CData Arc × Agent Searchで、散在するファイルを自社のナレッジへ

000

こんにちは。CData Software Japanの齋藤です。

データベースやSaaSのデータは、データ連携基盤を通じてAIや分析に活用しやすい一方、PDF、Word、Excelといったファイルは、ファイルサーバーやクラウドストレージに点在したまま、基盤外に置かれがちです。

実際、お客様から「社内のファイルサーバーにあるExcelやPDFもナレッジとして活用したい」というご相談をいただくことがあります。

そこで、本記事ではFTPサーバーとDropboxに散在するファイルをCData ArcでGoogle Cloud Storageに集約し、Agent Searchで質問できるRAG環境を構築する手順をご紹介します。

ゴール

ゴールとしては、CData Arcで各ファイルをGoogle Cloud Storageに集約し、Agent Searchによる自然言語でファイルの要約やエラー原因の調査を問い合わせられるようにします。

Agent Searchとは

Agent Searchは、Google Cloudが提供する生成AIアプリケーション構築のためのサービスです。BigQueryやGoogle Cloud Storageなどをデータソースに設定するだけで、検索・回答の環境を作成できます。

対象データとしては、ウェブサイト、構造化データ、非構造化データなどに対応しています。そのため、Google Cloud Storageと連携しドキュメントを取り込むだけで、自然言語で質問できる検索環境や、取り込んだ内容をもとに回答を生成するRAGを構築できます。

参考: エージェント検索  |  Agent Search  |  Google Cloud Documentation

構成

全体構成は次の通りです。

  • FTPサーバー:社内資料の格納場所

  • Dropbox:お客様との共有用のストレージ

  • CData Arc:FTPサーバーとDropboxにあるファイルを、Google Cloud Storageへ連携する

  • Google Cloud Storage:各ファイルを集約するストレージ

  • Agent Search:Google Cloud Storageのファイルを取り込んでRAG化

シナリオ

架空の業務用ラベルプリンタ(Exampleプリンター)を販売している企業を題材にします。社内資料はFTPサーバーに、お客様との共有資料はDropboxに置かれています。

置き場所

位置づけ

内容

FTPサーバー

社内管理 (部署ごとにフォルダ分け)

製品部:取扱説明書 (v1.0 / v2.0 / v3.2)、メンテナンスガイド

サポート部:障害対応報告書、問い合わせ履歴台帳

Dropbox

お客様との共有 (顧客名/年月日でフォルダ分け)

設置ガイド、ネットワーク設定仕様書、製品紹介資料、障害対応のご報告

詳細なディレクトリ構成は、次の通りです。

FTPサーバー

社内管理用で製品部、サポート部といった風に部署ごとにフォルダが分かれています。製品部の取扱説明書はPDFで、版ごとに管理されています。版によって記載内容が少しずつ異なります。サポート部では、問い合わせ履歴をExcelで、障害対応報告書をWordで管理しています。

社内資料

├─ 製品部/

│ ├─ 取扱説明書/

│ │ ├─ v1.0/ Exampleプリンター_取扱説明書.pdf

│ │ ├─ v2.0/ Exampleプリンター_取扱説明書.pdf

│ │ └─ v3.2/ Exampleプリンター_取扱説明書.pdf

│ └─ Exampleプリンター_メンテナンスガイド.docx

└─ サポート部/

├─ Exampleプリンター_問い合わせ履歴台帳.xlsx

└─ 障害対応報告書/

├─ RPT-2026-0128_E-42_寒冷地.docx

├─ RPT-2026-0219_E-55_DHCP.docx

├─ RPT-2026-0305_E-21_他社ラベル.docx

└─ RPT-2026-0412_E-42_冷蔵倉庫.docx

Dropbox

社外の共有用のストレージです。顧客名と年月日で、お客様ごとに渡した資料が整理されており、PowerPoint、PDF、Word形式のファイルが存在します。

顧客共有

├─ 東都フーズ流通/

│ ├─ 2024-04-25_ご提案/ Exampleプリンター_製品紹介資料.pptx

│ ├─ 2024-06-18_導入/ Exampleプリンター_設置ガイド_v1.0.pdf

│ └─ 2026-04-12_障害対応/ 障害対応のご報告.docx

├─ 北海道エクスプレス/

│ ├─ 2025-12-20_導入/ Exampleプリンター_設置ガイド_v2.0.pdf、Exampleプリンター_ネットワーク設定仕様書.docx

│ └─ 2026-01-28_障害対応/ 障害対応のご報告.docx

├─ 関西ロジスティクス/

│ ├─ 2026-01-10_導入/ Exampleプリンター_設置ガイド_v2.0.pdf

│ └─ 2026-03-05_障害対応/ 障害対応のご報告.docx

└─ 中部リテールサービス/

├─ 2026-01-22_導入/ Exampleプリンター_設置ガイド_v2.0.pdf、Exampleプリンター_ネットワーク設定仕様書.docx

└─ 2026-02-19_障害対応/ 障害対応のご報告.docx

セットアップ手順

Google Cloud Storageバケットの作成

はじめに、Google Cloud Storageに集約先となるバケットを作成します。(例: cdatajp_bucket)

CData Arcでフローを構築

CData Arcで今回作成するフローは、次の画像の通りです。

FTPコネクタの設定

FTPコネクタの設定画面では以下のようにFTPサーバーへの接続設定を指定します。キャッシングの「タイムスタンプ比較を有効化」も有効にしておきます。これにより、初回連携以降に前回連携時のファイルのタイムスタンプが比較され、同じだった場合は、連携がスキップされます。

設定項目

設定例

リモートホスト

社内管理FTPサーバーのホスト

リモートポート

社内管理FTPサーバーのポート番号

ユーザー名

社内管理FTPサーバーのログインユーザー名

パスワード

社内管理FTPサーバーのパスワード

リモートパス

社内資料があるフォルダ (/home/aitouto/社内資料)

ファイルマスク

* (全ファイルが取得対象)

キャッシング

タイムスタンプ比較を有効化

リモートサブディレクトリを再帰

有効

「高度な設定」の「リモートサブディレクトリを再帰」項目は、リモートパス配下のすべてのフォルダからファイルを取得したいときや、取得元と同じディレクトリ構造を維持したまま連携したい時に役に立つ設定です。

Dropboxコネクタの設定

次に、Dropboxコネクタです。設定項目は以下の通りです。

設定項目

設定例

リモートフォルダ

Dropboxの対象フォルダ名(顧客共有)

ファイルマスク

* (全ファイルが取得対象)

キャッシング

タイムスタンプ比較を有効化

リモートサブディレクトリを再帰

有効

DropboxコネクタもFTPコネクタ同様に「高度な設定」から「リモートサブディレクトリを再帰」を有効にします。

Google Cloud Storageコネクタの設定

最後に、Cloud Storageコネクタです。設定項目は以下の通りです。

設定項目

設定例

クライアントID

対象のストレージアカウントのクライアントID

クライアントシークレット

対象のストレージアカウントのクライアントシークレット

バケット名

cdatajp_bucket

リモートファイルを上書き

有効



フローの実行結果

各コネクタの設定が完了したら、フローを実行して各コネクタの結果とGoogle Cloud Storageへの転送を確認してみましょう。

FTPコネクタの受信結果です。計9個のファイルを受信しました。

Dropboxコネクタの受信結果です。計11個のファイルを受信しました。

Google Cloud Storageコネクタでは、FTPサーバーとDropboxから受信した計20個のファイルをすべて送信できました。

Google Cloud Storageのバケットを確認するとサポート部/障害対応報告書のようなディレクトリ階層が作成され、ファイルが転送されています。

Agent Searchを構築

Agent Searchでは、アプリのタイプを選んでデータストアを作成します。今回はPDFなどの非構造化ドキュメントを対象にするため、「Custom Search」を選択します。

参考: カスタム検索を使ってみる  |  Agent Search  |  Google Cloud Documentation

cdatajp_agentsearchという名前でアプリを作成していきます。

データストアは「Cloud Storage」を選択します。

データストアの設定項目は、次のように設定します。各設定項目の詳細は、以下のページからご確認いただけます。

参考: 検索データストアを作成する  |  Agent Search  |  Google Cloud Documentation

設定項目

設定例

Unstructured Data Import (Document Search & RAG)

Documents

Synchronization frequency

Periodic

Sync frequency

Every day

Folder

cdatajp_bucket

Periodic(定期同期)を選ぶと、約1時間後に初回の取り込みが自動で始まります。作成直後はドキュメントが0件ですが、進捗は、データストアのコネクタ名をクリックし、「Data Ingestion Activity」タブで確認できます。

参考: https://docs.cloud.google.com/generative-ai-app-builder/docs/create-data-store-es?hl=ja#storage-periodic-sync

その後、画面の案内に沿って設定を進めると、アプリの作成が完了します。それでは、作成したアプリの「Preview」ボタンを押して、質問してみましょう。

「東都フーズ流通に渡した製品紹介資料と設置ガイドの動作温度は?」

特定の顧客に渡した資料に関する質問です。

生成された回答から、東都フーズ流通向けの動作温度は資料によって数値が異なることがわかります。製品紹介資料であるPowerPointでは、動作環境の温度が「5℃~35℃」と言及され、設置ガイドでは「10℃~35℃」と回答されました。あわせて、他の顧客に渡している第2版の設置ガイドの内容にも言及しています。

「エラーE-42が出た。原因と対処方法と過去の対応履歴を教えて」

E-42について、原因・対処方法・過去の対応履歴が1つの回答にまとまりました。

  • 原因: 「結露による誤検知」と「低温による誤検知」の2パターンに整理されています。

  • 対処方法: 原因ごとに分かれています。結露の場合は、電源OFFのまま30分以上置いて乾燥させます。低温の場合は、始業前に室温を10℃以上にして、電源投入後に10分間ウォームアップします。

  • 過去の対応履歴: 北海道エクスプレス(2026年1月、低温が原因)と、東都フーズ流通(2026年4月、結露が原因)の2件が、報告書番号(RPT-2026-0128、RPT-2026-0412)付きで挙がっています。

障害対応報告書(Word)や問い合わせ履歴台帳(Excel)をまたいで、原因ごとの対処と実際の事例を1回の質問で確認できました。

まとめ

本記事では、FTPサーバーとDropboxに散在するファイルをCData ArcでGoogle Cloud Storageに集約し、Agent Searchで自然言語から質問できる環境を構築しました。従来であれば、ファイルを開いたり、文字列検索して調べることになりますが、ファイルを1か所に集約し、Agent SearchのようなRAGを構築すれば、形式も置き場所も異なるファイルを横断して、エラー原因の調査や顧客向け資料の確認を、1回の質問で行えるようになります。

PDFやWord、Excelといった非構造化データには、活用したいナレッジが含まれていますが、散在していたり、データ連携基盤の外に置かれていたりして、十分に活用できていないケースは少なくありません。社内でなかなか活用できていないファイルがある方は、ぜひCData Arcを使ったRAG構築をお試しください。また、CData Arcは30日間ご試用いただける無償トライアルをご用意しています。ぜひ、皆様の環境でお試しください。

CData Arc を使い始める

製品を試していただく中で何かご不明な点があれば、テクニカルサポートへお気軽にお問い合わせください。
CData - サポートフォーム


この記事では CData Arc™ 2025 - 26.3.9750.0 を利用しています。