CData Connect AI 経由で Goose とリアルタイム Spark データを連携
Goose は、お使いのマシン上でローカルに動作するオープンソースの AI エージェントで、幅広い LLM プロバイダーに対応しています。拡張機能(Extensions)のフレームワークを通じて Model Context Protocol(MCP)をサポートしているため、外部ツールやデータソースを追加して、モデルの学習データを超えたリアルタイムのシステムにエージェントからアクセスできます。
Goose を組み込みの MCP Server 経由で CData Connect AI と連携すると、Goose はガバナンスの効いたリアルタイムのSpark のデータへのアクセスが可能になります。自然言語のプロンプトでSpark のデータのカタログ一覧表示、スキーマ探索、レコードのクエリが行え、すべてのデータアクセスは認可されたソースに対してセキュアに実行されます。
この記事では、Connect AI での Spark 接続設定、必要な Personal Access Token の生成、Goose のインストールとセットアップ、Connect AI MCP Server をカスタム拡張機能として追加する手順、そして Goose のチャットからリアルタイムSpark のデータをクエリして連携を確認する方法をご紹介します。
ステップ 1:Goose 用に Spark への接続を設定
Goose から Spark への接続は、Connect AI の Remote MCP Server を通じて実現されます。Goose からSpark のデータを操作するために、まず Connect AI で Spark のコネクションを作成・設定していきましょう。
- Connect AI にログインし、Sources をクリック、次に Add Connection をクリック
- Add Connection パネルから Spark を選択
-
Spark に接続するために必要な認証プロパティを入力します。
SparkSQL への接続
SparkSQL への接続を確立するには以下を指定します。
- Server:SparkSQL をホストするサーバーのホスト名またはIP アドレスに設定。
- Port:SparkSQL インスタンスへの接続用のポートに設定。
- TransportMode:SparkSQL サーバーとの通信に使用するトランスポートモード。有効な入力値は、BINARY およびHTTP です。デフォルトではBINARY が選択されます。
- AuthScheme:使用される認証スキーム。有効な入力値はPLAIN、LDAP、NOSASL、およびKERBEROS です。デフォルトではPLAIN が選択されます。
Databricks への接続
Databricks クラスターに接続するには、以下の説明に従ってプロパティを設定します。Note:必要な値は、「クラスター」に移動して目的のクラスターを選択し、 「Advanced Options」の下にある「JDBC/ODBC」タブを選択することで、Databricks インスタンスで見つけることができます。
- Server:Databricks クラスターのサーバーのホスト名に設定。
- Port:443
- TransportMode:HTTP
- HTTPPath:Databricks クラスターのHTTP パスに設定。
- UseSSL:True
- AuthScheme:PLAIN
- User:'token' に設定。
- Password:パーソナルアクセストークンに設定(値は、Databricks インスタンスの「ユーザー設定」ページに移動して「アクセストークン」タブを選択することで取得できます)。
- 「Save & Test」をクリック
- Permissions タブに移動し、ユーザーベースの権限を更新
Personal Access Token の追加
Personal Access Token(PAT)は、Goose から Connect AI への接続を認証するために使用します。アクセス制御の粒度を維持するために、連携ごとに個別の PAT を作成することをおすすめします。
- Connect AI アプリ右上の歯車アイコン()をクリックして Settings を開く
- Settings ページで Access Tokens セクションに移動し、 Create PAT をクリック
- PAT にわかりやすい名前を付けて Create をクリック
- 表示されたトークンをコピーして安全に保管してください。一度しか表示されません
Spark のコネクションと PAT の設定が完了しました。これで Goose は Connect AI 経由でSpark のデータに接続する準備が整いました。
ステップ 2:Goose をインストールしてセットアップ
次に Goose をインストールし、LLM プロバイダーを選択して、Connect AI Remote MCP Server をカスタム拡張機能として追加します。これで、エージェントが Connect AI 経由でリアルタイムデータのツールを検出・呼び出せるようになります。
- 公式のインストールガイドに従って Goose をダウンロード・インストールし、アプリケーションを起動します
-
Welcome to goose 画面で AI プロバイダーを選択します。ローカルモデルを使う場合は Use Free/Local Providers、OpenAI、Anthropic、Google などのプロバイダーを設定する場合は Connect to a Provider を選択し、必要な API キーを入力します
-
左ナビゲーションで Extensions をクリックし、+ Add custom extension をクリック
-
拡張機能のダイアログで、以下の値を設定します:
- Extension Name: CData MCP、または任意の名前
- Type: Streamable HTTP
- Endpoint: https://mcp.cloud.cdata.com/mcp
-
Request Headers で以下の 2 つのヘッダーを追加し、それぞれ入力後に + Add をクリックします:
- Authorization: Basic your_base64_encoded_email_PAT
- Content-Type: application/json
注意:Goose は Connect AI との通信に Basic 認証を使用します。Connect AI のユーザーメールアドレスと前の手順で作成した PAT を email:PAT の形式で組み合わせ、その文字列を Base64 エンコードして先頭に Basic を付けてください。例えば [email protected]:ABC123...XYZ789 の場合、Authorization ヘッダーの値は Basic dXNlckBkb21haW4uY29tOkFCQzEyMy4uLlhZWjc4OQ== のような値になります
- Save をクリックして設定を保存
-
チャットに戻り、チャット入力欄の下にある拡張機能アイコンをクリックして、設定した MCP が有効になっていることを確認します
MCP サーバーの追加と LLM プロバイダーの設定が完了したので、Goose は Connect AI 経由でリアルタイムSpark のデータをクエリできる状態になりました。
ステップ 3:Goose からリアルタイム Spark のデータ をクエリ
連携設定が完了したら、Goose のチャットから、設定した LLM が処理する自然言語プロンプトでリアルタイムSpark のデータを操作してみましょう。
-
CData MCP 拡張機能を有効にした状態で、チャットにプロンプトを入力します。例:
- CData MCP のカタログを一覧表示して
- Spark で利用可能なスキーマとテーブルを表示して
- Spark のデータ のテーブルから上位 5 件のレコードをクエリして
-
Goose が Connect AI MCP Server を呼び出し、Spark のデータのリアルタイム結果を返します
これで Goose エージェントが Connect AI MCP Server と通信し、チャットから直接 Remote MCP ツールを通じてリアルタイムSpark のデータを取得できるようになりました。
CData Connect AI でビジネスシステムのデータ活用を今すぐスタート
いかがでしたか?Goose から Spark へのデータ連携が思ったより手軽にできたのではないでしょうか。業務に使えそう、と感じてくださった方は、CData Connect AI をぜひお試しください。 14 日間の無償トライアルで、クラウドアプリケーションから数百種類の SaaS、ビッグデータ、NoSQL ソースへのリアルタイムアクセスを体験いただけます。ご不明点がございましたら、サポートチームまでお気軽にお問い合わせください。