IBM Cloud Object Storage のデータにPythonで接続する方法|CData Connect AI SDK

Jerod Johnson
Jerod Johnson
Director, Technology Evangelism
PythonのDB-API 2.0準拠コードでリアルタイムのIBM Cloud Object Storage のデータを読み取る方法を解説。CData Connect AI Python SDKとPAT認証で、pip install1つから10分で接続を実現します。

CData Connect AI Python SDK を使うと、標準的なDB-API 2.0のPythonコードでIBM Cloud Object Storage のデータをそのまま読み書きできます。プログラミング不要の他ツールと異なり、pandasやpetlなど既存のPythonエコシステムにそのまま組み込めます。パッケージのインストールからクエリ実行まで3ステップで完了します。

CData Connect AI Python SDK(cdata-connect-ai)は DB-API 2.0(PEP 249)に準拠したクライアントで、標準的な Python のデータベースコードでリアルタイムのIBM Cloud Object Storage のデータを取得・操作できます。接続まわりは Connect AI が引き受けてくれるので、パッケージを1つインストールしてパーソナルアクセストークンで認証するだけで、IBM Cloud Object Storage(および Connect AI に接続済みのその他すべてのソース)にクエリを実行できます。しかも sqlite3psycopg2 といったライブラリでおなじみの connect() / cursor() / fetchall() という同じパターンをそのまま使えます。

この記事では、Connect AI で IBM Cloud Object Storage に接続し、パーソナルアクセストークンを生成して SDK をインストールし、リアルタイムのIBM Cloud Object Storage のデータを読み取る(対応している場合は書き込む)までの流れをご紹介します。

事前準備

  • CData Connect AI のアカウント
  • Python 3.8 以降
  • 有効な認証情報を持つアクティブな IBM Cloud Object Storage アカウント

Connect AI で IBM Cloud Object Storage に接続する方法は?

CData Connect AI では、直感的なクリック操作ベースのインターフェースでデータソースに接続できます。

  1. Connect AI にログインし、Sources をクリックして、 Add Connection をクリックします
  2. 接続の追加
  3. 「Add Connection」パネルから「IBM Cloud Object Storage」を選択します
  4. データソースの選択
  5. IBM Cloud Object Storage に接続するために必要な認証プロパティを入力します。

    Cloud Object Storage 接続プロパティの取得・設定方法

    Cloud Object Storage に接続する前に、Cloud Object Storage インスタンスを登録してCloud Object Storage API キーとCRN を取得していきます。

    Cloud Object Storage の新規インスタンスの登録

    IBM Cloud アカウントにCloud Object Storage がまだない場合は、以下の手順に従ってアカウントにSQL Query のインスタンスをインストールできます。

    1. IBM Cloud アカウントにログインします。
    2. Cloud Object Storage ページに移動して、インスタンス名を指定して「作成」をクリックします。Cloud Object Storage の新規インスタンスにリダイレクトされます。

    API キー

    API キーは以下の手順で取得できます。

    1. まずは、IBM Cloud アカウントにログインします。
    2. API キーページに移動します。
    3. 中央右隅のIBM Cloud APIキーの作成 をクリックして、新しいAPI キーを作成します。
    4. ポップアップウィンドウが表示されたら、API キーの名前を指定して作成をクリックします。ダッシュボードからはアクセスできなくなるため、API Key を控えておきましょう。

    Cloud Object Storage CRN

    デフォルトでは、CData 製品はCloud Object Storage CRN を自動で取得します。ただし、複数のアカウントがある場合は、CloudObjectStorageCRN を明示的に指定する必要があります。この値は、次の2つの方法で取得できます。

    • Services ビューをクエリする。これにより、IBM Cloud Object Storage インスタンスとそれぞれのCRN がリストされます。
    • IBM Cloud で直接CRN を見つける。これを行うには、IBM Cloud のダッシュボードに移動します。リソースリストで、ストレージからCloud Object Storage リソースを選択してCRN を取得します。

    IBM Cloud Object Storage への接続

    これで準備は完了です。以下の接続プロパティを設定してください。

    • InitiateOAuthGETANDREFRESH に設定。InitiateOAuth を使うと、OAuth 認証を繰り返す必要がなく、さらに自動でアクセストークンを設定できます。
    • ApiKey:セットアップ中に控えたAPI キーを指定。
    • CloudObjectStorageCRN(オプション):控えておいたCloud Object Storage のCRN に設定。Cloud Object Storage アカウントが複数ある場合のみ設定する必要があります。

    プロパティを設定したら、これで接続設定は完了です。

    接続の設定(Salesforce の例)
  6. 「Save & Test」をクリックします
  7. 「Permissions」タブに移動し、ユーザーベースの権限を更新します。 権限の更新

パーソナルアクセストークン(PAT)を生成する

Python SDK は、アカウントのメールアドレスとパーソナルアクセストークン(PAT)を使って Connect AI に認証します。アクセスの粒度を保つために、アプリケーションごとに個別の PAT を作成することをおすすめします。

  1. Connect AI アプリの右上にある歯車アイコン()をクリックして、設定ページを開きます。
  2. 設定ページの Access Tokens セクションに移動し、 Create PAT をクリックします。
  3. PAT に名前を付けて Create をクリックします。 新しい PAT の作成
  4. パーソナルアクセストークンは作成時にのみ表示されます。必ずコピーして安全な場所に保管してください。

SDK をインストールする

pip を使って PyPI から SDK をインストールします。

pip install cdata-connect-ai

接続して最初のクエリを実行する

アカウントのメールアドレスと PAT で接続したら、sys_tables にクエリを実行して、接続済みのソース全体で利用可能なテーブルを確認してみましょう。Connect AI の識別子は <Connection>.<Schema>.<Table> という3つの部分で構成されており、接続名はデフォルトでソース名(例:IBMCloudObjectStorage1)になります。

import cdata_connect_ai

conn = cdata_connect_ai.connect(
    username="[email protected]",
    password="<your_pat>",
)
cur = conn.cursor()

# Discover what's available across your connected sources
cur.execute("SELECT CatalogName, SchemaName, TableName FROM sys_tables LIMIT 25")

for row in cur.fetchall():
    print(row)

結果から任意のテーブルを選び、直接クエリを実行してみましょう。

cur.execute(
    "SELECT Key, Etag "
    "FROM [IBMCloudObjectStorage1].[IBMCloudObjectStorage].[Objects] "
    "LIMIT 10"
)

for row in cur.fetchall():
    print(row)

IBM Cloud Object Storage は Connect AI では読み取り専用のソースのため、SDK はクエリには対応していますが、INSERTUPDATEDELETE には対応していません。作業が終わったら接続を閉じましょう。

conn.close()

これがワークフローのすべてです。パッケージが1つ、PAT、そして標準的な DB-API 呼び出しだけ。SDK は通常の DB-API 接続を返すので、Python のデータエコシステムのほかのツールにもそのまま組み込めます。ここから先は、この同じ接続を使って、IBM Cloud Object Storage のデータを pandas に読み込んだり、petl で ETL パイプラインを構築したり、Dash の Web アプリを動かしたりできます。

関連情報と無料トライアル

これで、CData Connect AI Python SDK を通じて Python からリアルタイムのIBM Cloud Object Storage のデータをクエリできるようになりました。IBM Cloud Object Storage(および数百種類のその他のデータソース)への接続について詳しくは、Connect AI のページをご覧ください。

CData Connect AI の詳細、または無料トライアルにお申し込みください:

無料トライアル お問い合わせ

はじめる準備はできましたか?

CData Connect AI の詳細、または無料トライアルにお申し込みください:

無料トライアル