XML のデータをPythonのpetlでETL処理する方法|CData Connect AI
CData Connect AI の Python SDK と petl フレームワークを使うと、XML のデータをローカルにドライバーをインストールすることなく、Pythonで直接抽出・変換・ロードするETLパイプラインを構築できます。パーソナルアクセストークンで接続し、数行のコードで設定完了です。
Python は豊富なモジュールのエコシステムを備えているため、素早く作業に取りかかり、システムをより効果的に連携できます。CData Connect AI Python SDK と petl フレームワークを使えば、XML のデータを抽出・変換して CSV などに出力する XML 連携のアプリケーションやパイプラインを構築できます。この記事では、Connect AI に接続し、petl を使ってXML のデータを抽出・変換し、CSV ファイルに書き出す方法をご紹介します。
Connect AI Python SDK(cdata-connect-ai)は DB-API 2.0(PEP 249)に準拠したクライアントなので、petl は etl.fromdb を使って SDK の接続から直接読み取れます。ソースごとにドライバーをインストールする必要はありません。パーソナルアクセストークンで接続して、パイプラインを構築しましょう。
Python + petl でできること
XML データの定期抽出パイプライン構築
SQL クエリで取得した XML のレコードを petl の etl.fromdb で抽出し、etl.sort などの変換処理をはさんでから CSV に書き出す、軽量な ETL パイプラインを構築できます。
複数データソースとの統合分析
DB-API 2.0 準拠のクライアントなので、同じコードパターンで XML 以外のデータソースにも接続でき、petl 上で結合・整形してから任意の出力先にロードできます。
XML への書き戻し処理の自動化
書き込みに対応した権限を持つ PAT で接続していれば、cursor.executemany を使ったバッチ INSERT により、変換済みデータを XML に自動で書き戻す処理を組み込めます。
Connect AI で XML に接続する方法は?
CData Connect AI では、直感的なクリック操作ベースのインターフェースでデータソースに接続できます。
- Connect AI にログインし、Sources をクリックして、 Add Connection をクリックします
- 「Add Connection」パネルから「XML」を選択します
-
XML に接続するために必要な認証プロパティを入力します。
データソースを認証するには、データプロバイダーのドキュメント内の「はじめに」セクションをご覧ください。 データプロバイダーはXML API を双方向データベーステーブルとしてモデル化し、XML ファイルをread-only ビュー(ローカルファイル、人気のクラウドサービスに格納されたファイル、およびFTP サーバー)としてモデル化します。 HTTP Basic、Digest、NTLM、OAuth、およびFTP を含む主な認証スキームはサポートされています。認証のガイドについては、データプロバイダーのドキュメント内の「はじめに」セクションをご覧ください。
URI と認証値を設定した後で、DataModel を設定することでデータの構造によりよくマッチするようデータの抽象化を調整できます。
DataModel プロパティはデータがどのようにテーブルとして抽象化されるかを制御するプロパティであり、次の基本的な設定を調整します。
- Document(デフォルト):XML データのトップレベルのドキュメントビューをモデル化します。データプロバイダーは入れ子化した要素をデータの集約値として返します。
- FlattenedDocuments:入れ子化したドキュメントとその親を結合して単一のテーブルに入力します。
- Relational:個別の関連テーブルを階層化されたデータから返します。テーブルは主キーと、親ドキュメントにリンクする外部キーを含みます。
リレーショナルな抽象化の設定についての詳細は、「XML データのモデリング」セクションを参照してください。次の例で使用されているサンプルデータも存在します。 このデータには、人名、その人たちが所有する車、車に施されたさまざまなメンテナンスに関する情報が含まれます。
- 「Save & Test」をクリックします
- 「Permissions」タブに移動し、ユーザーベースの権限を更新します。

パーソナルアクセストークン(PAT)を生成する
Python SDK は、アカウントのメールアドレスとパーソナルアクセストークン(PAT)を使って Connect AI に認証します。アクセスの粒度を保つために、アプリケーションごとに個別の PAT を作成することをおすすめします。
- Connect AI アプリの右上にある歯車アイコン()をクリックして、設定ページを開きます。
- 設定ページの Access Tokens セクションに移動し、 Create PAT をクリックします。
- PAT に名前を付けて Create をクリックします。

- パーソナルアクセストークンは作成時にのみ表示されます。必ずコピーして安全な場所に保管してください。
必要なモジュールをインストールする方法は?
pip ユーティリティを使って、SDK と petl フレームワークをインストールします。
pip install cdata-connect-ai pip install petl
Python で XML のデータの ETL アプリを構築する方法は?
必要なモジュールをインストールしたら、ETL アプリを構築する準備は完了です。以下にコードスニペットを紹介しますが、完全なソースコードは記事の末尾に掲載しています。
まずモジュールをインポートし、アカウントのメールアドレスと PAT で Connect AI に接続します。
import petl as etl
import cdata_connect_ai
conn = cdata_connect_ai.connect(
username="[email protected]",
password="<your_pat>",
)
XML をクエリする SQL ステートメントを作成する方法は?
SQL を使って、XML をクエリするステートメントを作成します。この記事では、people エンティティからデータを読み取ります。識別子は <Connection>.<Schema>.<Table> という3つの部分で構成されており、接続名はデフォルトでソース名(例:XML1)になります。
sql = (
"SELECT [ personal.name.first ], [ personal.name.last ] "
"FROM [XML1].[XML].[people] "
"WHERE [ personal.name.last ] = 'Roberts'"
)
XML のデータの抽出・変換・ロードを実装する方法は?
接続とクエリが準備できたら、petl を使ってXML のデータを抽出・変換・ロードします。この例では、XML のデータを抽出し、[ personal.name.last ] カラムでデータを並べ替えて、CSV ファイルにロードします。
table1 = etl.fromdb(conn, sql) table2 = etl.sort(table1, '[ personal.name.last ]') etl.tocsv(table2, 'people_data.csv')
新しい行を XML に書き戻す方法は?
XML が書き込みに対応している場合は、バッチ INSERT で行を書き戻せます。SDK の executemany は、@name のプレースホルダーと、1行につき1つのパラメータ辞書のリストを受け取ります。
cur = conn.cursor()
cur.executemany(
"INSERT INTO [XML1].[XML].[people] ([ personal.name.first ], [ personal.name.last ]) "
"VALUES (@val1, @val2)",
[
{"@val1": "New value 1", "@val2": "New value 1"},
{"@val1": "New value 2", "@val2": "New value 2"},
],
)
print(f"Rows inserted: {cur.rowcount}")
conn.close()
注意:書き込み可能なソースであっても、読み取り専用の PAT や接続権限では書き込み操作は拒否されます。
CData Connect AI Python SDK を使えば、petl のような ETL パッケージでのデータへの直接アクセスも含め、通常のデータベースと同じようにXML のデータを扱えます。
関連情報と無料トライアル
これで、CData Connect AI Python SDK を使って、petl でリアルタイムのXML のデータをパイプライン処理できるようになりました。XML(および数百種類のその他のデータソース)への接続について詳しくは、Connect AI のページをご覧ください。
CData Connect AI の詳細、または無料トライアルにお申し込みください:
完全なソースコード
import petl as etl
import cdata_connect_ai
conn = cdata_connect_ai.connect(
username="[email protected]",
password="<your_pat>",
)
sql = (
"SELECT [ personal.name.first ], [ personal.name.last ] "
"FROM [XML1].[XML].[people] "
"WHERE [ personal.name.last ] = 'Roberts'"
)
table1 = etl.fromdb(conn, sql)
table2 = etl.sort(table1, '[ personal.name.last ]')
etl.tocsv(table2, 'people_data.csv')
cur = conn.cursor()
cur.executemany(
"INSERT INTO [XML1].[XML].[people] ([ personal.name.first ], [ personal.name.last ]) "
"VALUES (@val1, @val2)",
[
{"@val1": "New value 1", "@val2": "New value 1"},
{"@val1": "New value 2", "@val2": "New value 2"},
],
)
print(f"Rows inserted: {cur.rowcount}")
conn.close()