Azure Data Lake Storage のデータをPythonのpandasで可視化する方法|CData Connect AI
CData Connect AI Python SDKをpandasとMatplotlibに接続すると、パーソナルアクセストークンで認証するだけでリアルタイムのAzure Data Lake Storage のデータをDataFrameに読み込み、そのままグラフとして可視化できます。SQLAlchemyエンジンの設定やソースごとのドライバーインストールは不要です。
Python は豊富なモジュールのエコシステムを備えているため、素早く作業に取りかかり、システムをより効果的に連携できます。CData Connect AI Python SDK と pandas、Matplotlib のモジュールを使えば、Azure Data Lake Storage のデータを可視化する Azure Data Lake Storage 連携の Python アプリケーションやスクリプトを構築できます。この記事では、Connect AI に接続し、pandas と Matplotlib の組み込み関数を使ってAzure Data Lake Storage のデータをクエリし、その結果を可視化する方法をご紹介します。
Connect AI Python SDK(cdata-connect-ai)は DB-API 2.0(PEP 249)に準拠したクライアントなので、pandas は SDK の接続オブジェクトから直接クエリ結果を読み取れます。ソースごとにドライバーをインストールする必要も、SQLAlchemy のエンジンを設定する必要もありません。パーソナルアクセストークンで接続して、その接続をそのまま pandas.read_sql に渡すだけです。
Connect AI で Azure Data Lake Storage に接続する方法は?
CData Connect AI では、直感的なクリック操作ベースのインターフェースでデータソースに接続できます。
- Connect AI にログインし、Sources をクリックして、 Add Connection をクリックします
- 「Add Connection」パネルから「Azure Data Lake Storage」を選択します
-
Azure Data Lake Storage に接続するために必要な認証プロパティを入力します。
Azure Data Lake Storage 接続プロパティの取得・設定方法
Azure Data Lake Storage Gen2 への接続
それでは、Gen2 Data Lake Storage アカウントに接続していきましょう。接続するには、以下のプロパティを設定します。
- Account:ストレージアカウントの名前
- FileSystem:このアカウントに使用されるファイルシステム名。例えば、Azure Blob コンテナの名前
- Directory(オプション):レプリケートされたファイルが保存される場所へのパス。パスが指定されない場合、ファイルはルートディレクトリに保存されます
Azure Data Lake Storage Gen2への認証
続いて、認証方法を設定しましょう。CData 製品では、5つの認証方法をサポートしています:アクセスキー(AccessKey)の使用、共有アクセス署名(SAS)の使用、Azure Active Directory OAuth(AzureAD)経由、Azure サービスプリンシパル(AzureServicePrincipal またはAzureServicePrincipalCert)経由、およびManaged Service Identity(AzureMSI)経由です。
アクセスキー
アクセスキーを使用して接続するには、まずADLS Gen2ストレージアカウントで利用可能なアクセスキーを取得する必要があります。
Azure ポータルでの手順は以下のとおりです:
- ADLS Gen2ストレージアカウントにアクセスします
- 設定でアクセスキーを選択します
- 利用可能なアクセスキーの1つの値をAccessKey 接続プロパティにコピーします
接続の準備ができたら、以下のプロパティを設定してください。
- AuthScheme:AccessKey
- AccessKey:先ほどAzure ポータルで取得したアクセスキーの値
共有アクセス署名(SAS)
共有アクセス署名を使用して接続するには、まずAzure Storage Explorer ツールを使用して署名を生成する必要があります。
接続の準備ができたら、以下のプロパティを設定してください。
- AuthScheme:SAS
- SharedAccessSignature:先ほど生成した共有アクセス署名の値
その他の認証方法については、 ヘルプドキュメントの「Azure Data Lake Storage Gen2への認証」セクションをご確認ください。
- 「Save & Test」をクリックします
- 「Permissions」タブに移動し、ユーザーベースの権限を更新します。

パーソナルアクセストークン(PAT)を生成する
Python SDK は、アカウントのメールアドレスとパーソナルアクセストークン(PAT)を使って Connect AI に認証します。アクセスの粒度を保つために、アプリケーションごとに個別の PAT を作成することをおすすめします。
- Connect AI アプリの右上にある歯車アイコン()をクリックして、設定ページを開きます。
- 設定ページの Access Tokens セクションに移動し、 Create PAT をクリックします。
- PAT に名前を付けて Create をクリックします。

- パーソナルアクセストークンは作成時にのみ表示されます。必ずコピーして安全な場所に保管してください。
必要なモジュールをインストールする
pip ユーティリティを使って、SDK(pandas エクストラ付き)と Matplotlib をインストールします。
pip install "cdata-connect-ai[full]" pip install matplotlib
Python で Azure Data Lake Storage のデータを可視化する
モジュールをインポートし、アカウントのメールアドレスと PAT で Connect AI に接続します。識別子は <Connection>.<Schema>.<Table> という3つの部分で構成されており、接続名はデフォルトでソース名(例:ADLS1)になります。
import pandas
import matplotlib.pyplot as plt
import cdata_connect_ai
conn = cdata_connect_ai.connect(
username="[email protected]",
password="<your_pat>",
)
pandas で Azure Data Lake Storage をクエリする
pandas の read_sql 関数を使って SQL ステートメントを実行し、結果セットを DataFrame に格納します。エンジンは不要で、SDK の接続をそのまま渡すだけです。
df = pandas.read_sql(
"SELECT FullPath, Permission "
"FROM [ADLS1].[ADLS].[Resources] "
"WHERE Type = 'FILE'",
conn,
)
注意:pandas が、公式にサポートしているのは SQLAlchemy の接続のみであるという UserWarning を出力する場合があります。これは DB-API 接続を直接渡したときに想定される動作です。クエリは正しく実行されるため、この警告は無視して問題ありません。
Azure Data Lake Storage のデータを可視化する
クエリ結果を DataFrame に格納したら、plot 関数を使ってチャートを作成します。show メソッドを使うと、チャートが新しいウィンドウに表示されます。
df.plot(kind="bar", x="FullPath", y="Permission") plt.show() conn.close()
関連情報と無料トライアル
これで、CData Connect AI Python SDK を通じて、リアルタイムのAzure Data Lake Storage のデータを pandas に読み込めるようになりました。Azure Data Lake Storage(および数百種類のその他のデータソース)への接続について詳しくは、Connect AI のページをご覧ください。
CData Connect AI の詳細、または無料トライアルにお申し込みください:
完全なソースコード
import pandas
import matplotlib.pyplot as plt
import cdata_connect_ai
conn = cdata_connect_ai.connect(
username="[email protected]",
password="<your_pat>",
)
df = pandas.read_sql(
"SELECT FullPath, Permission "
"FROM [ADLS1].[ADLS].[Resources] "
"WHERE Type = 'FILE'",
conn,
)
df.plot(kind="bar", x="FullPath", y="Permission")
plt.show()
conn.close()