Python でGoogle Translate のデータを変換・出力するETL 処理を作る方法
Pythonエコシステムには多くのモジュールがあり、システム構築を素早く効率的に行うことができます。本記事では、CData Python Connector for API とpetl フレームワークを使って、Google Translate のデータにPython から接続してデータを変換、CSV に出力するETL 変換を実装してみます。
CData Python Connector は効率的なデータ処理によりGoogle Translate のデータ にPython から接続し、高いパフォーマンスを発揮します。Google Translate にデータをクエリする際、ドライバーはフィルタリング、集計などがサポートされている場合SQL 処理を直接Google Translate 側に行わせ、サポートされていないSQL 処理については、組み込みのSQL エンジンによりクライアント側で処理を行います(JOIN やSQL 関数など)。
必要なモジュールのインストール
pip で必要なモジュールおよびフレームワークをインストールします:
pip install petl pip install pandas
Python でGoogle Translate のデータをETL 処理するアプリを構築
モジュールとフレームワークをインストールしたら、ETL アプリケーションを組んでいきます。コードのスニペットは以下の通りです。フルコードは記事の末尾に付いています。
CData Connector を含むモジュールをインポートします。
import petl as etl import pandas as pd import cdata.api as mod
接続文字列で接続を確立します。connect 関数を使って、CData Google Translate Connector からGoogle Translate への接続を行います
cnxn = mod.connect("Profile=C:\profiles\GoogleTranslate.apip;AuthScheme=OAuth;InitiateOAuth=GETANDREFRESH;OAuthClientId=your_client_id;OAuthClientSecret=your_client_secret;CallbackUrl=your_callback_url;")
認証
Google Cloud Translation API では、翻訳サービス、データセット、用語集、適応型 MT リソースへの安全なアクセスを確保するために、OAuth 2.0 認証が必要です。この認証方式により、Google Cloud プロジェクトに安全に接続し、適切な認可のもとで翻訳リソースを管理できます。
OAuth 2.0 のセットアップと設定
ステップ 1:Google Cloud プロジェクトの作成と API の有効化
OAuth 認証をセットアップするには、以下のステップで進めます:
- Google Cloud Console にアクセスします
- 新しいプロジェクトを作成するか、既存のプロジェクトを選択します
- Project ID を控えておきます(すべての API 呼び出しで必要です)
- 「APIs & Services」 > 「Library」に移動します
- 「Cloud Translation API」を検索して有効化します
- 「APIs & Services」 > 「Credentials」に移動します
- 「Create Credentials」をクリックし、「OAuth Client ID」を選択します
- プロンプトが表示されたら OAuth 同意画面を設定します
- 用途に応じて「Desktop application」または「Web application」を選択します
- 承認済みリダイレクト URI(CallbackURL)を設定します
- 接続で使用する Client ID と Client Secret をコピーします
必須の接続プロパティ
- AuthScheme:OAuth に設定します(必須)
- OAuthClientId:Google Cloud Console の Client ID(必須)
- OAuthClientSecret:Google Cloud Console の Client Secret(必須)
- CallbackURL:OAuth アプリケーションで指定したリダイレクト URI(必須)
- InitiateOAuth:トークンを自動管理するには GETANDREFRESH に設定します(推奨)
- ProjectId:Google Cloud のプロジェクト ID またはプロジェクト番号(クエリに必須)
必須の OAuth スコープ
Google Cloud Translation API プロファイルでは、以下の OAuth スコープが必要です:
- https://www.googleapis.com/auth/cloud-translation - 翻訳、データセット、用語集、適応型 MT を含む Cloud Translation API リソースへのフルアクセス
Google Translate をクエリするSQL 文の作成
Google Translate にはSQL でデータアクセスが可能です。SupportedLanguages エンティティからのデータを読み出します。
sql = "SELECT LanguageCode, DisplayName FROM SupportedLanguages WHERE ProjectId = 'my-project-12345'"
Google Translate データのETL 処理
DataFrame に格納されたクエリ結果を使って、petl でETL(抽出・変換・ロード)パイプラインを組みます。この例では、Google Translate のデータ を取得して、DisplayName カラムでデータをソートして、CSV ファイルにデータをロードします。
table1 = etl.fromdb(cnxn,sql) table2 = etl.sort(table1,'DisplayName') etl.tocsv(table2,'supportedlanguages_data.csv')
CData Python Connector for API を使えば、データベースを扱う場合と同感覚で、Google Translate のデータ を扱うことができ、petl のようなETL パッケージから直接データにアクセスが可能になります。
おわりに
Google Translate Python Connector の30日の無償トライアル をぜひダウンロードして、Google Translate のデータ への接続をPython アプリやスクリプトから簡単に作成しましょう。
フルソースコード
import petl as etl
import pandas as pd
import cdata.api as mod
cnxn = mod.connect("Profile=C:\profiles\GoogleTranslate.apip;AuthScheme=OAuth;InitiateOAuth=GETANDREFRESH;OAuthClientId=your_client_id;OAuthClientSecret=your_client_secret;CallbackUrl=your_callback_url;")
sql = "SELECT LanguageCode, DisplayName FROM SupportedLanguages WHERE ProjectId = 'my-project-12345'"
table1 = etl.fromdb(cnxn,sql)
table2 = etl.sort(table1,'DisplayName')
etl.tocsv(table2,'supportedlanguages_data.csv')