ScrapingBee のデータを Teradata に自動でレプリケーションする方法

Cameron Leblanc
Senior Technology Evangelist

CData Sync を使って、ScrapingBee のデータを Teradata にカスタマイズ可能な自動レプリケーションを実現する方法を解説します。

常時稼働のアプリケーションには、自動フェイルオーバー機能とリアルタイムのデータアクセスが欠かせません。CData Sync を使えば、Teradata インスタンスにScrapingBee のデータをリアルタイムで統合できます。すべてのデータを1カ所に集約し、アーカイブ、レポーティング、分析、機械学習、AI などさまざまな用途に活用できます。

Teradata を同期先として設定する

CData Sync を使って、ScrapingBee のデータを Teradata にレプリケーションできます。同期先を追加するには、接続タブに移動します。

接続の追加をクリックします。
同期先タブを選択し、Teradata コネクタを探します。
該当行の末尾にある接続の設定アイコンをクリックして、新しい接続ページを開きます。接続の設定アイコンが表示されていない場合は、コネクタのダウンロードアイコンをクリックして Teradata コネクタをインストールします。新しいコネクタのインストールについて詳しくは、ヘルプドキュメントの「接続」セクションをご覧ください。
Teradata に接続するには、以下の接続プロパティを設定します：
- Connection Name：任意の接続名を入力します。
- Data Source：Teradata サーバー名、データベースコンピュータ（DBC）ユーザー名、または Teradata Director Program Id（TDPID）を入力します。
- User：Teradata アカウントで認証するためのユーザー名を入力します。
- Password：Teradata アカウントで認証するためのパスワードを入力します。
- Auth Scheme：認証スキームを選択します。Sync で利用可能な認証スキームは TD2 と LDAP です。TD2 がデフォルトのスキームです。
- Database：Teradata データベースの名前を入力します。
  Note：データベースを指定しない場合、CData Sync はデフォルトのデータベースに接続します。
- Port：Teradata サーバーのポート番号を入力します。デフォルトのポート値は 1025 です。

接続が確立されたら、作成およびテストをクリックして接続を作成、テスト、保存します。

これで Teradata に接続され、データソースとしても同期先としても使用できるようになりました。

NOTE：ラベル機能を使って、データソースや同期先にラベルを追加できます。

この記事では、ScrapingBee のデータを Teradata にロードし、同期先として活用する方法をご紹介します。

ScrapingBee への接続を設定する

ScrapingBee への接続は、接続タブから設定できます。ScrapingBee アカウントへの接続を追加するには、接続タブに移動します。

接続の追加をクリックします。
データソース（ScrapingBee）を選択します。
接続プロパティを設定します。

API キー認証の設定

ScrapingBee は API キー認証を使用します。API キーを取得するには、以下のステップで進めます：
1. https://app.scrapingbee.com で ScrapingBee アカウントにサインインします
2. Dashboard に移動して、上部のセクションで API キーを確認します。
3. 接続文字列で使用する API キーをコピーします。
API キーを取得したら、以下の接続プロパティを設定します：
- AuthScheme：APIKey に設定します。
ProfileSettings 接続プロパティには以下を設定します：
- APIKey：ScrapingBee の API キーに設定します。
接続文字列の例
```
Profile=C:\profiles\ScrapingBee.apip;AuthScheme=APIKey;ProfileSettings="APIKey=your_api_key";
```
ScrapingBee への接続

認証を設定すると、ScrapingBee に接続して、利用可能なテーブルからデータをクエリできます。すべてのテーブルでは、データを取得するために少なくとも 1 つの入力パラメータ（検索クエリや商品 ID など）が必要です。
ScrapingBee に接続をクリックして、接続が正しく設定されていることを確認します。
作成およびテストをクリックして変更を保存します。

レプリケーションクエリの設定

CData Sync では、ポイント＆クリック操作と SQL クエリの両方でレプリケーションを制御できます。レプリケーションを設定するには、ジョブタブに移動し、ジョブを追加をクリックします。レプリケーションのデータソースと同期先を選択します。

テーブル全体をレプリケーションする

テーブル全体をレプリケーションするには、ジョブのタスクタブでタスクを追加をクリックし、Teradata にレプリケーションしたい ScrapingBee テーブルをリストから選択して、再度タスクを追加をクリックします。

レプリケーションのカスタマイズ

タスクのカラムタブとクエリタブを使って、レプリケーションをカスタマイズできます。カラムタブでは、レプリケーションするカラムの指定、同期先でのカラム名の変更、レプリケーション前のデータ操作などが可能です。クエリタブでは、SQL クエリを使ってフィルタ、グループ化、ソートを追加できます。

レプリケーションのスケジュール

ジョブの概要タブを選択し、スケジュールの下にある設定をクリックします。10分ごとから月1回まで、指定した間隔でジョブを自動実行するようにスケジュールできます。

レプリケーションジョブを設定したら、変更を保存をクリックします。ScrapingBee のデータから Teradata へのレプリケーションを管理するジョブをいくつでも設定できます。

レプリケーションジョブの実行

ジョブに必要なすべての設定が完了したら、レプリケーションしたい ScrapingBee テーブルを選択し、実行をクリックします。レプリケーションが正常に完了すると、ジョブの実行時間とレプリケーションされた行数を示す通知が表示されます。

無料トライアル & 詳細情報

ScrapingBee のデータを Teradata にレプリケーションする方法をご覧いただきました。CData Sync ページで詳細をご確認いただき、30日間の無料トライアルをダウンロードして、エンタープライズデータの統合を始めましょう。

ご不明な点がございましたら、サポートチームがいつでもお手伝いいたします。

はじめる準備はできましたか？

詳細はこちら、または無料トライアルにお申し込みください：

CData Sync

CData は、AI を本番環境で機能させるデータレイヤーです。数百の主要エンタープライズソースへのライブコネクティビティとレプリケーション、セマンティックコンテキスト、組み込みガバナンスを提供。Databricks、Microsoft、Google、Palantir をはじめ、世界中の 10,000 以上のお客様の AI を支えています。

お問い合わせ

ScrapingBee のデータを Teradata に自動でレプリケーションする方法

Teradata を同期先として設定する

ScrapingBee への接続を設定する

API キー認証の設定

接続文字列の例

ScrapingBee への接続