Amazon SageMaker Canvas から RDS 経由で Amazon Athena のリアルタイムデータを活用

Dibyendu Datta
Dibyendu Datta
Lead Technology Evangelist
CData Connect AI を使って Amazon SageMaker Canvas の Amazon RDS コネクタから Amazon Athena に接続し、リアルタイムのAmazon Athena のデータでカスタムモデルを構築する方法を解説します。

Amazon SageMaker Canvas は、コードを書かずに予測の生成、データの準備、モデルの構築ができるノーコード機械学習プラットフォームです。CData Connect AI と組み合わせることで、クラウド間でリアルタイムにAmazon Athena のデータにアクセスし、カスタム機械学習モデルの構築、顧客離反予測、テキスト生成、チャットボット開発など、さまざまな用途に活用できます。この記事では、RDS コネクタを使用して Amazon SageMaker Canvas から Connect AI に接続し、Amazon Athena のデータを ML モデルのデプロイメントに統合する方法をご紹介します。

CData Connect AI は、Amazon Athena 向けに純粋な SQL インターフェースをクラウド間で提供します。これにより、データをレプリケーションすることなく、Amazon SageMaker Canvas からAmazon Athena のデータに簡単に接続できます。Connect AI は Amazon SageMaker Canvas からは SQL Server データベースとまったく同じように見え、フィルタや JOIN などの SQL 操作をAmazon Athenaに直接プッシュする最適化されたデータ処理により、サーバーサイド処理を活用してAmazon Athena のデータをすばやく取得します。

Amazon Athena データ連携について

CData は、Amazon Athena のライブデータにアクセスし、統合するための最も簡単な方法を提供します。お客様は CData の接続機能を以下の目的で使用しています:

  • IAM 認証情報、アクセスキー、インスタンスプロファイルなど、さまざまな方法で安全に認証できます。多様なセキュリティニーズに対応し、認証プロセスを簡素化します。
  • 詳細なエラーメッセージにより、セットアップを効率化し、問題を迅速に解決できます。
  • サーバーサイドでのクエリ実行により、パフォーマンスを向上させ、クライアントリソースへの負荷を最小限に抑えます。

ユーザーは、Tableau、Power BI、Excel などの分析ツールと Athena を統合し、お気に入りのツールから詳細な分析を行うことができます。

CData を使用した Amazon Athena のユニークなユースケースについては、ブログ記事をご覧ください:https://jp.cdata.com/blog/amazon-athena-use-cases


はじめに


Amazon Athena への接続を設定(Amazon SageMaker Canvas 向け)

Amazon SageMaker Canvas から Amazon Athena への接続は、CData Connect AI を介して行います。それでは、Amazon Athena のデータを Amazon SageMaker Canvas から利用できるようにするため、Amazon Athena への接続を作成していきましょう。

  1. Connect AI にログインして「Sources」をクリック、次に「 Add Connection」をクリック
  2. 接続を追加パネルから「Amazon Athena」を選択
  3. Amazon Athena に接続するために必要な認証プロパティを入力します。

    Amazon Athena 接続プロパティの取得・設定方法

    それでは、早速Athena に接続していきましょう。

    データに接続するには、以下の接続パラメータを指定します。

    • DataSource:接続するAmazon Athena データソース。
    • Database:接続するAmazon Athena データベース。
    • AWSRegion:Amazon Athena データがホストされているリージョン。
    • S3StagingDirectory:クエリの結果を保存するS3 フォルダ。

    Database またはDataSource が設定されていない場合、CData 製品はAmazon Athena の利用可能なデータソースからすべてのデータベースのリスト化を試みます。そのため、両方のプロパティを設定することでCData 製品のパフォーマンスが向上します。

    Amazon Athena の認証設定

    CData 製品は幅広い認証オプションに対応しています。詳しくはヘルプドキュメントの「はじめに」を参照してみてください。

    AWS キーを取得

    IAM ユーザーの認証情報を取得するには、以下のステップお試しください。

    1. IAM コンソールにサインインします。
    2. ナビゲーションペインでユーザーを選択します。
    3. ユーザーのアクセスキーを作成または管理するには、ユーザーを選択してからセキュリティ認証情報タブに移動します。

    AWS ルートアカウントの資格情報を取得するには、以下のステップをお試しください。

    1. ルートアカウントの認証情報を使用してAWS 管理コンソールにサインインします。
    2. アカウント名または番号を選択します。
    3. 表示されたメニューでMy Security Credentials を選択します。
    4. ルートアカウントのアクセスキーを管理または作成するには、Continue to Security Credentials をクリックし、[Access Keys]セクションを展開します。

    その他の認証オプションについては、ヘルプドキュメントの「Amazon Athena への認証」を参照してください。

  4. 「Save & Test」をクリック
  5. Amazon Athena 接続の追加ページで「Permissions」タブに移動し、ユーザーベースの権限を更新します。

パーソナルアクセストークンを追加

REST API、OData API、または仮想 SQL Server を通じて Connect AI に接続する場合は、パーソナルアクセストークン(PAT)を使用して認証を行います。アクセス管理を細かく制御するため、サービスごとに個別の PAT を作成することをお勧めします。

  1. Connect AI アプリの右上にある歯車アイコン()をクリックして設定ページを開きます。
  2. 設定ページで「Access Tokens」セクションに移動し、「 Create PAT」をクリックします。
  3. PAT に名前を付けて「Create」をクリックします。
  4. パーソナルアクセストークンは作成時にのみ表示されます。必ずコピーして、今後の利用のために安全に保管してください。

接続の設定と PAT の生成が完了したら、Amazon SageMaker Canvas からAmazon Athena のデータに接続する準備は完了です。

Amazon SageMaker Canvas から CData Connect AI に接続

CData Connect AI での接続設定が完了したら、RDS コネクタを使用してAmazon Athena のデータを Amazon SageMaker Canvas に統合していきましょう。

  1. Amazon SageMaker Canvas でドメインとユーザープロファイルを選択し、「Open Canvas」をクリックします。
  2. Canvas アプリケーションが開いたら、左側のパネルに移動して「My models」を選択します。
  3. My models 画面で「Create new model」をクリックします。
  4. Create new model ウィンドウでモデル名を入力し、Problem type を選択します。「Create」をクリックします。
  5. モデルバージョンが作成されたら、Select dataset タブで「Create dataset」をクリックします。
  6. Create a tabular dataset ウィンドウで「Dataset name」を入力し、「Create」をクリックします。
  7. 「Data Source」ドロップダウンをクリックして RDS コネクタを検索またはナビゲートし、「 Add Connection」をクリックします。
  8. Add a new RDS connection ウィンドウで、以下のプロパティを設定します。

    • Connection Name: 任意の接続名
    • Engine type を sqlserver-web に設定
    • Port を 14333 に設定
    • Addresstds.cdata.com に設定
    • Username を Connect AI ユーザー(例: [email protected])に設定
    • Password を上記ユーザーの PAT に設定
    • Database name を Amazon Athena 接続名(例: AmazonAthena1)に設定
  9. 「Create connection」をクリックします。

Amazon Athena を Amazon SageMaker Canvas に統合

RDS で Connect AI への接続が設定できたら、Amazon Athena のデータを Amazon SageMaker Canvas のデータセットに統合していきましょう。

  1. Amazon Athena のデータで作成した RDS のテーブル形式データセットで、検索バーまたは接続リストから Connect AI で設定した Amazon Athena 接続を検索します。
  2. Amazon Athena から使用したいテーブルを選択し、右側のキャンバスにドラッグ&ドロップします。
  3. 以下のように、Amazon Athena 接続から任意の数のテーブルを結合してワークフローを作成できます。「Create dataset」をクリックします。
  4. データセットが作成されたら、「Select dataset」をクリックしてモデルを構築します。
  5. 分析を実行し、予測を生成してモデルをデプロイします。

これで、Amazon SageMaker からAmazon Athena のデータにリアルタイムでアクセスできるようになりました。カスタム ML モデルを構築し、ビジネスの予測インサイトを生成して、組織の成長に活用してください。

クラウドアプリケーションから Amazon Athena への SQL アクセス

Amazon SageMaker Canvas からAmazon Athena のデータへのダイレクト接続が完成しました。データをレプリケーションすることなく、接続やデータセット、予測モデルをさらに追加してビジネスを推進できます。

300 以上の SaaS、ビッグデータ、NoSQL ソースにクラウドアプリケーションから直接リアルタイムアクセスするには、CData Connect AI をご覧ください。

はじめる準備はできましたか?

CData Connect AI の詳細、または無料トライアルにお申し込みください:

無料トライアル お問い合わせ