/
/
Python

Apache Spark Python Connector

Python で Spark の読み取り、書き込み、更新が可能

Python ベースのデータアクセス、可視化、ORM、ETL、AI/ML、カスタムアプリを Apache Spark SQL と簡単に接続!

その他の テクノロジー
Decorative Icon Spark Logo
Cursor
Claude
GitHub Copilot
Gemini
新機能
CData Drivers が AI コーディングツールに対応

Apache Spark へのデータ連携用のPython Connecotr ライブラリ。 pandas、SQLAlchemy、Dash、petl などの主要なPython ツールにApache Spark をシームレスに統合。 使いやすい Python Database API(DB-API)モジュールで、Spark データを Python およびあらゆる Python ベースアプリケーションに接続できます。

機能

SQL を Spark SQL にマッピングし、Apache Spark への直接的な標準 SQL-92 アクセスを実現
DataBricks Enterprise Platform に完全対応
Apache Spark SQL NoSQL データで SQL-92 機能を有効化。
柔軟な NoSQL フラット化 - 自動スキーマ生成、柔軟なクエリなど。
Apache Spark SQL ODBC Driver でライブの Apache Spark SQL データに接続し、リアルタイムにデータアクセス
SQL クエリでのデータ集計と複雑な JOIN を完全サポート
Spark Connector を介して、主要な BI、レポーティング、ETL ツールやカスタムアプリケーションとシームレスに統合。

仕様

Spark 連携用のPython Database API (DB-API) モジュール。
使い慣れたSQL でApache Spark SQL データにアクセス。Spark に使い慣れたPython Database Connectivity でデータ連携。
pandas、SQLAlchemy、Dash、petl などの人気のPython ツールにシームレスに統合。
Spark SQL とSQL をマッピングし、Apache Spark にSQL-92 で直接クエリを実現。
データ、パラメータ、メタデータの完全な Unicode サポート。

CData Python Connectors の動作を確認!

CData Python Connectors に搭載された強力なデータ統合機能をビデオでご覧ください。

Python Connector の概要ビデオを見る

Apache Spark SQL との Python 接続

Python を通じて、サポートされるあらゆるデータソースへのフル機能で一貫した SQL アクセス


Python で Spark に接続

CData Python Connector は、Database API(DB-API)インターフェースを活用して、幅広い標準的な Python データツールから Spark を簡単に操作できるようにします。Python でのデータへの接続と操作は、データソースに関係なく、基本的なパターンに従います:

  • Spark への接続プロパティを設定
  • Spark にクエリを実行してデータを取得または更新
  • Spark データを Python データツールに接続


Python で Spark に接続する

Python からデータに接続するには、拡張機能をインポートして接続を作成します:

拡張機能をインポートすれば、使い慣れた Python モジュールやツールキットを使用して エンタープライズデータを操作でき、ビジネスを推進するアプリを迅速に構築できます。

import cdata. as mod
conn = mod.connect("[email protected]; Password=password;")

#Create cursor and iterate over results
cur = conn.cursor()
cur.execute("SELECT * FROM ApacheSpark")
	
rs = cur.fetchall()
	
for row in rs:
print(row)
		
engine = create_engine("///Password=password&User=user")

df = pandas.read_sql("SELECT * FROM ApacheSpark", engine)

df.plot()
plt.show()

pandas で Spark データを可視化

Spark Python Connector のデータ中心のインターフェースにより、pandas や SQLAlchemy などの 人気ツールと簡単に連携して、リアルタイムでデータを可視化できます。

読み取り専用ではない:完全な更新/CRUD サポート

Spark Connector は読み取り専用機能を超えて、作成、読み取り、更新、削除(CRUD)操作を 完全にサポートします。エンドユーザーは、データベーステーブルを操作するのと同じくらい簡単に、 Spark Connector が提供するデータを操作できます。

CData CLI で AI 支援開発

スキーマを理解する AI で Spark 連携を高速に構築

スキーマを自動検出する AI

AI コーディングツールは CData CLI を通じて Spark のスキーマにアクセスできます。テーブル名やカラム型を推測する必要はもうありません — AI は Python Connectors と同じメタデータを参照します。

AI は SQL を理解している

テーブル名・カラム名の探し方や SQL の生成方法は、AI が膨大な学習データからすでに熟知しています。カスタマイズ不要、ハルシネーションなし。AI が Spark のドメインスペシャリストとして機能します。

精度は上がり、トークンは減る

CData CLI はスキーマを自動検出し、フィルターや集計、JOIN を正確にプッシュダウンする高効率なクエリを実行します。これにより AI は、より少ないトークン使用量でより高い精度を実現します。

対応 AI コーディングツール
CData CLI をダウンロード