同じインフラで、レプリケーションを 76% 高速化。
並列パーティション読み取りと書き込み処理の改善が、企業のデータパイプライン性能をどう変えるのか
CData Sync v26.2 は、まったく同じインフラ・同じワークロードで大規模レプリケーションの所要時間を 76% 削減します。360 GB/10 億行のテーブルを Databricks にレプリケーションするケースで、スキーマの変更は一切不要です。
360 GB/10 億行のデータセットで、レプリケーション時間を削減
ResultSet のメタデータ取得が高速化(66 ms → 8 ms)
カラム数の多いテーブルで、ファイル操作あたりの書き込みサイクルを平均短縮
レポート全文を読む前に、まずは要点から
大規模なデータセットをクラウドウェアハウスに複製しているチームは、いずれも同じ壁に行き着きます。スループットの限界です。テーブルが数百ギガバイト、数十億行の規模になると、レプリケーションの実行時間は伸び、データの鮮度は落ち、クラウドのコンピューティングコストも膨らんでいきます。CData Sync v26.x は、このギャップを埋めるために開発されました。
本レポートでは、v26.x で実装された 2 つの改良をベンチマークで検証しました。並列パーティション読み取りは、大きなソーステーブルを分割し、利用可能な CPU コアを使ってマルチスレッドで同時に読み取ります。書き込み処理の改善は、同期先での ResultSet 処理とディスク書き込みの効率を高めます。どちらも、Snowflake、Databricks、Redshift ですでに使われている COPY INTO のバルクロード基盤を土台にしています。
注目の数値はこちらです。360 GB/10 億行の SQL Server テーブルを Databricks にロードする処理は、v25.1 では 11 時間 6 分かかっていました。これが v26.2 では 2 時間 41 分で完了します。同じインフラのまま、同期先のスキーマ変更もなしで76% の削減です。
レポート全文では、ベンチマークの手法、4 つの Sync ビルドバージョンでのパーティションチューニング結果、Snowflake・Databricks・Redshift の数値比較、そして 3 つすべての処理を 3 時間未満に抑えた具体的な設定まで解説しています。
レプリケーション速度は、IT だけの問題ではなくビジネスの問題です。
データ量が増えるほど、遅いパイプラインはデータの鮮度を落とし、意思決定を遅らせ、クラウドのコンピューティングリソースを消費します。 3 社の事例から、何が問われているのかをご紹介します。
グローバル製薬企業 3 名のデータチームが、SAP の財務データを利用する 3,500 人を支えています。経営層のダッシュボードへの反映が遅れると、企業全体の意思決定にも遅れが生じます。
地域保険会社 20 を超えるパイプラインで、毎月数十億行のデータが動きます。レプリケーションが時間内に終わらなければ、その遅れは翌日の業務レポートにそのまま影響します。
サプライチェーンソフトウェア企業 200 以上の ERP カスタムフィールドをレプリケーションすると、カラム単位の処理オーバーヘッドが急速に積み重なります。書き込み処理の改善が、特に効果を発揮する領域です。
クラウドのコンピューティングコスト レプリケーション時間の短縮は、コスト削減にも直結します。Snowflake、Databricks、Redshift におけるウェアハウスのコンピューティング消費量を直接的に削減できます。
2 つの技術的な進化と、1 つのバルクロード基盤。
並列パーティション読み取り
大きなソーステーブルを分割し、利用可能な CPU コアを使って マルチスレッドで同時に読み取ります。8 コアの Sync マシンなら、8 並列のパーティションで 大規模テーブルのレプリケーション時間を 50–75% 短縮できます。
書き込み処理の改善
同期先での ResultSet 処理とディスク書き込みの効率を高めます。 ファイル操作あたりのサイクルタイムを 8% 短縮し、数百カラムに及ぶ 幅の広いテーブルで特に大きな効果を発揮します。
COPY INTO によるバルクロード
2 つの改良が土台とする、クラウドネイティブな高速データ取り込み基盤です。 Snowflake、Databricks、Redshift ですでに利用できます。
ベンチマークレポート全文
76% を支える数値をご覧ください
必要事項をご記入いただくと、レポート全文をお送りします。ベンチマークデータや検証手法はもちろん、主要ウェアハウス 3 種すべての処理を 3 時間未満に抑えた具体的な設定まで掲載しています。