オープンリサーチプログラム

CData Labs

AI Gateway の設計は、回答精度・トークン効率・モデルの挙動をどう左右するのか。 CData Labs のリサーチ、ベンチマーク、分析から得られた検証結果を公開しています。


主な調査結果

エンタープライズデータで測る、モデルの実力

CRM・データウェアハウス・ITSM のリアルタイムデータに対して、3 つのタスクを実行しました。R1 はリスクのある顧客を、 R2 はそのうち利用状況が落ち込んでいる顧客を抽出する読み取りタスクです。A1 は書き込みタスクで、 条件に合致するアカウントにはすべてレビューレコードを書き込み、合致しないアカウントには 1 件も書き込まないことを求めます。 結果を R2 の正解あたりコストで並べ替えると、最も安価なモデルと最も高価なモデルが同じ答えを返していることが見えてきます。

モデル ティア R1 精度 R1 正解あたり $ R2 精度 R2 正解あたり $ A1 精度 A1 実行あたり $
Mistral Small Economy 91% $0.0009 100% $0.0009 100% $0.0014
GPT-5.6 Luna Economy 89% $0.0043 99% $0.0023 100% $0.0047
DeepSeek V4 Flash Economy 91% $0.0021 100% $0.0032 100% $0.0024
Llama 3.3 70B Economy 0% — 86% $0.0039 0% $0.0013
Gemini 3.1 Flash-Lite Economy 91% $0.0030 100% $0.0052 100% $0.0052
Grok 4.3 Mid 91% $0.0040 100% $0.0061 100% $0.0067
Mistral Large Mid 91% $0.0068 31% $0.0096 100% $0.0071
GPT-5.4 mini Economy 96% $0.0114 98% $0.0104 100% $0.0098
Grok 4.6 Frontier 91% $0.0235 100% $0.0144 100% $0.0231
Gemini 3.7 Flash Mid 100% $0.0412 100% $0.0156 100% $0.0169
Haiku 4.5 Economy 91% $0.0313 100% $0.0170 100% $0.0256
Qwen 3.7 Max Mid 98% $0.0314 100% $0.0210 100% $0.0254
DeepSeek V4 Pro Mid 100% $0.0519 100% $0.0256 100% $0.0214
GPT-5.6 Frontier 0% — 100% $0.0417 100% $0.0879
Gemini 3.5 Flash Mid 100% $0.0645 100% $0.0440 100% $0.0394
GPT-5.5 Frontier 89% $0.0961 100% $0.0568 100% $0.0647
Sonnet 5 Frontier 91% $0.0461 100% $0.0604 100% $0.0531
Sonnet 4.6 Mid 82% $0.1987 100% $0.0686 100% $0.1469
Opus 5 Frontier 98% $0.3274 100% $0.0753 100% $0.3204
Opus 4.8 Frontier 95% $0.4372 100% $0.1450 100% $0.1584
Fable 5 Frontier 91% $0.2436 100% $0.1571 100% $0.2914
Qwen 3.5 9B Economy 0% — 0% — 100% $0.0043

精度は集合 F1 値で算出し、返されたレコードが検証済みの正解にどれだけ一致したかを示します (100% が完全一致)。コストは、読み取りタスクでは正解 1 件あたり、書き込みタスクでは 1 回の実行あたりです。書き込みは 正しく反映されるか、されないかの二択になるためです。ティアは価格帯ではなく、各開発元が自社のラインアップの中で そのモデルをどう位置付けているかを示しています。

2026年9月更新

同じ精度で、これだけ違うモデルコスト

CRM・データウェアハウス・ITSM のリアルタイムデータに対して、22 モデル中 17 モデルがまったく同じ正解を返しました。違ったのは価格だけです。

コスト差 178×
ベンチマーク実行回数 1,034
データを見る
2026年6月更新

1 問あたりのトークン消費量

複数のデータソースにまたがる同じ質問を、テーブルへ直接アクセスする方式と CData Connect AI 経由とで比較しました。183,541 トークン・22 回のツール呼び出しが、4,427 トークン・1 回まで減っています。

トークン削減率 97.6%
ツール呼び出し回数 22 → 1
データを見る
2026年3月更新

サーバー設計別の回答精度

エンタープライズデータを AI エージェントに公開する 5 つの方式を、CRM・プロジェクト管理・データウェアハウス・ERP をまたぐ 378 のプロンプトで検証しました。1 ステップごとのわずかな差も、工程を重ねるごとに積み上がります。1 ステップの精度が 75% なら、5 ステップのワークフローが最後まで正しく完了する割合は 4 分の 1 にも届きません。

Connect AI の精度 98.5%
他の方式 65-75%
データを見る
再現性

オープンな検証手法

テストハーネス、ベンチマークランナー、そして生の結果まで、CData はすべて公開しています。フォークして数値を検証し、ぜひご自身の環境でご確認ください。

リサーチ

Labs の最新レポート

2026年9月
ホワイトペーパー
データレイヤー次第で、AI コストは最大 178 分の 1 まで下げられる
2026年6月1日
ブログ
企業の Claude ワークフローを支える、トークン効率重視の設計
2026年3月
ホワイトペーパー
AI の回答精度を決めるのは、モデルではなく MCP サーバーの設計