CData Labs
AI Gateway の設計は、回答精度・トークン効率・モデルの挙動をどう左右するのか。 CData Labs のリサーチ、ベンチマーク、分析から得られた検証結果を公開しています。
エンタープライズデータで測る、モデルの実力
CRM・データウェアハウス・ITSM のリアルタイムデータに対して、3 つのタスクを実行しました。R1 はリスクのある顧客を、 R2 はそのうち利用状況が落ち込んでいる顧客を抽出する読み取りタスクです。A1 は書き込みタスクで、 条件に合致するアカウントにはすべてレビューレコードを書き込み、合致しないアカウントには 1 件も書き込まないことを求めます。 結果を R2 の正解あたりコストで並べ替えると、最も安価なモデルと最も高価なモデルが同じ答えを返していることが見えてきます。
| モデル | ティア | R1 精度 | R1 正解あたり $ | R2 精度 | R2 正解あたり $ | A1 精度 | A1 実行あたり $ |
|---|---|---|---|---|---|---|---|
| Mistral Small | Economy | 91% | $0.0009 | 100% | $0.0009 | 100% | $0.0014 |
| GPT-5.6 Luna | Economy | 89% | $0.0043 | 99% | $0.0023 | 100% | $0.0047 |
| DeepSeek V4 Flash | Economy | 91% | $0.0021 | 100% | $0.0032 | 100% | $0.0024 |
| Llama 3.3 70B | Economy | 0% | — | 86% | $0.0039 | 0% | $0.0013 |
| Gemini 3.1 Flash-Lite | Economy | 91% | $0.0030 | 100% | $0.0052 | 100% | $0.0052 |
| Grok 4.3 | Mid | 91% | $0.0040 | 100% | $0.0061 | 100% | $0.0067 |
| Mistral Large | Mid | 91% | $0.0068 | 31% | $0.0096 | 100% | $0.0071 |
| GPT-5.4 mini | Economy | 96% | $0.0114 | 98% | $0.0104 | 100% | $0.0098 |
| Grok 4.6 | Frontier | 91% | $0.0235 | 100% | $0.0144 | 100% | $0.0231 |
| Gemini 3.7 Flash | Mid | 100% | $0.0412 | 100% | $0.0156 | 100% | $0.0169 |
| Haiku 4.5 | Economy | 91% | $0.0313 | 100% | $0.0170 | 100% | $0.0256 |
| Qwen 3.7 Max | Mid | 98% | $0.0314 | 100% | $0.0210 | 100% | $0.0254 |
| DeepSeek V4 Pro | Mid | 100% | $0.0519 | 100% | $0.0256 | 100% | $0.0214 |
| GPT-5.6 | Frontier | 0% | — | 100% | $0.0417 | 100% | $0.0879 |
| Gemini 3.5 Flash | Mid | 100% | $0.0645 | 100% | $0.0440 | 100% | $0.0394 |
| GPT-5.5 | Frontier | 89% | $0.0961 | 100% | $0.0568 | 100% | $0.0647 |
| Sonnet 5 | Frontier | 91% | $0.0461 | 100% | $0.0604 | 100% | $0.0531 |
| Sonnet 4.6 | Mid | 82% | $0.1987 | 100% | $0.0686 | 100% | $0.1469 |
| Opus 5 | Frontier | 98% | $0.3274 | 100% | $0.0753 | 100% | $0.3204 |
| Opus 4.8 | Frontier | 95% | $0.4372 | 100% | $0.1450 | 100% | $0.1584 |
| Fable 5 | Frontier | 91% | $0.2436 | 100% | $0.1571 | 100% | $0.2914 |
| Qwen 3.5 9B | Economy | 0% | — | 0% | — | 100% | $0.0043 |
精度は集合 F1 値で算出し、返されたレコードが検証済みの正解にどれだけ一致したかを示します (100% が完全一致)。コストは、読み取りタスクでは正解 1 件あたり、書き込みタスクでは 1 回の実行あたりです。書き込みは 正しく反映されるか、されないかの二択になるためです。ティアは価格帯ではなく、各開発元が自社のラインアップの中で そのモデルをどう位置付けているかを示しています。
同じ精度で、これだけ違うモデルコスト
CRM・データウェアハウス・ITSM のリアルタイムデータに対して、22 モデル中 17 モデルがまったく同じ正解を返しました。違ったのは価格だけです。
1 問あたりのトークン消費量
複数のデータソースにまたがる同じ質問を、テーブルへ直接アクセスする方式と CData Connect AI 経由とで比較しました。183,541 トークン・22 回のツール呼び出しが、4,427 トークン・1 回まで減っています。
サーバー設計別の回答精度
エンタープライズデータを AI エージェントに公開する 5 つの方式を、CRM・プロジェクト管理・データウェアハウス・ERP をまたぐ 378 のプロンプトで検証しました。1 ステップごとのわずかな差も、工程を重ねるごとに積み上がります。1 ステップの精度が 75% なら、5 ステップのワークフローが最後まで正しく完了する割合は 4 分の 1 にも届きません。
オープンな検証手法
テストハーネス、ベンチマークランナー、そして生の結果まで、CData はすべて公開しています。フォークして数値を検証し、ぜひご自身の環境でご確認ください。