コストの推移
LLM のコストは上がり続け、止まる気配がありません
ツール定義、連鎖するスキーマ検出、複数のデータソースへのラウンドトリップ。トークンのオーバーヘッドは、あらゆるレイヤーで積み重なっていきます。利用するチームが増えるほど、請求額も急速に膨らみます。
Goldman Sachs が予測するエージェントのトークン消費量の伸び(24 倍)を、1 社に当てはめて試算
たった 1 つの質問が、CRM、データウェアハウス、ITSM ツールにまで及びます。参照するデータソースが 1 つ増えるたびに、スキーマ、ラウンドトリップ、コンテキストがそれぞれ積み上がっていきます。
標準的な Salesforce Account ツールは 70 以上のフィールドを LLM に渡しますが、ほとんどのクエリで必要なのはそのごく一部です。使われないフィールドも、呼び出しのたびにトークンを消費し続けます。
チーム、エージェント、プロンプトが増えるほど、コストのかかるスキーマ検出もその数だけ繰り返されます。オーバーヘッドは利用が広がっても薄まるどころか、掛け算で膨らんでいきます。
コストが生まれる場所で、コストをコントロール
予算、上限、ルーティングルールは、AI を管理するどの単位にも設定できます。各単位のコストは、すべて同じ台帳に集約されます。
チームごとに専用の予算を。
チームや部門ごとに、支出上限とレート制限を割り当てられます。組織単位ごとに独立した台帳とガードレールを持つため、あるチームの試行錯誤がほかのチームの予算に食い込むことはありません。
ユースケースごとに、それぞれの物差しで。
サポート向けのコパイロットと財務分析エージェントでは、コスト構造がまったく異なります。モデル、コンテキスト上限、予算をユースケースごとに設定し、そのコストを台帳で直接確認できます。
暴走するループに歯止めを。
マルチステップのエージェントは、処理が止まらなくなることがあります。エージェントワークロードごとにトークン予算、リトライ上限、ルーティングルールを設定すれば、コストが膨らむ前に処理を止められます。モデル自体に手を加える必要はありません。
コストを左右する 3 つの要素
Connect AI Gateway は、この 3 つをすべて制御して支出を動的に削減し、その効果を 1 つの台帳で計測できる唯一のゲートウェイです。
各データソースの機能を知り尽くしたツール。
フィルター、結合、集計をデータソース側にプッシュダウンするため、テーブルを丸ごと返すことなく、1 回の呼び出しで答えだけが返ってきます。
タスクに必要なコンテキストだけを。
コンテキストエンジンが、モデルに渡すスキーマ、定義、レコードを整理して絞り込みます。呼び出しのたびに余分な情報を詰め込むことはありません。
リクエストごとに、適正価格のモデルを。
単純な検索は低価格なモデルへ、10 のシステムにまたがる分析はフロンティアモデルへ。リクエストの対象となるデータを踏まえて、最適なモデルにルーティングします。
正確で安全な同じ回答を、最大 178 分の 1 の予算で。違いは選んだモデルだけです。 CData Software による社内テストに基づく結果です(2026年第3四半期)。第三者機関による独立した検証は行われていません。実際のコスト差はモデルによって異なり、テストは本番環境のアカウント構成を模した、既知のデータセットを含むサンドボックスアカウントを使用して実施されました。結果は実運用環境でのパフォーマンスを代表するものではなく、結果は変動する可能性があります。各組織は、購入または導入の意思決定を行う前に、独自に検証を実施する必要があります。
低価格帯からフロンティアまでの 22 モデルを対象に、稼働中の企業システムへの実際の質問 1,000 件以上でテストを行いました。精度と安全性を Connect AI のデータレイヤーが担うことで、すべてのモデルが同じ正答にたどり着きました。違いは価格だけです。
レポートを入手する適切なアーキテクチャなら、性能とコストを両立できます
同じクエリでも、処理の道筋は 2 つあります。1 つは、複数のデータソースの生データをそのままコンテキストウィンドウに流し込む方法。もう 1 つは、Claude に渡す前にデータを仮想統合・フィルタリングし、事前に分析しておく方法です。
フルスタックの制御で実現できること
価格でモデルを選び、低価格なモデルを安全に動かし、すべてのトークンを把握する。これらを 1 つのゲートウェイで実現します。
バーの長さは模式的に表示(対数スケール)。数値は CData ベンチマーク(1,034 回実行)の中央値。
直接の書き込みアクセスを与えた場合、22 モデルすべてが少なくとも 1 回の実行で不正なレコードを挿入しました。最も多いケースでは、21 件の指示に対して 250 件を書き込んでいます。出典: CData ベンチマーク