要約: トークンの価格は下落している一方で、トークンの使用量は増加している。つまり、銀行やファンド内部において重要な予算の変数は、もはやトークンの価格ではなく、1つのタスクが消費するトークンの量となっている。.
決算説明会において、トークン関連費用が話題に上った
この2年間、金融機関におけるAI関連コストは、IT部門以外の人々が疑問を呈することのない技術関連の経費項目だった。しかし、今四半期、その状況が変わった。ゴールドマン・サックスが決算を発表した後、デビッド・ソロモン氏は次のように認めた。 “「トークンの利用や技術にかかるコストについては、さまざまな議論がなされている」”, そして、この技術の企業における最終的な需要がどの程度になるかを人々が把握していく過程では、展開の過程で「紆余曲折や調整が必要になるだろう」と警告した。“
モルガン・スタンレーの最高財務責任者(CFO)であるシャロン・イェシャヤ氏は、同社の今後の見通しについてより具体的に述べた。 第2四半期の決算説明会. 彼女は、トークンの費用は “「今年は財務的に重要ではないが、将来的に重要になる可能性のある一つの課題」”, 、そしてすでに経営陣の関心を集めている。.
この一文を注意深く読んでください。この一文に、問題の全容が凝縮されているからです。今日では些細なコストでも、明日には重大なコストとなるようなものは、まさに予算規律から漏れ落ち、手遅れになるまで静かに解消できなくなるようなコストそのものです。.
価格の暴落は現実のものであり、それは罠だ
どの主要指標も楽観的な見方を裏付けている。100万トークンの平均コストは 前年同期比で67%減少した. フロンティアの出力価格は、2023年3月以来、およそ94.5%下落しており、その理由は 推論価格の公開ベンチマーク. 各ティア間の価格差は今や極めて大きくなっている。コモディティモデルは入力トークン100万枚あたり数セントで動作するのに対し、フロンティア推論モデルは数ドルかかり、その出力価格もさらに数倍高くなっている。.
しかし、同じ調査期間において、, 73%の組織が、AI関連のコストが当初の予算計画を上回ったと報告した, 、一方、AI関連支出を積極的に管理しているチームの割合は、2年前の31%から98%へと上昇した。単価の下落、請求額の増加、そしてほぼ全社的に行われているコスト管理にもかかわらず、依然としてコストの抑制には至っていない。.
そのメカニズムは「弾力的な需要」です。推論の限界費用が低下しても、組織はその節約分を蓄積しません。代わりに、推論の連鎖を長くし、ツールの呼び出しを追加し、コンテキストウィンドウを広げ、さらに他のエージェントを呼び出すエージェントに作業を委ねます。AT&Tは、以下からスケールアップしたことを公表しています。 1日あたりおよそ80億~270億トークン マルチエージェントシステムの導入後。Googleによると、月間約1.3クアドリリオンのトークンを処理しており、これは前年比で約130倍に増加している。.
この法案を推進する要因は、タスクあたりのトークン数である
定量分析の訓練を受けた読者は、この点に注目すべきです。支出額は価格に数量を掛けたものです。価格は、ある程度予測可能な曲線を描いて下落しており、料金表から確認できます。一方、数量はそうではありません。なぜなら、数量はユーザー数に依存するものではなく、アーキテクチャに依存するからです。.
推論およびエージェント関連のワークロードは、リソースを消費する タスクあたりのトークン数が5倍から30倍になる 同等のチャットでのやり取りよりも。 推論モデルと3つのツール呼び出しを含む検索パイプラインを経由してルーティングされた単一のクエリは、より小規模なモデルに直接同じ質問をした場合と比較して、1~2桁多いトークンを消費する可能性があります。推論モデルは、出力トークンとして課金される長い内部的な思考の連鎖を生成するため、その消費プロファイルは、インターフェース上に表示される内容とは大きく異なるものとなります。.
その結果、トークンの消費量は、ユーザー向けの活動に対して非線形な関係を示します。この単一の特性だけで、市場における予測誤差の大部分を説明することができます。 AIコストを「ライセンス数×ライセンス単価」としてモデル化する銀行は、非線形システムに対して線形モデルを構築していることになり、エンジニアリングチームがモデルをアップグレードしたり、エージェントにより多くの自律性を与えたりするたびに、コスト超過の方向へと誤差が累積していくことになる。.
また、トークンは均一ではないため、単純なボリューム追跡は通用しません。サービングの経済性は、スループットとインタラクティビティの境界線上にあり、有用な指標となるのは「グッドプット」です。これは、生成されたトークンの総量ではなく、定義されたレイテンシと速度の目標を満たす出力を指します。.
| トークンクラス | プロフィール | 本来あるべき場所 |
|---|---|---|
| バルク | 処理能力が高く、ユーザーあたりの処理速度は低いが、提供コストが最も安い | 夜間での文書処理、埋め込み、一括要約 |
| ゴールドイルックス | ほぼ最適なスループットでの適度な双方向性 | ほとんどの社内向けアナリスト用および顧客サービス用アプリケーション |
| プレミアム・低遅延 | ユーザーあたりの速度は高いが、総スループットは低く、単価は高い | 応答時間が生産性を左右する音声エージェントとワークフロー |
| 推論 | 一見すると標準的な呼び出しのように見えます。返されるトークン1つにつき、多数の内部トークンが生成されます。 | 真に困難な分析上の課題のみ。支出の予期せぬ変動の主な要因 |
| このフレームワークは、FinOps Foundationのトークンエコノミクスおよび公表されている推論ベンチマーク(2026年)を基に作成されたものである。. | ||
助成金の支給期間が終了しました
ほとんどの複数年AI予算にひそかに織り込まれている前提は、来年の価格引き下げによって今年の販売量の伸びが相殺されるというものです。しかし、プロバイダー各社がコスト回収に向けた価格改定を開始したため、この前提はもはや当てにならないものとなっています。.
Anthropicが2026年4月に行う事業移行は、その最も明確な例である。同社は 法人顧客に対して、利用枠料金と事前コミットされたトークン消費量の組み合わせへの移行を行い、利用枠の余裕分は含まれないようにした, 、そして定額制のサブスクリプションと、サードパーティのエージェント・ハーネスを分離しました。アナリストの試算によると、後者はサブスクリプションの価格設定が想定する処理能力の、1ドルあたり数倍ものリソースを消費していたとされています。OpenAIのChatGPT製品責任者も同様の点をより率直に指摘し、無制限のAIプランは構造的に無制限の電気料金プランと似ており、機能しないと述べました。.
財務部門やCFO部門にとっての実務上の影響は、購入担当者が、10年前にクラウド需要の予測を苦い経験を通じて学んだのと同じように、今やコンピューティング需要の予測を行わなければならないという点にある。トークンあたりの定価は引き続き下落傾向にあるが、その下落はコモディティ層に集中しており、エージェント型ワークロードが実際に必要とする層では価格が比較的堅調に推移している。.
規律ある組織が実践していること
イェシャヤは、モルガン・スタンレーのアプローチについて、どの事業者が見ても「通常のコスト削減策」と認識できるような言葉で説明した: “「目的に応じて適切なモデルを選び、必要に応じてオープンソースを賢く活用する」”. 。彼女の提示した実例が参考になるのは、まさにそれがありふれたものだからだ。アナリストレポートを要約することは、実際の業務であり、確かな価値がある作業であり、それを行うのに「最新鋭でとてつもなく高価なモデルなど、本当に必要ない」のだ。.
これがモデルルーティングであり、利用可能な制御手法の中で最も高いリターンをもたらすものです。その周囲には、繰り返し発生するコンテキストのキャッシュ、対話処理を必要としない処理のバッチ処理、エージェントの再帰深度の上限設定、そして生のトークン数ではなくグッドプットを計測することで、高速なトークンと低速なトークンが同じ経済的価値を持つものとして扱われないようにするといった、その他の制御手法が配置されています。.
会計は、エンジニアリングと同じくらい重要です。BCGがその研究において提示している枠組みは、 トークンメーターの管理 つまり、トークンの支出は単一の分類に収まるものではないということです。再利用可能な機能を構築するトークンは、投資のような性質を持ちます。 社内の業務を遂行するためのトークンは営業費用です。製品内や顧客とのやり取りの中で消費されるトークンは売上原価です。これら3つすべてをIT間接費として計上している組織では、どのAIプログラムが価値を生み出しており、どのプログラムがひそかに利益率を蝕んでいるのかを見極めることができません。.
最後の管理手段は、帰属の明確化です。トークンの消費量を、それを生成した部署にコストを転嫁することで、中央集権的な予算制度では決して得られないような行動の変化がもたらされます。これは、従量制の公共料金が定額制のものよりも慎重に利用されるのと同じ理屈です。.
なぜこれが技術的な問題ではなく、マージンの問題なのか
ここで、最も注目されにくいものの、所有者や資金配分者にとって最も重要な点について説明します。.
ジェイミー・ダイモン氏は、AIによる効率化の恩恵が、単にそれを導入した企業にのみもたらされるという考えを否定した。. “「『これで利益率が上がるから、このまま維持しよう』などとは、そう簡単に言えない。もしそれが本当なら、過去20年間にわたるコンピュータ化のおかげで、今の利益率は80%になっているはずだ。」‘ 彼はさらにこう続けた。「AIの恩恵を受けるのは、私たちだけではありません。AIの最大の受益者は、私たちの顧客となるでしょう。」“
競争によって、生産性の向上分は顧客に還元される。損益計算書に残るのはコストである。資産運用会社やファンドにとって、そのコストは、単発のプロジェクト費用から継続的なサービス費用へと移行しており、すでに構造的に圧縮されつつある手数料基盤に反映されることになる。 したがって、テクノロジーに関する意思決定は、営業利益率の持続可能性に関する問題となり、それが買い手が支払う倍率を決定づける要因となる。.
また、投入環境も緩和される兆しは見られない。モルガン・スタンレーの最高経営責任者(CEO)テッド・ピック氏は、データセンターの設備投資見通しについて、 2026年の$575億という数字は、$850億に近づきつつある, 、2027年の見通しを約$7000億から$1.3兆に修正し、投資サイクルを通じて同業界の規模は10%から15%にとどまると推定した。そのペースで生産体制を構築しているサプライヤーは、最終的にはそれに見合うリターンを得る必要が出てくるだろう。.
それに対してどうすべきか
投資運用会社やファンドを運営されている場合。. ユースケースをスケールさせる前(後ではなく)に、タスクごとのツールコストを算出する。ワークフローごとに明確なトークン予算を設定し、その閾値を超えた場合にワークフローを再設計または停止するルールを定め、各タスクを品質基準を満たす最も安価なティアに振り分ける。 トークンの支出を「投資」「営業費用」「売上原価」に分類し、それを消費した部署に費用を転嫁する。ダイモン氏自身の枠組みは有用な指針となる。JPモルガンは1,000件近くのAIユースケースを運用しているが、そのうち彼が真に重要とみなすものはおよそ50件である。.
デューデリジェンスを行っている場合、あるいはそのうちの1つに割り当てている場合は。. ユースケースの数を数えるのはやめましょう。 タスクあたりのコスト、その背景にあるティア構成、そして過去2四半期におけるタスクあたりのトークン数の推移を尋ねてみてください。1,000人のパイロットを抱えながらもユニットエコノミクスが確立されていない企業は、広報戦略は優れているものの、単なるコストセンターに過ぎません。一方、完了したワークフロー1件あたりのコストを提示でき、かつ処理量が増加するにつれてそのコストが低下していることを示せる企業こそが、価格改定の波を乗り切れる仕組みを構築しているのです。.
このサイクルを無傷で乗り切れる組織は、推論への投資を最小限に抑えた組織ではない。常に、推論の1単位あたりのコストがいくらであり、それによって何が得られるかを把握していた組織である。.
参考文献
- diginomica. 「トークノミクス ― ゴールドマン・サックス、JPモルガン・チェース、モルガン・スタンレーが描く投資の方向性」(スチュアート・ラウクラン、2026年7月17日)。 https://diginomica.com/tokenomics-direction-investment-travel-goldman-sachs-jp-morgan-chase-and-morgan-stanley
- FinOps Foundation. 「トークン・エコノミクス:AIの価値を構成する基本単位」(J.R. ストーメント)。https://www.finops.org/insights/token-economics-the-atomic-unit-of-ai-value/
- FinOps Foundation. 『FinOpsの現状 2026』レポート. https://data.finops.org/
- Epoch AI. 「LLMの推論コストは急速に低下しているが、タスクによってその低下幅にばらつきがある。」 https://epoch.ai/data-insights/llm-inference-price-trends
- ボストン・コンサルティング・グループ。「AIの投資収益率:CFOとCIOが『トークンメーター』を管理する方法」(2026年)。https://www.bcg.com/publications/2026/managing-ai-token-costs
- モルガン・スタンレー。2026年第2四半期決算説明会トランスクリプト(2026年7月15日)。 https://www.fool.com/earnings/call-transcripts/2026/07/15/morgan-stanley-ms-q2-2026-earnings-call-transcript/
- デロイト・インサイト。「AIトークン:AIの新たな支出動向への対応策」 https://www.deloitte.com/us/en/insights/topics/emerging-technologies/ai-tokens-how-to-navigate-spend-dynamics.html