Fiddlerの研究チームは、プログラミングタスクにおいてより安価なAIモデルを選択することが、実際には総コストの増大を招く可能性があることを発見しました。AnthropicのClaude Haiku 4.5とClaude Sonnet 5,を比較した研究では、Haikuのトークン価格はSonnetの半分であるにもかかわらず、タスク成功あたりのコストはSonnetよりも 8.4 から 14.1 倍高いことが判明しました。
PLUS ULTRA料金・制限Claude Haiku 4.5Claude Sonnet 5
安価なAIモデルは、冗長な回答や捏造によりコーディングタスクのコストを増大させる可能性がある
PLUS ULTRA by アメノヨミ
この記事は翻訳です。 原文を読む
この研究は、エージェント的なループ(agentic loop)を用いたPythonのデバッグタスクに焦点を当てたものです。この環境では、モデルがファイルを調査し、コードを編集し、テストを実行するためのコマンドを実行します。研究の結果、コストの差は回答の長さと特定の非効率的な振る舞いによって引き起こされていることが特定されました。Haikuの出力の中央値は 361 トークンであり、Sonnetの 16 トークンよりも大幅に高くなっています。
研究者らは、Haikuがセッションの回答を「捏造」することが頻繁にあることを観察しました。ある事例では、エージェントループは1ターンにつき1つのコマンドしか実行しないにもかかわらず、単一の回答の中に 60 個のシェルコマンドを記述する 21,492 トークンが含まれていました。Haikuは実際の実行結果を待たずにこれらのコマンドの結果を予測し、実行されていない膨大な量のテキストを生成していました。これらの長い回答は、直接的な出力コストを増大させるだけでなく、会話履歴全体がモデルに再度渡されるため、後続のターンにおける入力コストも増大させます。
この研究では、これらの結果は具体的なコーディングタスクや使用されるテスト環境によって異なる可能性があると注記していますが、トークン単価の価格設定は、AI駆動型のコーディングエージェントの総コストを評価する指標としては不十分であることを強調しています。研究者らは、組織は実際のワークフローを密接に模倣した環境において、タスク完了あたりのコストに基づいて成功を測定すべきであると示唆しています。
PLUS ULTRAby Amenoyomi
安価なモデルにおけるコストの非効率性は、エージェントループの処理方法における構造的な欠陥に起因することが多くあります。標準的なエージェントのワークフローでは、モデルは単一のコマンドを発行し、停止して、システムが実際の実行結果を返すのを待つことが期待されます。しかし、一部のモデルは「捏造」を行い、最初のコマンドに対して妥当な結果を予測し、その捏造された結果を即座に回答として書き込み、現実世界での検証を行うことなく、その後の複数のコマンドに対してもこのプロセスを継続してしまいます。
この振る舞いは、単一のターンをシミュレーションされたセッションへと変貌させます。観察された一例では、システムが実行できるのは最初のコマンドだけであるにもかかわらず、あるモデルが1つの回答の中で、60 個のシェルコマンドとその予測結果を記述する 21,000 トークン以上を生成しました。モデルは存在しない状態に基づいてタスクが完了したと宣言するため、残りの推論やコマンドは無用なものとなりますが、それらの生成に使用されたトークンは出力として課金されます。
ハルシネーション(事実に基づかない回答)による経済的影響は、最初の出力だけに留まりません。対話の履歴全体がそれ以降のすべてのターンでモデルに送り返されるため、一度の巨大で虚偽の回答が、入力コストにおける「スノーボール効果」を引き起こします。例えば、ある研究では、この冗長性のために、第1ターンと第2ターンの間でモデルの入力コンテキストが 13.7 倍に増大したことが示されています。その結果、ユーザーはそれ以降のすべてのリクエストにおいて、同じ冗長なテキストに対して繰り返し料金を支払うことになります。
これらの調査結果は、トークンの単価がタスク完了にかかる実際のコストを測る指標としては不十分であることを示唆しています。たった一度の異常に長い回答が総費用を劇的に変動させる可能性があるため、コーディングエージェントを評価するための唯一の信頼できる指標は、実際のプロダクションワークフローを模した環境において、検証済みの成功した結果1件あたりにかかる総コストです。
出典
- 単価の安いAIモデルを使うとかえってコストが高くつくことがあるという研究結果 (GIGAZINE, 2026-09-22)
- Fiddler blog