AIコーディングエージェントは、AIモデルを動かす際に、モデルにどのツールを使わせるか、どのような情報をコンテキスト(文脈)として渡すかといった処理を「ハーネス」と呼ばれるツールによって管理しています。
AIコーディングエージェントの「ハーネス」はコストに大きく影響、成功率への寄与は限定的との研究結果
カリフォルニア大学バークレー校とAIランキングサイト「Arena」の共同研究チームは、7つのモデルと3つのハーネス(Claude Code、Codex CLI、Pi)を組み合わせた21通りのパターンを対象に、2種類のベンチマークで比較調査を行いました。
研究の結果、ハーネスの違いによるタスクの成功率の差は、SWE-bench Liteで±2%以内、Terminal-Bench 2.0でもおおむね±5%以内に収まりました。一方で、費用には最大5倍の差が生じることが示されました。例えば、Claude Fable 5を比較した場合、Claude CodeはPiの約2倍の費用がかかりました。
費用差の一因として、ハーネスがモデルに渡す初期コンテキスト量の違いが挙げられます。Claude Codeの初期コンテキストは、Piの10倍を超えるケースが確認されました。研究チームは、同じ品質の結果を得るために余分な費用を支払う状態を「ハーネス税(Harness Tax)」と表現しています。
また、モデルの提供元が用意したハーネスが、必ずしも最高の性能を発揮するとは限らないことも判明しました。研究チームは、重要なのはモデルの提供元ではなく、実際の作業において費用と成功率のバランスを最もよく保てるハーネスを選択することであると述べています。
出典
- AIコーディングエージェントにとってハーネスはどれほど重要なのか? (GIGAZINE、2026-09-17)