日本語

ニュースマイクロソフト

MicrosoftがThinkingBoxをリリース:データベースの状態を通じてAIエージェントの一貫性を評価

Microsoftは、AIエージェントの信頼性を評価するために設計された新しいフレームワークおよびデータセットであるThinkingBoxをHugging Faceでリリースしました。エージェントが生成する文章に焦点を当てた従来のベンチマークとは異なり、ThinkingBoxはバックエンドデータベースに残される実際のレコードと副作用に基づいてエージェントを格付けします。

このベンチマークでは、隔離されたModel Context Protocol (MCP) ツールセッションを利用して、507のステートフルなビジネスワークフローを通じてエージェントを実行します。一貫性をテストするために、各タスクは独立して20回ずつ繰り返されます。この手法は、エージェントが正しいように聞こえる応答を生成しながら、データベースの更新に失敗したり、意図しない副作用を引き起こしたりするケースを特定することを目的としています。

研究によると、知覚される能力と実際の信頼性の間には大きな隔たりがあることが示されています。12のLLMモデルにわたる121,680件の有効な試行を含む調査では、試行の約65.6%が実行チェックに失敗しました。特筆すべきは、これらの失敗のうち67.24%において、不適切なフィールド値、意図しない余計な影響、または必要な影響の欠如を残しているにもかかわらず、エージェントは「クリーンに」終了し、状態変化ツールを呼び出し、最終的なツールエラーも報告しないまま終了している点です。

ベンチマークの結果は、「pass@1」(単一試行スコア)と20回の実行における一貫性の違いを浮き彫りにしています。GPT-6 AstraやClaude Opus 5.5のようなモデルは単一試行スコアの高い割合を維持している一方で、DeepSeek-V4-ProやKimi-K2.6などははるかに低い一貫性を示し、20回の繰り返しにおいて初期パフォーマンスの約8%しか維持できませんでした。

ThinkingBoxおよびThinkingBox-Benchデータセットは、現在Hugging Faceで利用可能です。この環境により、開発者はモデルの要約に頼るのではなく、システムのターミナル状態をチェックすることで、エージェントが反復的なタスクを確実に実行できるかどうかを検証できます。

出典

  1. The Agent Said It Was Done. The Database Disagreed. (Hugging Face Blog, 2026-10-03)
  2. ThinkingBox paper