日本語

モデル発表Google

Google、AIエージェントのコーディング能力を測る「Android Bench 2.0」を公開

Googleは2026年9月17日(米国時間)、大規模言語モデル(LLM)やAIエージェントのAndroid開発能力を評価するベンチマークの最新版「Android Bench 2.0」を公開しました。

今回のアップデートでは、エンジニアが数日から1週間ほどかけて取り組む「長期タスク(Long-Horizon Tasks:LHT)」を課す仕様へと大幅に刷新されています。従来のベンチマークでは、既存リポジトリへの小規模な変更やバグ修正といった限定的な作業が中心であり、最高通過率は約91%に達していました。これに対し、今回の長期タスク群における最高通過率は約28%へと急落しています。

導入された長期タスクには、ライブラリなどの依存関係のアップグレード、新機能の追加、スクラッチからのアプリケーション構築、クロスプラットフォームアプリケーションのAndroid向け移植などが含まれます。

評価指標については、従来の二者択一による合否判定ではなく、「完了率(Completion Rate)」を算出する連続スコアリング方式を採用しています。これは、機能性、UIの忠実度、リグレッション(回帰:修正によって既存機能が損なわれること)の防止といった要素を組み合わせて計算されるもので、モデルが持つ設計能力をより詳細に把握することを目的としています。

検証の結果、AIモデルは既存コードのリファクタリングよりも新規コードの作成で高い性能を示す傾向があることが明らかになりました。一方で、実行時の検証が必要なタスクや、フレームワークの破壊的変更を伴うタスク、未公開ライブラリを利用する「知識の空白」に直面するタスクでは、性能が大幅に低下する結果となっています。

なお、テスト対象にはOpenAIの「GPT-6 Astra」などの最新モデルが含まれており、同モデルが長期タスクにおいて最高通過率28%を記録しています。

出典

  1. 「1週間の開発タスク」でAIの限界を検証 Googleが「Android Bench 2.0」公開 (ITmedia AI+、2026-09-26)