ソフトウェアエンジニアのBen Swerdlow氏は、リアルタイム戦略ゲーム「StarCraft: Brood War」をプレイする汎用AIエージェントの能力を評価するために設計された新しいベンチマーク「Brood War Bench」をリリースしました。StarCraft II専用にトレーニングされたDeepMindのAlphaStarのような特化型AIとは異なり、このベンチマークは通常テキストやコード生成に使用されるモデルをテストし、それらがリアルタイムのゲームプレイをいかに自律的に扱えるかを測定します。
このベンチマークでは、OpenAI、Anthropic、xAIのエージェントを含む、19通りの異なるモデル構成と推論負荷レベルによる総当たり戦が実施されました。結果の中で、Codex Astraは18勝0敗という完全な戦績を収めました。しかし、Swerdlow氏は、トップクラスの性能を持つモデルであっても初心者レベルを超えていないことを指摘しており、戦略的な複雑さと実行力が依然として大きな障壁であることを示唆しています。
テストでは、モデル間で明確な行動パターンが明らかになりました。Codexベースのエージェントは、プローブ(Probe)ユニットを送って敵のワーカーを嫌がらせするといった妨害戦術に焦点を当てることが多かったものの、継続的な生産やサブエージェント間の協調に苦戦しました。Claude Fableは、長期的な経済成長と技術進歩を志向する傾向を示し、一部の試合ではミュタリスクのような高度なユニットの生産に成功しました。
対照的に、リアルタイムのインタラクションにおける基本的な要件に苦戦するモデルもありました。例えばGrok 4.6は、一貫した制御ループを維持することに頻繁に失敗し、多大な推論時間を費やしたにもかかわらず、コマンドの発行が極めて少なくなることもありました。Swerdlow氏は、困難さは戦略だけでなく、変化するゲーム状態を観察し、迅速に行動する能力にあると述べています。彼は、基本的な「フォトンのラッシュ」戦術を用いる人間のプレイヤーであれば、参加しているすべてのエージェントを打ち負かせる可能性が高いと示唆しました。
出典
- AIに「StarCraft」をリアルタイムで戦わせる「Brood War Bench」が登場、全モデルが初心者レベルながらCodex Astraは18戦全勝 (GIGAZINE, 2026-09-25)
- Brood War Bench