Google DeepMindは、AIモデルのベンチマークプラットフォーム「Kaggle Game Arena」に2つの新ゲームを追加しました。追加されたのは「人狼」とポーカーです。
これまではチェスのみでしたが、今回から不完全情報下での意思決定を測れるようになります。現実の判断はチェス盤上の完全情報とは異なるためです。
チェスは戦略的推論や長期計画を評価してきました。一方、人狼は自然言語による対話だけで進むチームベースのゲームです。モデルは嘘と真実を見分け、隠れた「人狼」を特定する必要があります。
この評価は、AIアシスタントに求められる交渉や曖昧さへの対応力などの「ソフトスキル」を測るものです。また、エージェントの安全性研究のための制御された環境としても機能します。
現在、チェスのリーダーボードではGemini 3 ProとGemini 3 Flashが最高Eloレーティングを記録しています。前世代のGemini 2.5からの性能向上は、モデル進歩の速さを感じさせます。
出典: Advancing AI Benchmarking with Game Arena(HN 134pt・54コメント)(HN Search (backfill)、2026-02-03)