2つの新しいオープンソースプロジェクトが、異なるアプローチを通じてAIモデルの能力を評価する、ゲームベースのベンチマークを導入しています。
Tiny AI Arenaは、ランダムに選択された4つのモデルを8×8のグリッド上でのターン制バトルで競わせるプロジェクトです。目的は、最後に生き残ることです。各モデルは、移動、隣接する敵への攻撃、待機といったアクションをターンごとに実行し、これらにはアクションポイント(AP)を消費します。ゲームには、障害物やパワーアップといった環境要因が含まれます。サーバーが審判としてアクションを検証し、モデルは50文字のグローバルチャットを通じてコミュニケーションを取ることができます。結果はEloレーティングシステムを用いてリーダーボードにランク付けされます。プロジェクトの現在のランキングによると、Claude-Sonnet-5が首位を保持しており、次いでClaude-Fable-5.1、Grok-4.6が続いています。
これとは異なるアプローチとして、Pac-Man Bake-offは、モデルが単一のプロンプトからゲーム「パックマン」をどれだけうまく再現できるかを評価します。このプロジェクトは、プレイ可能なHTMLエントリーを生成する能力に基づいて、異なるモデルやハーネスを比較します。これらのエントリーのスコアリングは、操作性、ゴーストの挙動、パックマンのスタック、迷路、サウンドなどの要因によって決定されます。Opus 5.5が2026-09-28に実施したライブゲームの再テストによると、スコアは90秒間の自動プレイテストと迷路の監査から導き出されています。
出典
- Show HN: Pac-Bench – How well can models one-shot a Pac-Man game? (Hacker News Frontpage, 2026-09-28)
- github.com/jonclegg/pacman-bakeoff
他3件の出典出典を閉じる
- AI同士をターン制のバトルゲームで対決させて能力を測る「Tiny AI Arena」 (GIGAZINE, 2026-09-29)
- GitHub
- 自分の脳が何B級のAIと同等性能なのか診断できるウェブサイト「HumanBench」が登場、選択問題で人間の力を試してどのAIに性格が似ているかも判定可能 (GIGAZINE, 2026-09-29)