SpaceXAIはGrok 4.6の性能評価結果を公開した。Artificial Analysis Intelligence Indexでは61点を記録している。Grok 4.5からの向上幅は5点、Grok 4.3比では23点上昇した。
このスコアは、GPT-5.6 Sol (max) と同等水準にある。上位にはClaude Opus 5 (max, 63点) とClaude Fable 5 (max with fallback, 62点) が位置する。直近のGrok 4.5は1か月ほど前にリリースされたばかりだが、今回のアップデートで性能が引き上げられた。
エージェント系タスクでの評価も高い。GDPval-AA v2のEloは1753で、Claude Opus 5に次ぐ水準だ。信頼区間が重なるClaude Fable 5やQwen3.8 Maxと統計的に差はない。タスク単価は0.84ドルで、Kimi K3と同額ながら知能指数はやや高い。
価格設定は前モデルから変更されていない。1Mトークンあたりの入出力価格は2ドル/6ドルを維持した。これはClaude Opus 5 ($5/$25) やGPT-5.6 Sol ($5/$30) より60%以上低い水準だ。フロンティアモデルで価格を据え置くのは異例とされている。
AA-Briefcaseという長期エージェントタスクの私有ベンチマークではElo 1577を記録した。Fable 5のクラスに位置する結果だ。効率性も特徴で、平均ターン数は約53回、入力トークン数は約5億と試算される。これに対しClaude Opus 5 (max) は約103ターン、約20億トークンが必要だった。
出典: Grok 4.6 scores 61 on the Artificial Analysis Intelligence Index(HN 343pt・417コメント)(HN Search (backfill)、2026-08-13)