OpenAIは、エージェントの知能を測定するためのベンチマーク「ARC-AGI-3」において、同社のAstraが極めて高い性能を示したと発表しました。
ARC-AGIシリーズは、現在のAIと汎用人工知能(AGI)の間のギャップを測定することを目的としています。
ARC-AGI-3は、未知の環境で目標を推論し、行動を計画するエージェント能力をテストするものです。
OpenAIによると、Astra (high) は「Provider Adapter harness」を用いた環境において99.9%のスコアを記録しました。これは最先端のスコアであるとしています。
また、Astra (max) は「Standard harness」を用いた環境で62.7%のスコアを記録しました。
Astraは、環境内でオブジェクトの座標やルール、未完了の計画などを記録し、独自の記法を用いて情報を管理します。
Astra (max) は、96.0%のレベルにおいて人間よりも少ないアクション数で課題を解決しました。
テストにおいて、Astraは効率的な行動を選択することで、推論の試行における総コストを低減させています。
出典: OpenAI's GPT-6 Astra on ARC-AGI-3(Hacker News Frontpage、2026-09-04)