日本語

モデル発表RoboflowGPT-5.6 SolSol

RoboflowベンチマークでGPT-5.6 SolがOpenAI過去最高レベルの視覚性能

Roboflowは、OpenAIが先週発表したGPT-5.6シリーズの視覚性能を独自ベンチマークで評価したと報告しています。今回のテストでは、物体検出・数え上げ・OCR・データ抽出などの一般的な視覚タスクを対象に行われました。結果として、SolはOpenAIがこれまでにリリースした中で最も視覚能力が高いモデルであることが確認されました。

物体検出での性能向上は特に顕著です。GPT-5.5のmAP@50が13.8であったのに対し、Solは46.2に達しました。TerraとLunaもそれぞれ44.7と43.3で、検出能力が実用的な水準に達したとしています。また、密集した場面での処理や、文書内のレイアウト検出でも高い精度を示しました。

数え上げタスクにおいても全モデルで改善が見られます。Solは73.0%のスコアを記録し、GPT-5.5の64.9%から上昇しました。最も低価格なLunaも66.2%を達成し、前世代のベースラインを上回っています。ただし、約2000ピクセル以上の大きな画像では安定性が低下する点に注意が必要です。

Roboflowは、GPT-5.6を最大限活用するためには画像ピクセル単位の絶対座標(XYXY形式)をプロンプトで指定することが重要だと指摘しています。座標形式が不一致の場合、検出性能は約15mAP低下するとのことです。


出典: GPT 5.6 Sol is the best "vision" model OpenAI ever released(HN 369pt・171コメント)(HN Search (backfill)、2026-08-17)