日本語

ニュースGrok 4.5GPT-5.5Claude Opus 4.8Claude Fable 5

Grok 4.5・GPT-5.5等4モデルの同一プロンプト実装比較と推論コスト計測結果

Grok 4.5、GPT-5.5、Claude Opus 4.8、Claude Fable 5の4モデルに、単一HTMLファイルでのアプリ作成を依頼する実験が行われました。プロンプトは3種類で、外部ライブラリやネットワーク呼び出しなしという条件です。各モデルの出力をブラウザで実行し、動作を確認しました。

3Dルービックキューブのアニメーション作成では、Claude Opus 4.8とFable 5が初回で正しく動作する成果物を出しました。Grok 4.5は初回でキューブが表示されず、1回のリトライで成功しました。GPT-5.5は一面しか描画されず、完成度は低かったとされています。

パーティクル重力サンドボックスでは、GPT-5.5が視覚的に最も魅力的な出力と評価されました。Grok 4.5は整った軌道描写となり、Opus 4.8は物理演算に優れるが視覚効果が控えめでした。Fable 5は柔らかい光の表現が特徴です。

ブレイクアウトゲームでは4モデルとも初回で動作する品質の成果物を生成しました。スコアや残機管理、パドル操作も正常に機能し、差はほとんど見られなかったとされています。

推論コストの実測では、Grok 4.5が初トークン生成に0.5秒未満、速度は約110トークル/秒で他を圧倒しました。コストも最も安価であり、xAIが主張する高速・低価格の特性を実証しています。一方、Fable 5は最速ではなかったものの、高品質な出力を得るためのコストとして位置づけられています。


出典: We made Grok 4.5, GPT-5.5, and Claude build the same apps(HN 173pt・93コメント)(HN Search (backfill)、2026-07-09)