GPT-5.6のSol・Terra・Luna、MetaのMuse Spark 1.1など12モデルが参加しました。4つのアプリを各5回生成し、動作確認とコストを比較しています。
一人称視点の迷路探索では、GPT-5.6が全モデルで高評価でした。Claudeは予想外に苦戦し、Grok 4.5は価格帯に対して実用的とされています。Muse Sparkも動作したケースでは驚きを生みました。
3Dルビークキューブでは、GPT-5.6が予想外に低評価でした。一方、Claude Fable 5は5回中5回で無傷の解算に成功し、高評価を得ています。Opusは一度も完全な解算ができなかったと報告されています。
電卓アプリでは、Claudeが最も優れた結果を出しました。OpusとFableは5回中5回で正しく動作し、Fableはデザイン面でも好印象でした。GPT-5.6 Solは3Dレンダリングに挑戦しましたが、スタイルが不揃いで体験が悪かったとされています。
ゲーム・オブ・ライフでは、オープンウェイトモデルが低コストで高品質な結果を残しました。Qwen 3.7 PlusやGLM-5.2は既存コードの多さにより有利に働いたと分析されています。
SVG生成では、Claude Fableが高品質でユーモラスな結果を出しました。GPT-5.6系はクリーンなレンダリングを欠き、伸びしろが乏しかったと指摘されています。
出典: GPT-5.6, Grok 4.5, Claude, and Muse Spark build the same 4 apps(HN 159pt・89コメント)(HN Search (backfill)、2026-07-11)