開発者ハーサルブ氏は、4つのビジョンモデルに同一の色鉛筆ツールセットを与え、描画能力を比較する実験「Canvas Arena」を実施したと報じています。対象はGPT-5.6 Sol、Claude Fable 5、Grok 4.5、Gemini 3.6 Flashの4つです。モナ・リザと星月夜の2作品に加え、フリープロンプト5件で計28回の描画を行い、構造的類似度(SSIM)でスコアを付しました。
料金・制限GPT-5.6 SolClaude Fable 5Grok 4.5Gemini 3.6 Flashハーサルブ
GPT-5.6とClaude Fable 5など4モデル、色鉛筆ツールで「モナ・リザ」を描画
ツール利用の癖はモデルごとに大きく異なりました。GPT-5.6 SolとGemini 3.6 Flashはセットアップ用のツールを呼ばず、描画コール内でパラメータを設定しました。一方、Grok 4.5は全体の65%が色や筆圧の設定であり、平均99ステップと多めでした。Claude Fable 5はスミッジ(ぼかし)を多用し、頻繁にキャンバスを確認したとされています。
コスト面では大きな差が出ました。Claude Fable 5は7回の描画で約160ドルと、GPT-5.6 Solの7.74ドルやGrok 4.5の9.21ドルと比べて約20倍高くなりました。Grokはトークン数が3,400万と最多でしたが、キャッシュヒット率が98%近くだったため低コストに抑えられたとしています。
描画の進行状況も解析しました。どのモデルも、描画中に一度到達した最高スコアより最終的な完成度が低くなる傾向が見られました。Claude Fable 5は27回も確認しましたが、5回目以降の類似度はほぼ横ばいだったと報告されています。実験の詳細な記録はオープンソースで公開されています。
出典: "Drawing" the Mona Lisa with GPT-5.6, Claude, Gemini, and Grok(HN 249pt・104コメント)(HN Search (backfill)、2026-07-22)