Entelligenceは、自動コードレビューへの安価なモデルの利用の実現可能性を評価するため、低コストのGPT-5.6 Lunaと高性能なGPT-6 Astraとの比較調査を実施しました。AI-Code-Review-Evals組織の50の公開プルリクエストを使用し、正確性、セキュリティ、並行性、リソース、およびエラーハンドリングのバグを特定する能力についてモデルを評価しました。
GPT-5.6 Luna vs. GPT-6 Astra:低コストモデルがわずかなコストで75%のバグを特定
この記事は翻訳です。 原文を読む
結果として、コストと精度の間に顕著なトレードオフがあることが示されました。LunaのコストはAstraの約3.6%でしたが、Astraが検出した検証済みバグの75%を特定しました。Lunaは一般的な正確性の確認においては、Astraの47に対して39のロジックおよびデータバグを発見し、効率的であることが証明されましたが、専門的なコードには苦戦しました。アイデンティティおよびアクセス管理サーバーであるKeycloakでは、特に認証および権限ロジックに関して、Lunaの検証率はAstraの93%に対し、50%まで低下しました。
セキュリティに関しては、Astraの19に対し、Lunaは9のセキュリティバグを特定しました。この調査は、Lunaは日常的な正確性のチェックには非常に費用対効果が高いものの、バグの見落としによるコストが高いセキュリティ的に重要なパスにおいては、引き続き高性能なモデルが必要であると結論付けています。
出典
- GPT-5.6 Luna vs. GPT-6 Astra: Is a $1.20 Model Good Enough for Code Review? (Hacker News Frontpage, 2026-09-14)
- AI-Code-Review-Evals