「モデルのナーフ(性能低下)」、すなわち最先端のAIモデルが初期リリース後に能力が低下したり量子化されたりしているのではないかという懸念の高まりに対処するため、livenerfという新しいオープンソースのベンチマークツールがリリースされました。
Livenerf:リリース後のモデル性能低下を検出するための新しい決定論的ベンチマーク
この記事は翻訳です。 原文を読む
エピソード的な「感覚(vibes)」に頼る従来の評価とは異なり、livenerfは決定論的な手法を採用して、時間の経過に伴うパフォーマンスのドリフトを追跡します。このツールは、固定されたプロンプト、固定されたCLIバージョン、および正確なグレーダーを使用することで、観測されたパフォーマンスの変化がテスト環境の変動によるものではなく、モデルのアップデートによるものであることを保証します。これは、英国AI安全研究所(UK AI Security Institute)のオープンソース評価フレームワークであるInspectを基盤として構築されています。
このベンチマークは現在、サブスクリプションを通じてClaude Code経由で提供されているClaude Opus 5.5を追跡しています。プロジェクトは透明性を確保するために事前登録されたプロトコルに従っており、30日間でGPQA、MMLU-Pro、数学の問題などのコアタスクにおける統計的に有意な変化を検出することを目指しています。特筆すべき点として、このツールは二次的なシグナルとして出力トークン数も監視しています。トークン数の減少は、精度指標が変化し始める前に、モデルの「思考」が少なくなっていることを示すことが多いためです。
出典
- Livenerf: Has Opus 5.5 been nerfed yet? (Hacker News Frontpage, 2026-09-29)