型付き意思決定モデルを評価するために設計された、再現可能なベンチマークである「JevBench」が導入されました。このベンチマークは、知能(Intelligence)、較正(Calibration)、速度(Speed)、コスト(Cost)の4つの主要な軸を測定し、それぞれの 25% に幾何平均を適用して、公式のJevBenchスコアを算出します。
高速で安価だが、ランダムな推測と大差ない性能のモデルが高くランク付けされるのを防ぐため、スコアリングシステムには 50 を下回る知能スコアに対するペナルティが含まれています。具体的には、知能がこの閾値を下回る場合、最終スコアに (I / 50)^2 が乗じられます。
また、このベンチマークは難易度ティアごとに特定のスコープを実装しています。「Easy」スコープが知能に焦点を当てるのに対し、「Hard」ティアでは 220 の高難度な意思決定のサブセットにおいて4つの指標すべてを測定します。この評価は、デプロイ環境の透明性を確保するため、EUベースの 推論 といった地域的なホスティングの違いを考慮するように設計されています。
このプロジェクトはオープンソースであり、GitHubから利用可能です。最近のテストでは、classifier.devの「fast tier」(Jev 1.13.0 モデルを使用)が、特定の比較指標において、judge tierで 97.3%、hard tierで 70.5% のスコアを記録しました。
出典
- Show HN: JevBench, a reproducible benchmark for typed decision models (Hacker News Frontpage, 2026-09-22)