Amazonの研究者らは、異なる判定モデル間の相関関係を考慮することで、「LLM-as-a-judge」パイプラインの信頼性を向上させる手法を導入しました。現在のシステムでは、複数のLLMが同じタスクを評価する場合、判定モデルが学習系統、プロンプトテンプレート、またはモデルファミリーを共有していると、その一致度が実際よりも強く見えることがあります。これは、独立した証拠を提供するのではなく、共有されたバイアスを強化してしまう多数決につながる可能性があります。
研究者らは、ペアワイズの依存関係を表現できる統計モデルである「イジングモデル」を使用して、判定パネルをネットワークとして扱う手法を提案しました。このアプローチは、個々の判定者の信頼性と判定者間の関係の両方を学習するため、システムが冗長な一致を排除し、真の合意と共通の誤りを区別することを可能にします。
関連性分類、有害性検出、要約評価の3つのタスクにわたる評価において、10人の判定者パネルを使用した場合、この依存関係を考慮した集約手法は、重み付き多数決のベースラインを9%から14%上回りました。この手法は教師なし設定で機能するため、トレーニングに人間の参照ラベルを必要とせずに、判定結果から学習することができます。
出典
- When LLM judges agree, should we believe them? (Hacker News Frontpage, 2026-09-14)