Red HatのAIセーフティチームは、ジャッジとして機能する大規模言語モデル(LLM)、学習済みテキスト分類器、そしてTypeSafe AIのJevのような最近登場した「意思決定モデル」を含む、さまざまなAIガードレール手法のベンチマーク評価を実施しました。この調査は、テキストを生成するのではなく、状態と特定の質問に基づいて固定された判定を下すこれらの新しい意思決定モデルが、エンタープライズAIの安全性において、速度、コスト、または精度において大きな利点をもたらすかどうかを判断することを目的としています。
NeMo Guardrails評価ライブラリを使用して実施されたベンチマークでは、プロンプトインジェクションおよびコンテンツの安全性/有害性のベンチマークにわたってモデルをテストしました。JevやDiffusionGemmaのような意思決定モデルは有望な結果を示し、granite-guardian-hap-125mのような特定のモデルを上回りましたが、研究の結果、これらが速度、コスト、または精度の面で、LLM-as-a-judgeや従来の学習済み予測モデルを確実に上回ることはないという結論に達しました。
結果として、deberta-v3-base-prompt-injection-v2のような学習済み分類器が依然として非常に競争力があり、専用のGPUインフラを必要とせずにミリ秒単位のレイテンシでトップクラスの精度を提供していることが浮き彫りになりました。Red Hatの調査結果は、意思決定モデルが軽量でタスク特化型の推論への実用的なシフトを示している一方で、ツールの選択はガードレールのユースケースの具体的な要件に依存すべきであることを示唆しています。Red Hatは、OpenShift AI 3.6において、軽量な予測モデルをデフォルトのガードレール構成として統合し続けています。
出典
- Decision models like Jev don't beat LLM-as-a-judge or traditional classifiers (Hacker News Frontpage, 2026-10-02)