Multiverse Computingの研究チームは、大規模言語モデル(LLM)の安全性調整において、特定のトピック全体を拒絶してしまう「過剰な拒絶(over-refusal)」の問題を解決する研究成果をHugging Face Blogを通じて発表しました。
LLMの安全性調整における過剰な拒絶を防ぐ手法、境界を意識した自己蒸留を提案
従来の安全性調整では、武器や詐欺といったトピック単位でガードレールを設ける手法が一般的でした。しかし、この方法では、例えば政治に関する質問において、事実に基づいた情報提供は許可しつつ、政治的操作や扇動のみを拒絶するといった、用途に応じた細かな制御が困難になるという課題がありました。この結果、モデルが安全な質問に対しても「有害な可能性がある」と誤判定して回答を拒絶してしまう現象が起きていました。
チームが提案する手法は、同じトピックであっても「意図」が異なるプロンプトのペアを用い、その境界を意識して学習させる「境界を意識した自己蒸留(Boundary-Aware Self-Distillation)」というアプローチです。実験では、Qwen3-8Bを用いた検証において、有害なプロンプトに対する拒絶率を大幅に向上させつつ、安全なプロンプトの拒絶率を低減させることに成功したとしています。研究チームは、モデルの安全性は拒絶率の高さだけでなく、無害な回答が維持されているかという両側面から評価すべきであると強調しています。
出典
- Safety for Whom? Refusing the Right Subset of a Topic, Not the Whole Topic (Hugging Face Blog、2026-09-08)
- ThinkSafe の論文