日本語

製品発表OpenAIMentalHealthBench

OpenAI、メンタルヘルスに関する対話におけるAIの評価用ベンチマーク「MentalHealthBench」を発表

この記事は翻訳です。 原文を読む

OpenAIは、AIシステムが現実的なメンタルヘルスの対話においてどのように応答するかを評価するために設計された、新しいオープンなベンチマーク「MentalHealthBench」を発表しました。22カ国から集まった80人以上の免許を持つ心理士および精神科医との協力により開発されたこのベンチマークは、単なる緊急事態だけでなく、幅広いメンタルヘルス関連のやり取りにおいてモデルがどのように機能するかを理解するためのギャップを埋めることを目的としています。

このベンチマークは、非急性、高急性、および緊急事態を含む、さまざまな深刻度をカバーする1,215の合成対話で構成されています。また、複数の言語や文化的背景にわたり、成人、ティーンエイジャー、介護者、臨床医などの多様なユーザープロファイルも組み込まれています。臨床的な妥当性を確保するため、このデータセットはプライバシー保護技術を活用し、ChatGPTの現実世界での利用パターンを反映させています。

MentalHealthBenchは、安全性、文脈の確認、ユーザーの主体性の維持、および実行可能なガイダンスの提供を含む10の行動軸を通じてモデルの能力を評価します。各対話には専門家によって作成されたルーブリック(評価指標)が組み合わされており、有益な行動には報酬を与え、有害な行動には罰を与えるように基準に重みが割り当てられています。採点は、高度な推論能力を持つLLMベースの評価器「GPT-5.6 Sol」を使用して行われます。

ベンチマークのリリースと併せて行われた研究では、最先端のモデルがメンタルヘルスの状況への対処において着実な向上を示している一方で、依然として大きな課題が残っていることが示唆されています。具体的には、モデルは依然として、文脈を適切に確認することや、異なる状況に求められる緊急度のレベルを調整することに困難を感じています。OpenAIは、研究者や開発者が手法を検討し、将来のモデルを改善できるように、このベンチマークをオープンに公開しました。

出典

  1. Introducing MentalHealthBench (OpenAI News, 2026-09-23)
  2. MentalHealthBenchの論文