OpenAIは、同社のフロンティアAIモデルに対する独立した第三者による評価を強化することを目的とした、一連の優先事項と原則を公開しました。この取り組みは、外部の評価者がトレーニング、評価、およびデプロイメントのデータに深くアクセスすることで、安全性に関する主張や保護策の有効性を効果的に評価できるようにすることに焦点を当てています。
同社は、より深い評価を行うための4つの主要な優先分野を特定しました:
- 1:トレーニング、評価、およびデプロイメントを網羅する安全性ケースの独立した評価。
- 2:内部および外部へのデプロイメントにおける重要な保護策の評価。
- 3:化学、生物学、およびサイバーセキュリティのリスクを含む、準備されたリスクカテゴリの評価。
- 4:重大なアライメント不全事案に関する独立した調査。
これらの取り組みを支援するため、OpenAIは強力な独立性メカニズム、科学的な厳密さ、および強固なセキュリティ慣行の必要性を強調しました。このフレームワークは、機密情報を保護しつつ、評価者に対して技術的な保護策や機密データへの適切なアクセスを提供することを目指しています。OpenAIは、AIの安全性とセキュリティに関する国際的な基準を確立する一助となるよう、多様な独立評価者コミュニティを支援することへのコミットメントを表明しました。
出典
- Priorities and principles for effective third party assessments (OpenAI News, 2026-09-22)
- OpenAI Foundation