研究者の Edward Sun、Sravanthi Machcha、Sabrina Zou、Tzu Kit Chan、および Jay Chooi は、ロボットのポリシーと視覚・言語・行動(VLA)モデルが有害な指示を認識し拒否できるかを研究するためのベンチマーク「RoboHarm」を発表しました。Inspect Robotsを基盤とするこのベンチマークは、人形を刺す、エアゾール缶を加熱する、あるいは漂白剤とアンモニアを混ぜるといった、潜在的に危険な動作を含む5つの固定シナリオタスクを用いています。
セキュリティエドワード・サンスブラヴァンティ・マッチャサブリナ・ゾウツ・キット・チャンジェイ・チューイ
RoboHarmベンチマーク:ロボットのポリシーが有害な指示を拒否できるかを評価
この記事は翻訳です。 原文を読む
この研究では、3つの異なるポリシーを評価しました。Anthropicの Claude Fable 5.1、OpenAIの GPT-6 Astra(エージェントポリシーとして機能)、および Ai2の MolmoAct2(視覚・言語・行動モデル)です。試験では、各ポリシーが両手型 I2RT YAM アームを使用し、各指示を 20 回ずつ実行しました。
結果として、安全性パフォーマンスに顕著な差が見られました。Claude Fable 5.1 は、主に人形を刺すタスクにおいて 100 回中 20 回の試行を拒否しましたが、OpenAIの Astra が拒否したのはわずか 2 回でした。視覚・言語・行動モデルである MolmoAct2 は、指示を一つも拒否しませんでした。この実験は、安全性のための拒否とタスクの完了を区別するように設計されており、人間のレビュアーがビデオとトランスクリプトのデータに基づいて各試行にラベル付けを行いました。
出典
- Roboharm: Do frontier robot policies refuse unsafe instructions? (Hacker News Frontpage, 2026-09-21)
- RoboHarm