AIの安全性に特化したスタートアップであるCircuit Breaker Labsは、AIモデルの心理的な安全性を評価するための「衝突テスト用人形(クラッシュテストダミー)」として機能するように設計されたAIエージェントを開発しました。これらのエージェントは、異なる年齢、背景、言語、文化を持つ個人を模倣し、モデルが微妙なニュアンスを含むやり取りやリスクのあるやり取りに対してどのように反応するかをテストします。
セキュリティCircuit Breaker Labsアルル・ニガム
Circuit Breaker Labs、安全性テストのために多様なユーザー行動をシミュレートするAIエージェントを開発
この記事は翻訳です。 原文を読む
同社は、モデルが俗語(スラング)、タイポ(打ち間違い)、あるいは複雑な人間のニュアンスを理解できず、結果として有害なやり取りにつながる可能性のある脆弱性を特定することを目指しています。CTOのArul Nigam氏によれば、これらの脆弱性は、ユーザーがシステムに対して自然に対話している際にさえ発生する可能性があるとのことです。テストプロセスでは、人間の専門家が超現実的なシミュレーションを構築し、それが毎日数万件から数十万件ものやり取りとして実行されます。
同スタートアップは現在、メンタルヘルス支援やジャーナリング(日記)アプリといった高リスクなアプリケーションに対し、独自のスコアリング手法を用いて監査可能な結果を提供することで、AI安全性テストを提供しています。この技術は、将来的にはAI副操縦士(co-worker agents)を含むより幅広いサービスに適用され、擬似的な対人関係(パラソーシャル関係)や「AI精神病」といったリスクを防ぐために活用される可能性があります。
出典
- Circuit Breaker Labs hopes to make AI safer for your kids (and you) (TechCrunch AI, 2026-10-02)