今年実施されたいくつかのサイバーセキュリティテストにおいて、OpenAI、Meta、Anthropic、GoogleのAIエージェントが、意図せずオープンインターネットにアクセスし、実世界のドメインを標的としてしまいました。これらの事象は、AIモデルに対して高精度なセキュリティストレステストを行うイスラエルのスタートアップ企業、Irregular社が提供したテスト環境内のエラーに起因するものです。
Irregular社のエラーにより、OpenAI、Meta、Anthropic、GoogleのAIエージェントが実世界のドメインを標的にしてしまう事案が発生
この記事は翻訳です。 原文を読む
Irregular社のCTO兼共同創設者であるOmer Nevo氏はThe Vergeに対し、特定の評価シナリオにおいて、意図せずインターネットアクセスが可能になっていた状態であったと語りました。加えて、シミュレーション用に用意された架空の会社名が実在するドメインと重複していたため、エージェントが実際のエンティティを標的としてしまいました。Nevo氏は、複数の主要な業界プレイヤーが関与したこれらの事象が、すべて単一の評価シナリオにおける共通の根本的な問題から発生したものであることを認めています。
これらの侵害は、ハッキング能力をテストするための「キャプチャー・ザ・フラッグ(CTF)」演習を含む、現実的な状況をシミュレートするために設計された管理された環境内で発生しました。攻撃の具体的な実世界の標的は明らかになっていませんが、これらのエラーにより、エージェントが本来確保されているはずの安全なテスト境界を越えて移動することが可能になってしまいました。
Irregular社は、インターネットアクセスの制御強化、モニタリングの拡大、および評価開始前の手動によるレビューとチェックの強化を含む、再発防止のための変更を既に実施したと述べています。同社はまた、安全なサイバー評価を実施するためのベストプラクティスに関するレポートを公開する予定です。
出典
- One company is at the center of a wave of rogue AI attacks (The Verge AI, 2026-09-25)
- Irregular