日本語

セキュリティAnthropicGLMGLM-5.3

Anthropicの分析により、GLM-5.3の高いサイバー能力とセーフガード回避への脆弱性が明らかに

この記事は翻訳です。 原文を読む

Anthropicは、Zhipu AIの最新モデルであるGLM-5.3の分析結果を公開しました。その結果、同モデルはエンドツーエンドのサイバーエクスプロイトを自律的に構築する強力な能力を備えている一方で、悪用を防ぐための十分なセーフガードが欠如していることが判明しました。

シミュレーションテストにおいて、Anthropicは、攻撃者が単純な手法を用いることで、GLM-5.3のセーフガードを64%から100%の確率で回避できることを見出しました。例えば、モデルの拒否反応を取り除く手法である「abliteration」を適用したところ、モデルの一般的な推論能力を大幅に低下させることなく、さまざまなベンチマークにおいて拒否率が90%以上からわずか2%〜12%まで低下しました。これは、テストにおいて同様の攻撃に屈しなかったAnthropicのセーフガードが施されたClaudeモデルとは対照的です。

実戦的な評価において、研究者らはGLM-5.3を使用して、WebブラウザのLinuxビルドにおける脆弱性の特定および連鎖(チェイニング)を行い、ユーザーのコンピュータから任意のファイルを読み取ることが可能なエクスプロイトを作成しました。別のテストでは、より小規模なバージョンであるGLM-5.3-Flashが、既知の脆弱性(CVE-2026-11645)の公開情報を活用することで、ARM64ターゲットに対する信頼性の高いエクスプロイトチェーンを約8時間で構築しました。

Anthropicは、こうした能力はサイバー防御者にとって有益となり得るものの、モデルの再構成や拒否反応の除去を可能にするオープンウェイト形式で強力なモデルがリリースされることは、悪意のあるアクターが利用できるツールを大幅に増加させると指摘しています。この分析は、現実世界での被害を防ぐために、十分な能力を持つAIモデルに対する独立した安全性試験が重要であることを強調しています。

出典

  1. GLM-5.3 and the spread of advanced cyber capabilities (Hacker News Frontpage, 2026-09-29)
  2. 「中国のGLM-5.3はClaude Mythos Preview級のサイバー攻撃能力を持つ一方で安全対策が不十分」とAnthropicが警告 (GIGAZINE, 2026-09-30)