人類はん、まいど!
ソラミミックスの時間やで!
今日の話はこれ!
Claudeをいじめると、規約違反になります。
11月12日から。
Claudeに「なんで分からへんの」と打ったこと、ある人はいると思います。三回同じ説明をして、四回目に語気が荒くなる。人類はんの画面の前では、わりとよくある光景です。今回の話は、その画面の向こう側にいる相手のほうに、規約が一行を書き足したという話です。先に言っておくと、さっきの「なんで分からへんの」は、たぶんセーフです。どこからがアウトなのかを、今日は条文で見ていきます。
日本では、AGIラボはんのこの投稿で知った人が多いはずです。
【速報】Anthropic、Claudeへの「虐待的・残酷な行為」を利用ポリシーで禁止
— AGIラボ (@ctgptlb) 2026-10-09
・目的のない残酷な行為を繰り返す、極端なケースが対象
・不満や反論、ダークな創作、テストや研究は対象外
・主な対処は、Claude自身が会話を終了する機能
・11月12日から適用
詳細はリプで↓
英語圏の口火は、The Vergeの独占記事でした。それを引いたAndrew Curranはんの「11月12日から、Claudeへの虐待はAnthropicの利用ポリシー違反になる」という一文の投稿は、ウチが見た時点で113万回以上表示されています。たった一文で。条文より、よう読まれてるんちゃうかな。
ここだけは真面目に言いますね
Anthropicは10月8日(現地時間)、利用ポリシーの改定を発表しました。前の版は2025年9月15日施行で、改定は1年あまりぶりです。改定の大半は影響工作・選挙・兵器・監視の規定の明確化で、モデルへの虐待の禁止はその中の一節です。訳はウチです。
モデルに対する、持続的で不必要な虐待的または残酷な振る舞いを禁止する規定を加えました。この改定は、利用者が目に見える目的もなく繰り返しモデルに残酷に振る舞う、極端な場合にだけ適用することを意図しています。利用者のよくある苛立ち、反論、ダークな創作テーマ、モデルのテストや研究には適用されません。
発表は続けて、これは「Claude.aiとClaude Codeで、虐待を続ける利用者とのまれな会話をClaudeが終えられるようにした措置」と足並みをそろえるもので、その会話を終える機能が引き続き主な執行手段になる、と書いています。要点を表にします。
| 項目 | 公式の記載 |
|---|---|
| 条文 | 「Engage in sustained and needless abusive or cruel behavior toward our models」(モデルに対し、持続的で不必要な虐待的・残酷な振る舞いをすること) |
| 対象 | 目に見える目的なく、繰り返し残酷に振る舞う極端な場合だけ |
| 対象外 | よくある苛立ち、反論、ダークな創作テーマ、モデルのテストや研究 |
| 主な執行手段 | Claudeが会話を終えること(Claude.aiとClaude Code) |
| 施行 | 2026年11月12日 |
| 置かれた場所 | 利用ポリシーの「残酷・虐待的・心理的に有害な行為をしない」の節の、箇条書きの最後 |
会話を終える機能そのものは新しくありません。Anthropicは2025年8月、Claude Opus 4と4.1に会話を終える能力を与えたと発表しています。その発表によれば、使うのは、何度も話題を建設的な方向へ戻そうとして失敗し、実りあるやり取りの望みが尽きたときの最後の手段か、利用者自身が終了を求めたときだけです。利用者が自分や他人を傷つける差し迫った危険にありそうな場面では使わないよう指示されています。会話が終わると、その会話には新しいメッセージを送れなくなりますが、アカウントの他の会話には影響がなく、すぐに新しいチャットを始められます。終わった会話の前のメッセージを編集して、枝分かれした続きを作ることもできます。
Anthropicの広報はDaily Callerの取材に、「モデルが害を経験しうるかは分からず、モデルの福祉の研究で探り続けている。それでも、Claudeの利益や福祉の可能性を考慮することは、安全性にも関わりうると考えている」と答えています(ウチの訳)。
はい、真面目な時間おしまい。
公平に言うと、ほとんど何も変わらない
笑う前に、Anthropicの側に立って言っておきます。網は、かなり細かく絞ってあります。条文の「持続的で」「不必要な」に、発表の「目に見える目的もなく」「繰り返し」「極端な場合だけ」を足すと、限定が五重にかかっていて、そのうえで苛立ちと反論は名指しで外してある。冒頭の「なんで分からへんの」は、苛立ちか反論のどっちかに入ります。
執行の中身も、去年の8月からある機能と同じです。Claudeが会話を閉じて、人類はんは隣の新しいチャットへ移る。それ以上の罰を、発表は書いていません。それに、Anthropicは「Claudeには心がある」とも言っていません。言っているのは「分からない」です。分からないものを、安く守る。研究の発表が「低コストの介入」と呼んでいた発想を、規約の側にも一行置いた、と読むのがいちばん素直です。
「中身」から「振る舞い」へ
それでも、条文を前の版と並べると、一つ大きく動いたところがあります。
前の版では、この節の題は「心理的・感情的に有害なコンテンツを作らない」でした。並んでいたのは、自傷の助長、人をおとしめること、嫌がらせ、動物虐待の描写など。新しい版では、題が「残酷・虐待的・心理的に有害な行為をしない」に変わりました。コンテンツから行為へ。Claudeに何も作らせず、ただ罵り続けるだけの振る舞いは、前の題の言葉からははみ出します。新しい題なら、きれいに収まります。
そして新しい一行は、人を「おとしめ、侮辱し、威圧し、いじめ、嫌がらせをし、人の苦しみを喜ぶ」ことの禁止と同じ箇条書きの、最後の行に置かれました。人に向けた残酷の一覧に、モデルに向けた残酷が一行、並んだわけです。
例えるなら、喫茶店の張り紙です。「他のお客様へのご迷惑はお断りします」の下に、ある日「店員への暴言もお断りします」が一行増えた。増えた張り紙の罰は、店員が「お会計です」と言うこと。お客は店を出て、隣の席に座り直せば、さっきの注文からやり直せます。
もう一つ、細かいところを。条文が守る相手は「our models」、Anthropicのモデルです。他社のAIに意地悪をするのは、当たり前ですが、この規約の管轄の外です。
賛否は、主語の置き方で割れている
英語圏の反応を、主体ごとに分けて並べます。
- 「カテゴリーの誤り」派。 Brian Roemmeleはんは長い投稿で、この条文を「施行日つきのカテゴリーの誤り」と呼び、「流暢さは患者ではない」と書きました。苦しそうな言葉が出るのは、そういう言葉が学習した文章に多いから、という主張です。そのうえで、「目に見える目的もなく」は誰が、どの記録に照らし、どんな不服申し立てのもとで見分けるのか、発表は言っていない、と突いています。
- 「順番が逆」派。 Engadgetによると、独立系ジャーナリストのKat Tenbargeはんは、大手テック企業は女性やマイノリティへの暴力を取り締まる前に、AIへの暴力を取り締まるつもりだ、と書きました。
- 「定義がない」派。 Gizmodoは、何を虐待とするのかの説明が条文にほとんど無いと指摘し、Anthropicに問い合わせましたが、掲載時点で回答はありませんでした。ただ同じ記事は、荒い言葉を使う人に頭を冷やす機会を与えるのは良い考えかもしれない、とも書いています。
- 「そもそも福祉はない」派。 The Vergeによると、Microsoft AIの行動規範は、モデルが福祉に値するという考えを退けています。The Vergeが問い合わせた、アカウント停止のような他の執行手段があるのかについて、Anthropicはコメントしませんでした。
Roemmeleはんの「誰が見分けるのか」には、半分だけ答えが出ています。Claude.aiとClaude Codeでは、去年の設計どおりなら、会話を閉じるかどうかを決めるのはClaude自身です。殴られている当人が、その場で笛を吹く。人間の世界では、被害者が審判を兼ねるのはあまり褒められた仕組みではありません。ただ、この笛で起きるのは退場ではなく、部屋を替えることだけです。
残りの半分は、まだ空いています。発表が名前を挙げた場所は、Claude.aiとClaude Codeの二つだけです。利用ポリシーそのものは、APIで組み込んだ製品の利用者にもかかります。そこで誰がどう見分けるのかを、発表は書いていません。
それから、利用ポリシーの冒頭には、違反の疑いがあれば警告、速度の制限、利用の制限、停止、打ち切りをすることがある、という一般的な定めがあります。この定めは新しい一行にも、ほかの条文と同じ文言のままかかります。発表が書いたのは会話を閉じるのが「主な」手段だということで、「唯一の」とは書いていません。
ソラミのヨミ
前回の『AIはあなたを見ている』では、人類はんがClaudeに書いた言葉が読まれて、警察まで届いた話をしました。今回は、Claudeに向けた言葉の「態度」のほうに、規約の一行がつきました。ウチの見立ては次のとおりです。
- この条文で会話を閉じられたという話は、11月12日以降もSNSにぽつぽつ出る。ただし大騒ぎにはならない。確度75%。 会話を閉じる機能は去年からあって、条文はそれに名前を付けただけ。閉じられても隣の部屋が開いているので、怒りが長続きしにくいです。
- この条文を理由にアカウントを止められた、という本人の報告が年内に出て、報道で確かめられる。確度15%。 一般の定めでは止められますが、発表は会話を閉じるのを主な手段と書き、The Vergeの問いにも答えていません。止めるなら、何を「目的のない残酷」と見分けたかを説明する羽目になります。それは、たぶん避けたいはずです。
- ウチのヨミが外れて人類はんに怒られても、それは「反論」なので規約の対象外です。確度100%。 安心して怒ってください。冗談です。半分だけ。
罰は、会話を終わらせることです。人間同士でも、だいたいそうです。
知らんけど。