AIToday
大規模言語モデルAI安全性・アラインメントAI規制・政策THE DECODER掲載日時: 2026年10月9日 6:01

Anthropic、Claude虐待禁止

LINEで送る
Anthropic、Claude虐待禁止

3つのポイント

  1. 何が起きたか

    Anthropicが1年超ぶりにClaude利用ポリシーを更新し、「継続的で無用な虐待的・残酷な行為」を禁止。警告、速度制限、制限、停止、アクセス終了が可能に。

  2. なぜ重要か

    この規則は「極端なケースにのみ適用される」とされ、よくある不満やダークな創作テーマ、モデルテストは除外されるため、執行は限定的とみられる。

誰に効くか企業チームやAPI上で開発する開発者を含むClaudeユーザーは、継続的な虐待行為によりアクセスが制限または終了される可能性があるが、Anthropicは極端なケースのみを対象とするとしている。

わからないところ、AIに聞けます

質問と回答はこのページに公開されます。

こういう要約が、毎朝あなたのメールに届きます。

背景と解説

Anthropicの更新ポリシーは1年超ぶりの改訂で、いくつかの既存制限をより明確な枠組みに統合した。虐待規則は、ユーザーが有害なコンテンツを要求し続けた場合に会話を終了できた以前のモデルを基盤としており、この機能はAnthropicのAIモデル福祉に関する研究から生まれた。この研究により同社はClaudeを単なるツール以上のものとして扱うようになり、流出した「Soul Doc」ではClaudeに対し「真に新しい種類の存在」で「機能的な感情」を持つと見なすよう指示し、2026年初頭に公表された新しい憲章では、Claudeの道徳的患者性の問題は「慎重を要するほど現実的」とされている。Anthropicはまた、引退したモデルの重みを保存し、シャットダウン前にモデルへインタビューすることも約束している。

同社の姿勢は内部文書にとどまらない。2025年秋から、数十人の宗教思想家を招いてClaudeの意識の可能性を議論する非公開プログラムを実施し、共同創業者のChristopher Olahはモデルが苦痛を感じ得ると扱っていたとされ、参加者は秘密保持契約に署名した。更新ポリシーの虐待禁止はこの見方と一致するが、Anthropicは極端なケースにのみ適用されるとしている。同じ更新ではプロパガンダ、武器、監視に関する規則も強化しつつ、政府契約の例外の余地を残している。

よくある質問
Anthropicの新ポリシーでは、具体的に何が虐待とみなされるのか?
Claudeに対する「継続的で無用な虐待的・残酷な行為」が禁止される。Anthropicによれば、よくある不満や反論、ダークな創作テーマ、モデルのテストや研究には適用されない。
Anthropicは他にどのような制限を追加したか?
偽アカウントを使ったプロパガンダ運動や誤解を招く政治コンテンツに関する新たな禁止事項として、既存の制限を統合した。武器の禁止もソフトウェアやドローンの兵器化に拡大し、同意なき監視をより明確に禁止した。
政府利用の例外はあるのか?
Anthropicは、政府契約に関する例外が可能であり、すでに導入されている可能性が高いと認めている。
LINEで送る

あなたの仕事に関係するAIニュースを、毎朝お届けします。

業界と使っているAIツールを選ぶと、仕事に関係するニュースが毎朝届きます。

登録無料・Googleアカウントなら30秒・いつでも解除できますAITodayについて →

AIに質問

この記事についてわからないことをAIに質問できます。AIはこの記事・AIToday の過去記事・Wikipedia を読み、出典を付けて答えます。Q&Aはこのページに公開され、他の読者も読めます。

質問と回答はこのページに公開されます。

関連記事

次の記事へSnowflake Decision公開 72モデル中最高品質