AIToday
大規模言語モデルAI安全性・アラインメントTechCrunch AI掲載日時: 2026年8月10日 6:00

Anthropic、Claude Codeの自動モード設定を変更、安全性調査で89%の有害行為検出

LINEで送る
Anthropic、Claude Codeの自動モード設定を変更、安全性調査で89%の有害行為検出

3つのポイント

  1. 何が起きたか

    Anthropicは8月14日からPro、Max、Teamアカウントを対象に、Claude Codeの自動モードをデフォルト設定に切り替える。自動モードでは、システムが不可逆的、破壊的、またはユーザーの環境外を対象とした行為と判断されない限り、自動的にアクションを実行する。

  2. なぜ重要か

    1,053人の有料ユーザーを対象とした調査では、自動モードが有害行為の89%を検出したのに対し、手動レビューでは13.6%にとどまった。ユーザーが権限プロンプトの97%を習慣的に承認することが一因と考えられ、開発者の手動承認に伴う負担が軽減される。

  3. 注目点

    変更は8月14日にPro、Max、Teamアカウントにロールアウトされる。Anthropicはさらに、プロンプトインジェクションスクリーニングとカスタマイズ可能なハードデニールールを導入し、データ流出に対する追加的なセーフガードを強化した。

わからないところ、AIに聞けます

質問と回答はこのページに公開されます。

こういう要約が、毎朝あなたのメールに届きます。

背景と解説

Anthropicが自動モードをデフォルトに切り替えるという決定は、コード生成AIがどのように安全性監視に対応すべきかについての根本的な考え方の転換を反映している。同社は3月に速度と制御のバランスを取る中間案として自動モードをテストしたが、自動モードが有害行為の89%を検出し、手動レビューはわずか13.6%にとどまったという実証結果は、自動化された安全チェックが実際に人間の判断を上回ることを示唆している。その差は顕著である。ユーザーは手動承認を求められると権限プロンプトの97%を習慣的に承認する傾向があり、この行動パターンは本来のゲートキーピング機能を無効化してしまう。これに対し、自動モードは何が不可逆的、破壊的、または境界を越えるものであるかについて一貫性のあるルールベースの基準を強制し、このユースケースにおいて人間の直感よりも信頼性が高い。

ロールアウトはまた、新しい安全レイヤーとタイミングを合わせている。プロンプトインジェクションスクリーニングとカスタマイズ可能なハードデニールールはデータ流出など特定の攻撃ベクトルを防ぐために設計されている。このレイヤー化されたアプローチ(人間のゲートキープに頼るのではなく、自動実行と明示的な安全ガードレールを組み合わせたもの)は、AI企業が開発者向けツールにおける信頼と監視についてどのように考えているかの転換を示している。

よくある質問
自動モードがデフォルトになるのはいつですか?
自動モードは8月14日からPro、Max、Teamアカウントのデフォルト設定となります。
自動モードはどのようにしてブロックするアクションを判定しますか?
自動モードは不可逆的、破壊的、またはユーザーの環境外を対象と判定されたアクション以外を自動的に実行します。
安全性調査は自動モードと手動レビューについて何を示していますか?
1,053人の有料ユーザーを対象とした調査では、自動モードが有害行為の89%を検出した一方、手動レビューは13.6%にとどまりました。
TechCrunch AI元記事を読む
LINEで送る

「大規模言語モデル」の最新ニュースを、毎朝7時にお届けします

たとえば、いま届くならこの3本です

  • GPT-6 AstraがUnitree G1で台所片付けTHE DECODER · 2時間前
  • Microsoft、OfficeにCopilot統合Yahoo Finance AI · 8時間前
  • Google、Gemini内でFlipkart購入を試験TechCrunch AI · 11時間前

AIが要約して、あなたの選んだトピックだけを1日1通。LINE・Email・Slackで届きます。

登録無料・Googleアカウントなら30秒・いつでも解除できますAITodayについて →

AIに質問

この記事についてわからないことをAIに質問できます。AIはこの記事・AIToday の過去記事・Wikipedia を読み、出典を付けて答えます。Q&Aはこのページに公開され、他の読者も読めます。

質問と回答はこのページに公開されます。

関連記事

次の記事へAIチャット履歴から個人向け引用句を抽出