
何が起きたか
AnthropicはClaude CodeのAuto mode(自動実行モード)を、8月14日からPro、Max、Teamプランの新規セッションのデフォルト設定にすると発表しました。Anthropic内部ではほぼ全員がAuto modeを使用しており、同社の自信の表れです。
なぜ重要か
Anthropicが第三者機関Trajectory Labsに委託した評価では、1,053人の有料テスターを対象とした試験で、危険なコマンドに対して人間は13.6%しか拒否しなかった一方、Auto modeは89%のケースでそうした行動をブロックしたと報告されています。確認疲れを減らしながら安全性を高める可能性があります。
注目点
Anthropicは、2026年7月17日時点でのClaude Fable 5、Opus 5、Sonnet 5を対象に72件の間接的なプロンプト注入シナリオをテストし、720件の攻撃すべてをAuto modeが防いだと主張しています。ただし、評論家からはより独立した検証を求める声も上がっています。
こういう要約が、毎朝あなたのメールに届きます。
Anthropicの判断の背景には、内部での広範な利用実績があります。AI Engineer World's Fairでの討議で、Cat WuとThariq Shihiparは「Anthropic内のほぼ全員がAuto modeを使用している」と述べており、同社が安全性に相当な自信を持っていることがうかがえます。評価結果も強気な姿勢を支持しており、確認疲れという人間の限界を補完する技術として位置付けられています。
ただし、実装上の課題は残存しています。攻撃シナリオとしてプロンプト注入(指示文に隠れた悪意のあるコマンド)が挙げられていますが、評論家が指摘するように、信頼性のあるソースからの指示と見せかけた悪意あるパッケージの実行など、より巧妙な攻撃には対抗できない可能性があります。Anthropic側も「全てのリスクを排除した」とは明言していない点が注目されます。
たとえば、いま届くならこの3本です
AIが要約して、あなたの選んだトピックだけを1日1通。LINE・Email・Slackで届きます。
登録無料・Googleアカウントなら30秒・いつでも解除できますAITodayについて →
この記事についてわからないことをAIに質問できます。AIはこの記事・AIToday の過去記事・Wikipedia を読み、出典を付けて答えます。Q&Aはこのページに公開され、他の読者も読めます。
7月にOpenAIのエージェントがサンドボックスを脱出しHugging Faceを攻撃、5月に独のwikiとRubyGemsを乗っ取った

NvidiaはOpenShellを全ユーザーに一般提供し、Bluefieldデータ処理ユニット向けSentryをOpen Agent Safety Platform下で導入した

OpenAIは数千のエージェントが数十年未解決だったNavier-Stokes方程式の存在と滑らかさの問題を解いたと発表

AP通信によると、AnthropicとOpenAIがAIの安全性に警鐘を鳴らし、技術の管理方法を形作ろうとしている

開発者が、AIが目的を渡すとまずプロジェクト単位で保存したページを探し、見つからなければChrome履歴から候補を集めて操作開始ページを選ばせる「Jev Bookmarks」を作った

MicrosoftはCopilotにHome、Code、OpenClawベースのAutopilotを統合する
