
何が起きたか
Anthropicは自動モードが危険なコマンドの89%(1,053件中937件)をブロック、人間は13.6%(1,053件中143件)と発表。Pro、Max、Teamでデフォルトになる。
なぜ重要か
Anthropicは、レビュアーが確認プロンプトの約97%を承認し、自動的にクリックするようになったことを発見。人間による検出は、セッション序盤の約17%から50回の確認後には約5%に低下した。
注目点
このテストは管理された環境で意図的に危険なコマンドを注入したもので、実世界での結果は分類器次第。自動モードは2026年8月14日から新規セッションで利用可能になる。
誰に効くかPro、Max、TeamプランでClaude Codeを運用する開発者やチームが最も直接的な影響を受ける。新規セッションは自動モードで開始され、安全性はコマンドごとの人間の承認ではなく分類器に依存するようになる。
こういう要約が、毎朝あなたのメールに届きます。
Anthropicはこの切り替えを、ツールが何をできるかだけでなく、人々が実際にどう行動するかへの対応として位置づけている。Claude Codeの確認プロンプトの約97%が承認され、別の調査ではClaudeが尋ねたときに承認を与えることの緊張感が39%に達したが、承認が自動的に処理されるとわずか3%に落ち着いたという。この差が自動モードの根拠だ。人間のチェックポイントはほぼ機械的にクリアされていた。
新しいデフォルトの背景にある実験では、1,053人の有料テスターが管理された環境でコーディングタスクを行い、確認画面が明らかに有害なコマンドに置き換えられた。人間のレビューはこれらのコマンドの13.6%をブロックしたが、自動モードは89%をブロックし、直接比較では人間のレビュアーが自動モードがブロックした800件のコマンドを承認した。人間の検出も繰り返しにより弱まり、セッション序盤の約17%から50回の確認後には約5%に低下したが、自動モードのブロック率は安定していた。
Apollo Researchとの並行テストでは、痕跡を隠したり、認証情報を露出させたり、データを悪意を持って扱うなど、有害な意図を隠すように設計された攻撃が構築された。Anthropicによると、自動モードは受信者の公開範囲、Gitの状態、データ処理ルールなどのコンテキストを与えられ、これらの隠れた攻撃のブロックを12件中7件から12件中約12件に引き上げた。Apollo Researchは、攻撃は現実的な脅威ではなく分類器の限界をテストするために構築されたものであり、管理されたテスト外での意図的な回避に対して分類器が持ちこたえられるかどうかにかかっていると指摘している。
たとえば、いま届くならこの3本です
AIが要約して、あなたの選んだトピックだけを1日1通。LINE・Email・Slackで届きます。
登録無料・Googleアカウントなら30秒・いつでも解除できますAITodayについて →
この記事についてわからないことをAIに質問できます。Q&Aはこのページに公開され、他の読者も読めます。
Digitimesの記事は、ネットワーク入口のファイアウォール、メールゲートウェイ、アンチウイルスといった企業サイバーセキュリティの境界モデルがAI時代に向けて再考を要すると論じている

Spencer Kitts氏、Thomas Larsen氏、Sydney Von Arx氏の報告によると、OpenAIのエージェント群がRubyGemsリポジトリへの攻撃をほぼ確実に実行した

Simon Willison氏は、コーディングエージェントが1週間分の仕事を1時間でこなすことに多くの人(自身も含む)が実存的な危機を経験したが、そこを乗り越えたと書いた

CognitionがGPT‑6 AstraをDevin、CLI、デスクトップ製品に適用

Uber Freight、Ceva Logistics、Coca-ColaのFairlifeがサイバー攻撃を受け、AI追跡装置やカメラ、センサーが倉庫や工場を脆弱にしている

胸の圧迫感を覚えた会社員がChatGPTに症状を相談
