
何が起きたか
Anthropic の Opus 5 モデルは、Claude Cowork などの製品で Auto Mode を有効にした場合、129 のブラウザベースのプロンプトインジェクションテストシナリオ全体で 0% の攻撃成功率を達成しました。セキュリティ企業 Gray Swan による一般的なプロンプトインジェクションテストでは、Opus 5 の攻撃成功率は 15 回の試行後に 2.0% に低下し、Opus 4.8 の 5.5% から改善され、Gray Swan IPI ベンチマークで首位となりました。
なぜ重要か
攻撃者が隠された指令を AI の入力に紛れ込ませてセーフティガード機能を回避するプロンプトインジェクションは、ウェブベースのタスクを処理する AI エージェントの継続的なセキュリティ問題でした。OpenAI は 12 月にこの脆弱性は完全には解決されない可能性があると認めており、実世界のシナリオでのこの急速な改善は、ユーザーが制御するコンテンツとウェブサイトと相互作用する AI を展開する組織にとって重要です。
注目点
0% の成功率には Auto Mode の両方の防御メカニズムが必要です。処理前に隠された指令をスキャンするレイヤーと、実行前に危険なアクションをブロックする別のレイヤーです。Auto Mode なしでは、Opus 5 のブラウザインジェクション成功率は 3.7% となり、モデル単独ではリスクを排除できず、保護ソフトウェアラッパーが不可欠であることが強調されます。
こういう要約が、毎朝あなたのメールに届きます。
プロンプトインジェクションは AI 展開における最も難しいセキュリティ問題の 1 つとして浮上しており、特にウェブページとユーザーが制御する入力と相互作用する必要のある自律型エージェントに当てはまります。AI エージェントがウェブページを読む場合、攻撃者は隠されたテキストまたは工作されたプロンプトを埋め込み、モデルに元の指令を無視させることができます。例えば、データを盗んだり、意図しないアクションを実行させたりできます。この脆弱性は、モデル自身が正当な入力と悪意のある指令を確実に区別する必要があるため、ほぼ解決不可能です。攻撃者がより創意工夫するにつれて、このタスクはさらに困難になります。
Opus 5 を使用した Anthropic のアプローチは、モデルが免疫を持っていると主張するのではなく、保護ソフトウェア(Auto Mode)でラップすることで異なるレイヤーで問題に対処しています。最初のレイヤーはモデルに到達する前に隠された指令をキャッチし、2 番目のレイヤーはインジェクションが成功した場合でも危険なアクションを防ぎます。攻撃者が両方を独立して突破することを要求することで、組み合わせたシステムは実世界のブラウザシナリオで完全に近い防御を達成します。このレイヤード防御は重要です。OpenAI が 12 月に認めたように、モデル自体の堅牢性のみに依存することは十分でない可能性があるためです。
たとえば、いま届くならこの3本です
AIが要約して、あなたの選んだトピックだけを1日1通。LINE・Email・Slackで届きます。
登録無料・Googleアカウントなら30秒・いつでも解除できますAITodayについて →
この記事についてわからないことをAIに質問できます。Q&Aはこのページに公開され、他の読者も読めます。
ブロードコムのAIチップ売上高は前年比221%増の167億ドル、エヌビディアの直近四半期の総売上高は106%増の962億ドルだった

Nvidiaの最新決算説明会でCEOのJensen Huang氏は、先月AIが変曲点を迎え、現在のAIの大半はエージェント型になったと述べた

NvidiaがAnthropicの1000億ドルのIPOを、評価額約2兆ドルで中核投資すべく協議中と報じられた

KAISTとNaver AI Labの研究で、抽出・分解・公式想起・演繹・計算といった推論操作が、Qwen2.5-7B、Qwen3-8B、Gemma4-31Bの内部表現で識別でき、中間層でピークに達する

Reutersによると、NvidiaはAnthropicが計画するIPOで最大100億ドルを基幹投資家として出資する交渉中で、公開前に株式を確保する

OpenAIのEric Provencher氏はGPT-6 Astraへの切り替え時にスキル、AGENTS.md、タスクプロンプトを見直すよう推奨した
