
Anthropic は、Claude Cowork などの製品と組み合わせた Opus 5 が、129 のブラウザベースのプロンプトインジェクション攻撃シナリオ全体で 0% の成功率を達成したと報告しています。これは、OpenAI が最近完全には解決されない可能性があると述べた脆弱性に対する重要な強化です。防御は二層アプローチで機能します。モデルが処理する前に受信データをスキャンして隠された指令を検出するレイヤーと、実行前に危険なアクションをブロックするレイヤーです。
こういう要約が、毎朝あなたのメールに届きます。
無料で登録 →何が起きたか
Anthropic の Opus 5 モデルは、Claude Cowork などの製品で Auto Mode を有効にした場合、129 のブラウザベースのプロンプトインジェクションテストシナリオ全体で 0% の攻撃成功率を達成しました。セキュリティ企業 Gray Swan による一般的なプロンプトインジェクションテストでは、Opus 5 の攻撃成功率は 15 回の試行後に 2.0% に低下し、Opus 4.8 の 5.5% から改善され、Gray Swan IPI ベンチマークで首位となりました。
なぜ重要か
攻撃者が隠された指令を AI の入力に紛れ込ませてセーフティガード機能を回避するプロンプトインジェクションは、ウェブベースのタスクを処理する AI エージェントの継続的なセキュリティ問題でした。OpenAI は 12 月にこの脆弱性は完全には解決されない可能性があると認めており、実世界のシナリオでのこの急速な改善は、ユーザーが制御するコンテンツとウェブサイトと相互作用する AI を展開する組織にとって重要です。
注目点
0% の成功率には Auto Mode の両方の防御メカニズムが必要です。処理前に隠された指令をスキャンするレイヤーと、実行前に危険なアクションをブロックする別のレイヤーです。Auto Mode なしでは、Opus 5 のブラウザインジェクション成功率は 3.7% となり、モデル単独ではリスクを排除できず、保護ソフトウェアラッパーが不可欠であることが強調されます。
Anthropic は、Claude Cowork などの製品の Auto Mode と組み合わせた Opus 5 モデルが、129 のブラウザベースのテストシナリオ全体でプロンプトインジェクション攻撃に対して 0% の成功率を達成することを示す調査結果を発表しました。これは、防止が著しく困難であることが証明されている攻撃の形態に対して AI エージェントを保護するための大きな前進を表しています。
セキュリティ企業 Gray Swan が実施した並列ベンチマークでは、Opus 5 は 15 回の試行後に 2.0% の攻撃成功率で首位を獲得し、Opus 4.8 の 5.5% と比較されました。次の競争相手の Mythos 5 と Fable 5 はそれぞれ 2.6% と 2.8% を達成しました。改善はモデルレベルの堅牢性と建築上の変更の両方を反映していますが、ブラウザシナリオでの劇的な 0% の成功率は保護ソフトウェアスタックに重大に依存しています。
防御メカニズムは 2 つの順序立った層に依存しています。最初に、Auto Mode はモデルが処理する前にすべての受信データをスキャンして隠された指令を検出し、明らかな攻撃ベクトルを除外します。次に、システムは実行時に危険なアクションをブロックし、成功したインジェクションがモデルをだましてもそれが害をもたらすことを防ぎます。両方のレイヤーを独立して回避する必要があるため、攻撃者はほぼ不可能な状況に直面しています。Auto Mode を有効にしない場合、Opus 5 のブラウザインジェクション成功率は 3.7% に上昇し、興味深いことに、Sonnet 5 は単独で 0.93% でより良いパフォーマンスを発揮します。これは、モデルのアーキテクチャ単独では脆弱性を排除できないことを示しています。これは 0% の結果が単独のモデルではなく、モデルとソフトウェアの組み合わせたシステムの産物であることを強調しています。
プロンプトインジェクションは AI 展開における最も難しいセキュリティ問題の 1 つとして浮上しており、特にウェブページとユーザーが制御する入力と相互作用する必要のある自律型エージェントに当てはまります。AI エージェントがウェブページを読む場合、攻撃者は隠されたテキストまたは工作されたプロンプトを埋め込み、モデルに元の指令を無視させることができます。例えば、データを盗んだり、意図しないアクションを実行させたりできます。この脆弱性は、モデル自身が正当な入力と悪意のある指令を確実に区別する必要があるため、ほぼ解決不可能です。攻撃者がより創意工夫するにつれて、このタスクはさらに困難になります。
Opus 5 を使用した Anthropic のアプローチは、モデルが免疫を持っていると主張するのではなく、保護ソフトウェア(Auto Mode)でラップすることで異なるレイヤーで問題に対処しています。最初のレイヤーはモデルに到達する前に隠された指令をキャッチし、2 番目のレイヤーはインジェクションが成功した場合でも危険なアクションを防ぎます。攻撃者が両方を独立して突破することを要求することで、組み合わせたシステムは実世界のブラウザシナリオで完全に近い防御を達成します。このレイヤード防御は重要です。OpenAI が 12 月に認めたように、モデル自体の堅牢性のみに依存することは十分でない可能性があるためです。
AIが要約して、あなたの選んだトピックだけを1日1通。LINE・Email・Slackで届きます。
登録無料・30秒で完了・いつでも解除できます
まだコメントがありません。最初のコメントを投稿しましょう!
ログインして議論に参加200以上のソースから厳選したAIニュースを毎日無料でお届けします。
無料で始める登録無料・30秒で完了・いつでも解除できます