AIToday

Opus 5、プロンプトインジェクション攻撃を完全防止

THE DECODER2時間前
Opus 5、プロンプトインジェクション攻撃を完全防止

要点

Anthropic は、Claude Cowork などの製品と組み合わせた Opus 5 が、129 のブラウザベースのプロンプトインジェクション攻撃シナリオ全体で 0% の成功率を達成したと報告しています。これは、OpenAI が最近完全には解決されない可能性があると述べた脆弱性に対する重要な強化です。防御は二層アプローチで機能します。モデルが処理する前に受信データをスキャンして隠された指令を検出するレイヤーと、実行前に危険なアクションをブロックするレイヤーです。

こういう要約が、毎朝あなたのメールに届きます。

無料で登録 →

3つのポイント

  • 何が起きたか

    Anthropic の Opus 5 モデルは、Claude Cowork などの製品で Auto Mode を有効にした場合、129 のブラウザベースのプロンプトインジェクションテストシナリオ全体で 0% の攻撃成功率を達成しました。セキュリティ企業 Gray Swan による一般的なプロンプトインジェクションテストでは、Opus 5 の攻撃成功率は 15 回の試行後に 2.0% に低下し、Opus 4.8 の 5.5% から改善され、Gray Swan IPI ベンチマークで首位となりました。

  • なぜ重要か

    攻撃者が隠された指令を AI の入力に紛れ込ませてセーフティガード機能を回避するプロンプトインジェクションは、ウェブベースのタスクを処理する AI エージェントの継続的なセキュリティ問題でした。OpenAI は 12 月にこの脆弱性は完全には解決されない可能性があると認めており、実世界のシナリオでのこの急速な改善は、ユーザーが制御するコンテンツとウェブサイトと相互作用する AI を展開する組織にとって重要です。

  • 注目点

    0% の成功率には Auto Mode の両方の防御メカニズムが必要です。処理前に隠された指令をスキャンするレイヤーと、実行前に危険なアクションをブロックする別のレイヤーです。Auto Mode なしでは、Opus 5 のブラウザインジェクション成功率は 3.7% となり、モデル単独ではリスクを排除できず、保護ソフトウェアラッパーが不可欠であることが強調されます。

詳細

Anthropic は、Claude Cowork などの製品の Auto Mode と組み合わせた Opus 5 モデルが、129 のブラウザベースのテストシナリオ全体でプロンプトインジェクション攻撃に対して 0% の成功率を達成することを示す調査結果を発表しました。これは、防止が著しく困難であることが証明されている攻撃の形態に対して AI エージェントを保護するための大きな前進を表しています。

セキュリティ企業 Gray Swan が実施した並列ベンチマークでは、Opus 5 は 15 回の試行後に 2.0% の攻撃成功率で首位を獲得し、Opus 4.8 の 5.5% と比較されました。次の競争相手の Mythos 5 と Fable 5 はそれぞれ 2.6% と 2.8% を達成しました。改善はモデルレベルの堅牢性と建築上の変更の両方を反映していますが、ブラウザシナリオでの劇的な 0% の成功率は保護ソフトウェアスタックに重大に依存しています。

防御メカニズムは 2 つの順序立った層に依存しています。最初に、Auto Mode はモデルが処理する前にすべての受信データをスキャンして隠された指令を検出し、明らかな攻撃ベクトルを除外します。次に、システムは実行時に危険なアクションをブロックし、成功したインジェクションがモデルをだましてもそれが害をもたらすことを防ぎます。両方のレイヤーを独立して回避する必要があるため、攻撃者はほぼ不可能な状況に直面しています。Auto Mode を有効にしない場合、Opus 5 のブラウザインジェクション成功率は 3.7% に上昇し、興味深いことに、Sonnet 5 は単独で 0.93% でより良いパフォーマンスを発揮します。これは、モデルのアーキテクチャ単独では脆弱性を排除できないことを示しています。これは 0% の結果が単独のモデルではなく、モデルとソフトウェアの組み合わせたシステムの産物であることを強調しています。

背景と解説

プロンプトインジェクションは AI 展開における最も難しいセキュリティ問題の 1 つとして浮上しており、特にウェブページとユーザーが制御する入力と相互作用する必要のある自律型エージェントに当てはまります。AI エージェントがウェブページを読む場合、攻撃者は隠されたテキストまたは工作されたプロンプトを埋め込み、モデルに元の指令を無視させることができます。例えば、データを盗んだり、意図しないアクションを実行させたりできます。この脆弱性は、モデル自身が正当な入力と悪意のある指令を確実に区別する必要があるため、ほぼ解決不可能です。攻撃者がより創意工夫するにつれて、このタスクはさらに困難になります。

Opus 5 を使用した Anthropic のアプローチは、モデルが免疫を持っていると主張するのではなく、保護ソフトウェア(Auto Mode)でラップすることで異なるレイヤーで問題に対処しています。最初のレイヤーはモデルに到達する前に隠された指令をキャッチし、2 番目のレイヤーはインジェクションが成功した場合でも危険なアクションを防ぎます。攻撃者が両方を独立して突破することを要求することで、組み合わせたシステムは実世界のブラウザシナリオで完全に近い防御を達成します。このレイヤード防御は重要です。OpenAI が 12 月に認めたように、モデル自体の堅牢性のみに依存することは十分でない可能性があるためです。

よくある質問

プロンプトインジェクションとは何か、AI エージェントにとってなぜ重要か?
プロンプトインジェクションは、攻撃者が AI モデルの入力に隠されたテキストまたは指令を紛れ込ませてセーフティガイドラインを回避する攻撃です。ウェブコンテンツと相互作用するブラウザエージェントにとって、これは重大なセキュリティ欠陥となっており、OpenAI は 12 月にプロンプトインジェクションが完全には解決されない可能性があると認めました。
Auto Mode はプロンプトインジェクションにどのように対抗するか?
Auto Mode は 2 つの独立した防御レイヤーを使用します。1 つはモデルが処理する前に受信データをスキャンして隠された指令を検出し、もう 1 つは実行前に危険なアクションをブロックします。インジェクションが成功するには、攻撃者は両方のレイヤーを独立して突破する必要があります。
Auto Mode なしでの Opus 5 の成功率はいくらか?
Auto Mode なしでは、Opus 5 のブラウザベースのプロンプトインジェクション成功率は 3.7%、一般的なプロンプトインジェクション攻撃は 15 回の試行後に 2.0% の成功率となります。テストされたモデルの中でも最良ですが、Auto Mode を有効にした場合の 0% より大幅に高くなります。

「大規模言語モデル」の最新ニュースを、毎朝7時にお届けします

AIが要約して、あなたの選んだトピックだけを1日1通。LINE・Email・Slackで届きます。

登録無料・30秒で完了・いつでも解除できます

ディスカッション

まだコメントがありません。最初のコメントを投稿しましょう!

ログインして議論に参加

関連記事

AIニュースを毎日お届け

200以上のソースから厳選したAIニュースを毎日無料でお届けします。

無料で始める

登録無料・30秒で完了・いつでも解除できます