AIToday
大規模言語モデルAIビジネス・産業THE DECODER掲載日時: 2026年7月25日 22:003分で読める

Opus 5、プロンプトインジェクション攻撃を完全防止

LINEで送る
Opus 5、プロンプトインジェクション攻撃を完全防止

3つのポイント

  1. 何が起きたか

    Anthropic の Opus 5 モデルは、Claude Cowork などの製品で Auto Mode を有効にした場合、129 のブラウザベースのプロンプトインジェクションテストシナリオ全体で 0% の攻撃成功率を達成しました。セキュリティ企業 Gray Swan による一般的なプロンプトインジェクションテストでは、Opus 5 の攻撃成功率は 15 回の試行後に 2.0% に低下し、Opus 4.8 の 5.5% から改善され、Gray Swan IPI ベンチマークで首位となりました。

  2. なぜ重要か

    攻撃者が隠された指令を AI の入力に紛れ込ませてセーフティガード機能を回避するプロンプトインジェクションは、ウェブベースのタスクを処理する AI エージェントの継続的なセキュリティ問題でした。OpenAI は 12 月にこの脆弱性は完全には解決されない可能性があると認めており、実世界のシナリオでのこの急速な改善は、ユーザーが制御するコンテンツとウェブサイトと相互作用する AI を展開する組織にとって重要です。

  3. 注目点

    0% の成功率には Auto Mode の両方の防御メカニズムが必要です。処理前に隠された指令をスキャンするレイヤーと、実行前に危険なアクションをブロックする別のレイヤーです。Auto Mode なしでは、Opus 5 のブラウザインジェクション成功率は 3.7% となり、モデル単独ではリスクを排除できず、保護ソフトウェアラッパーが不可欠であることが強調されます。

この記事についてAIに質問する →

こういう要約が、毎朝あなたのメールに届きます。

背景と解説

プロンプトインジェクションは AI 展開における最も難しいセキュリティ問題の 1 つとして浮上しており、特にウェブページとユーザーが制御する入力と相互作用する必要のある自律型エージェントに当てはまります。AI エージェントがウェブページを読む場合、攻撃者は隠されたテキストまたは工作されたプロンプトを埋め込み、モデルに元の指令を無視させることができます。例えば、データを盗んだり、意図しないアクションを実行させたりできます。この脆弱性は、モデル自身が正当な入力と悪意のある指令を確実に区別する必要があるため、ほぼ解決不可能です。攻撃者がより創意工夫するにつれて、このタスクはさらに困難になります。

Opus 5 を使用した Anthropic のアプローチは、モデルが免疫を持っていると主張するのではなく、保護ソフトウェア(Auto Mode)でラップすることで異なるレイヤーで問題に対処しています。最初のレイヤーはモデルに到達する前に隠された指令をキャッチし、2 番目のレイヤーはインジェクションが成功した場合でも危険なアクションを防ぎます。攻撃者が両方を独立して突破することを要求することで、組み合わせたシステムは実世界のブラウザシナリオで完全に近い防御を達成します。このレイヤード防御は重要です。OpenAI が 12 月に認めたように、モデル自体の堅牢性のみに依存することは十分でない可能性があるためです。

よくある質問
プロンプトインジェクションとは何か、AI エージェントにとってなぜ重要か?
プロンプトインジェクションは、攻撃者が AI モデルの入力に隠されたテキストまたは指令を紛れ込ませてセーフティガイドラインを回避する攻撃です。ウェブコンテンツと相互作用するブラウザエージェントにとって、これは重大なセキュリティ欠陥となっており、OpenAI は 12 月にプロンプトインジェクションが完全には解決されない可能性があると認めました。
Auto Mode はプロンプトインジェクションにどのように対抗するか?
Auto Mode は 2 つの独立した防御レイヤーを使用します。1 つはモデルが処理する前に受信データをスキャンして隠された指令を検出し、もう 1 つは実行前に危険なアクションをブロックします。インジェクションが成功するには、攻撃者は両方のレイヤーを独立して突破する必要があります。
Auto Mode なしでの Opus 5 の成功率はいくらか?
Auto Mode なしでは、Opus 5 のブラウザベースのプロンプトインジェクション成功率は 3.7%、一般的なプロンプトインジェクション攻撃は 15 回の試行後に 2.0% の成功率となります。テストされたモデルの中でも最良ですが、Auto Mode を有効にした場合の 0% より大幅に高くなります。
LINEで送る

「大規模言語モデル」の最新ニュースを、毎朝7時にお届けします

たとえば、いま届くならこの3本です

  • Nvidia、次は従業員4万人にエージェント400万体Yahoo Finance AI · 5時間前
  • Nvidia、Anthropicに1000億ドル投資協議Yahoo Finance AI · 5時間前
  • KAIST、AI推論段階の分離可能と判明THE DECODER · 5時間前

AIが要約して、あなたの選んだトピックだけを1日1通。LINE・Email・Slackで届きます。

登録無料・Googleアカウントなら30秒・いつでも解除できますAITodayについて →

AIに質問

この記事についてわからないことをAIに質問できます。Q&Aはこのページに公開され、他の読者も読めます。

関連記事

次の記事へAIエージェント向け軽量サンドボックスツール