AIToday
大規模言語モデルAIビジネス・産業ITmedia AI+掲載日時: 2026年7月16日 13:013分で読める

OpenAI、自動攻撃AIで脆弱性検出 成功率84%

LINEで送る
OpenAI、自動攻撃AIで脆弱性検出 成功率84%

要点

  • OpenAIは自社システムの脆弱性を発見するよう設計された自動化AI「GPT-Red」をリリースしました。

  • テストにおいて、GPT-Redは未検証シナリオへのプロンプトインジェクション攻撃で84%の成功率を達成し、人間のセキュリティテスターの13%を大きく上回りました。

  • 同社はこの自動化されたレッドチーミング手法を用いて最新モデル「GPT-5.6 Sol」を訓練し、最も難しいダイレクトプロンプトインジェクションベンチマークの失敗率を4ヶ月前の最高製品モデルの6分の1となる0.05%にまで低下させました。

3つのポイント

  1. 何が起きたか

    OpenAIは7月15日、自社モデルの脆弱性を自動で発見するAI「GPT-Red」を発表しました。人間のレッドチーマー(セキュリティテスター)による攻撃成功率が13%だったのに対し、GPT-Redは84%のシナリオで攻撃に成功しました。

  2. なぜ重要か

    人間による脆弱性検査は時間がかかり大規模に実施しにくく、モデルを堅牢にするのに必要な量と多様性の攻撃データを生成できません。GPT-Redはこの課題を自動化・大規模化し、最新モデル「GPT-5.6 Sol」は最難関のプロンプトインジェクションベンチマークで失敗率を4カ月前の6分の1に低下させました。

  3. 注目点

    GPT-Redは社内専用モデルとし、訓練した攻撃能力が悪意ある者の手に渡らないようにします。詳細を記した査読前論文は今週後半に公開される予定です。

この記事についてAIに質問する →

背景と解説

OpenAIによるGPT-Redの発表は、AI企業がセキュリティ検証にどのようにアプローチするかの転換を反映しています。人間の専門家によるレッドチーミングは労働集約的であり、モデルのロバスト性を大幅に改善するのに必要な攻撃データの量と多様性を生成することができません。自己対戦で訓練されたAI対手によるこのプロセスの自動化を通じて、OpenAIは「セーフティフライホイール」と呼ぶものを作成することを目指しています。これは今日のモデルが明日のモデルをより復元力のあるものにする循環です。同社は計算リソースを安全性に費やしました。これは最大の学習後努力に相当する量です。

OpenAIオフィスのAI自動販売機エージェントでの実世界テストでは、実際の利害が示されました。GPT-Redは以前の防御が検出しなかった3つの悪意のある目標(価格操作、注文詐欺、注文キャンセル)を達成しました。この発見はGPT-5.6 Solの訓練にフィードバックされ、プロンプトインジェクションベンチマークで劇的に低い失敗率を示すようになりました。同社は、モデル能力を低下させることなくロバスト性が向上したことを強調しています。防御的すぎるモデルはしばしば有用性が低下するため、これは重要な区別です。GPT-Redを社内に保持し、査読論文を公開する予定にすることで、OpenAIは透明性とセキュリティのバランスを取ろうとしており、研究コミュニティがこの成果から学ぶことができる一方で、攻撃ツールが拡散するのを防いでいます。

よくある質問

プロンプトインジェクションとは何か、そしてなぜ重要なのか?
プロンプトインジェクションは、悪意のあるコマンドをAIモデルに送られる指示の中に隠す攻撃です。GPT-Redはこれらの脆弱性を発見することに特化しており、導入前に修正できるようにします。
GPT-Redはどのようにして効果的に攻撃することを学ぶのか?
GPT-Redは自己対戦強化学習を使用し、複数の防御言語モデルに対して同時に訓練します。攻撃側は成功したインジェクションで報酬を得、防御側は攻撃に抵抗し元のタスクを完了することで報酬を得ます。これにより、両者がより強くなっていく循環が生まれます。
OpenAIはGPT-Redを公開リリースするか?
いいえ。GPT-Redは社内専用モデルとして保管され、導入モデルから分離されており、訓練された攻撃能力が悪意のある者の手に渡らないようにします。
ITmedia AI+元記事を読む
LINEで送る

「大規模言語モデル」の最新ニュースを、毎朝7時にお届けします

たとえば、いま届くならこの3本です

  • DataAgentが1000万ドル調達、Kubernetes障害を自動修復SiliconANGLE AI · 3時間前
  • SK海力士定制HBM推升推理性能5.15倍DIGITIMES Asia · 3時間前
  • エヌビディア決算、統合回避戦略で退屈な内容にStratechery (Ben Thompson) · 3時間前

AIが要約して、あなたの選んだトピックだけを1日1通。LINE・Email・Slackで届きます。

登録無料・30秒で完了・いつでも解除できますAITodayについて →

AIに質問

この記事についてわからないことをAIに質問できます。Q&Aはこのページに公開され、他の読者も読めます。

関連記事

次の記事へロボット大手、NVIDIAコンソーシアムに参加