AIToday
大規模言語モデルMITテクノロジーレビュー掲載日時: 2026年7月16日 6:004分で読める

OpenAI、防御強化用攻撃モデル「GPT-Red」開発

LINEで送る
OpenAI、防御強化用攻撃モデル「GPT-Red」開発

要点

  • OpenAIは他の言語モデルを自動的に攻撃してセキュリティの脆弱性を見つけるよう訓練された攻撃モデル「GPT-Red」を開発しました。

  • これにより反復的な対抗関係を通じて防御を強化できます。

  • OpenAIがGPT-Redの最も強力な攻撃をGPT-5.6に対してテストした結果、昨年のGPT-5では90%以上の成功率が23%未満にまで低下し、モデルの複雑化と外部ツールおよびエージェントとの統合が進むなかで、より堅牢なAIシステム構築に向けたこのアプローチの有効性が実証されました。

3つのポイント

  1. 何が起きたか

    OpenAIが「GPT-Red」と呼ばれるLLM攻撃モデルを開発しました。このモデルは他のLLMのサイバー防御を高めるための訓練相手として機能します。セルフプレイ・ループで何度も対戦を繰り返すうちに、GPT-Redは攻撃能力を、相手モデルは防御能力を高めていきました。

  2. なぜ重要か

    LLMはWebサイトやコード、他のエージェントと連携する複雑なAIエージェントとして使われるようになり、人間チームだけで起こり得るあらゆる攻撃に対応し続けることが難しくなっています。GPT-Redは「プロンプト・インジェクション」などの新たな攻撃手法を自動で発見できるため、より堅牢なモデルの開発が可能になります。

  3. 注目点

    OpenAIがGPT-Redの攻撃を自社モデルに試した結果、2024年8月リリースのGPT-5では90%以上が成功した一方、新版GPT-5.6では成功率は23%未満に低下しました。ただしGPT-Redは人間のレッドチーマーを完全に置き換えるものではなく、人間が見逃す攻撃がある一方、GPT-Redも画像経由のプロンプト・インジェクション攻撃には十分対応していません。

この記事についてAIに質問する →

背景と解説

OpenAIによるGPT-Redの開発は、大規模言語モデルがより高度化し広く展開される中で、AI安全テストの根本的な転換を反映しています。従来、セキュリティ脆弱性を発見するレッドチーミング活動は人間のテスター頼りでしたが、LLMの複雑さの増加と、Webブラウザやコードエディタ、他のAIエージェントといった外部システムとの統合が進むにつれて、人間だけでの包括的なテストはますます困難になっています。OpenAIが採用したセルフプレイ・ループアプローチでは、GPT-Redが他のモデルを繰り返し攻撃する一方でそれらは防御を強化し、攻撃者と防御者の能力が共進化するトレーニングの場が生まれます。これはサイバーセキュリティにおける競争力学を映し出しており、防御側はまだ発明されていない攻撃に先制的に備える必要があります。

「Fake Chain of Thought」攻撃は、自動化が必要とされる理由を示す好例です。この攻撃は、現代のLLMが問題解決時に内部的に使用する仕組み(思考過程の記録)を悪用するもので、そうした攻撃を発見するにはモデル自体のロジックを理解する必要があります。OpenAIが2025年の実験を再現したところ、人間のレッドチーマーがGPT-5の脆弱性を発見したのと同じタスクで、GPT-Redは人間テスターよりも効果的な攻撃を発見しました。これは、攻撃空間の自動探索が特定の領域ではより徹底的である可能性を示唆しています。ただし、本文は人間の専門知識を置き換えることはGPT-Redの意図ではないことを明確にしています。人間テスターはGPT-Redが見逃す攻撃を見つけられ、その逆も同様であり、最も効果的なアプローチは両者を組み合わせることです。

よくある質問

GPT-Redが研究者たちが以前見たことのない特定の攻撃手法をどのように発見したか?
GPT-Redは「Fake Chain of Thought」と呼ばれる新しいプロンプト・インジェクション攻撃を発見しました。これは別のモデルの思考過程の記録に虚偽の情報を書き込み、モデルをだまして虚偽の情報を信じさせて行動させるものです。
OpenAIはGPT-Redを公開するか?
いいえ。OpenAIはGPT-Redを公開する予定はなく、模倣モデルよりもはるかに強力だと考えています。研究チームは1年以上かけて膨大な計算リソースを使用して開発しました。
GPT-Redと人間のレッドチーマーの違いは何か?
GPT-Redは、攻撃者と標的の間で何度もやり取りが繰り返される攻撃の設計が得意ではありません。人間の攻撃者は容易にこうした攻撃を行えます。また、テキストをモデルに渡すために画像を使用するプロンプト・インジェクション攻撃にもまだ十分対応していません。
MITテクノロジーレビュー元記事を読む
LINEで送る

「大規模言語モデル」の最新ニュースを、毎朝7時にお届けします

たとえば、いま届くならこの3本です

  • オープンAI CEO、安全上の失敗受け開発減速を提言Yahoo Finance AI · 10時間前
  • マスターカードCEO、AI決済で商業変革へTop Companies AI · 13時間前
  • AI編集者の告白、実作業はツール任せTop Companies AI · 13時間前

AIが要約して、あなたの選んだトピックだけを1日1通。LINE・Email・Slackで届きます。

登録無料・30秒で完了・いつでも解除できますAITodayについて →

AIに質問

この記事についてわからないことをAIに質問できます。Q&Aはこのページに公開され、他の読者も読めます。

関連記事

次の記事へSandler PartnersとLiminal、エンタープライズAIガバナンスで提携