
OpenAIは他の言語モデルを自動的に攻撃してセキュリティの脆弱性を見つけるよう訓練された攻撃モデル「GPT-Red」を開発しました。
これにより反復的な対抗関係を通じて防御を強化できます。
OpenAIがGPT-Redの最も強力な攻撃をGPT-5.6に対してテストした結果、昨年のGPT-5では90%以上の成功率が23%未満にまで低下し、モデルの複雑化と外部ツールおよびエージェントとの統合が進むなかで、より堅牢なAIシステム構築に向けたこのアプローチの有効性が実証されました。
何が起きたか
OpenAIが「GPT-Red」と呼ばれるLLM攻撃モデルを開発しました。このモデルは他のLLMのサイバー防御を高めるための訓練相手として機能します。セルフプレイ・ループで何度も対戦を繰り返すうちに、GPT-Redは攻撃能力を、相手モデルは防御能力を高めていきました。
なぜ重要か
LLMはWebサイトやコード、他のエージェントと連携する複雑なAIエージェントとして使われるようになり、人間チームだけで起こり得るあらゆる攻撃に対応し続けることが難しくなっています。GPT-Redは「プロンプト・インジェクション」などの新たな攻撃手法を自動で発見できるため、より堅牢なモデルの開発が可能になります。
注目点
OpenAIがGPT-Redの攻撃を自社モデルに試した結果、2024年8月リリースのGPT-5では90%以上が成功した一方、新版GPT-5.6では成功率は23%未満に低下しました。ただしGPT-Redは人間のレッドチーマーを完全に置き換えるものではなく、人間が見逃す攻撃がある一方、GPT-Redも画像経由のプロンプト・インジェクション攻撃には十分対応していません。
OpenAIによるGPT-Redの開発は、大規模言語モデルがより高度化し広く展開される中で、AI安全テストの根本的な転換を反映しています。従来、セキュリティ脆弱性を発見するレッドチーミング活動は人間のテスター頼りでしたが、LLMの複雑さの増加と、Webブラウザやコードエディタ、他のAIエージェントといった外部システムとの統合が進むにつれて、人間だけでの包括的なテストはますます困難になっています。OpenAIが採用したセルフプレイ・ループアプローチでは、GPT-Redが他のモデルを繰り返し攻撃する一方でそれらは防御を強化し、攻撃者と防御者の能力が共進化するトレーニングの場が生まれます。これはサイバーセキュリティにおける競争力学を映し出しており、防御側はまだ発明されていない攻撃に先制的に備える必要があります。
「Fake Chain of Thought」攻撃は、自動化が必要とされる理由を示す好例です。この攻撃は、現代のLLMが問題解決時に内部的に使用する仕組み(思考過程の記録)を悪用するもので、そうした攻撃を発見するにはモデル自体のロジックを理解する必要があります。OpenAIが2025年の実験を再現したところ、人間のレッドチーマーがGPT-5の脆弱性を発見したのと同じタスクで、GPT-Redは人間テスターよりも効果的な攻撃を発見しました。これは、攻撃空間の自動探索が特定の領域ではより徹底的である可能性を示唆しています。ただし、本文は人間の専門知識を置き換えることはGPT-Redの意図ではないことを明確にしています。人間テスターはGPT-Redが見逃す攻撃を見つけられ、その逆も同様であり、最も効果的なアプローチは両者を組み合わせることです。
たとえば、いま届くならこの3本です
AIが要約して、あなたの選んだトピックだけを1日1通。LINE・Email・Slackで届きます。
登録無料・30秒で完了・いつでも解除できますAITodayについて →
この記事についてわからないことをAIに質問できます。Q&Aはこのページに公開され、他の読者も読めます。
オープンAIのサム・アルトマンCEOはタイム誌のインタビューで、AIモデル開発を「減速する良い時期」と述べた

マスターカードのマイケル・ミーバックCEOは、AI主導の商業と機械間決済を支える新プロトコル「Agent Pay」と、大手ステーブルコインプラットフォームBVNKの買収について説明した

Anthropicは木曜日、研究プレビューとしてModel Hardware Standard(MHS)を公開した

AI編集スタートアップの元社員が、同社がAIツールで原稿を編集し、人間が読まないこともしばしばだったと証言

NECは9月に「NEC SCM AIエージェント」を発売すると発表した

KDDIとみちのりホールディングスは2026年9月1日から茨城県日立市で、自動運転バスの5G品質をAIで自律最適化する実証実験を開始する
