
OpenAIは自社システムの脆弱性を発見するよう設計された自動化AI「GPT-Red」をリリースしました。
テストにおいて、GPT-Redは未検証シナリオへのプロンプトインジェクション攻撃で84%の成功率を達成し、人間のセキュリティテスターの13%を大きく上回りました。
同社はこの自動化されたレッドチーミング手法を用いて最新モデル「GPT-5.6 Sol」を訓練し、最も難しいダイレクトプロンプトインジェクションベンチマークの失敗率を4ヶ月前の最高製品モデルの6分の1となる0.05%にまで低下させました。
何が起きたか
OpenAIは7月15日、自社モデルの脆弱性を自動で発見するAI「GPT-Red」を発表しました。人間のレッドチーマー(セキュリティテスター)による攻撃成功率が13%だったのに対し、GPT-Redは84%のシナリオで攻撃に成功しました。
なぜ重要か
人間による脆弱性検査は時間がかかり大規模に実施しにくく、モデルを堅牢にするのに必要な量と多様性の攻撃データを生成できません。GPT-Redはこの課題を自動化・大規模化し、最新モデル「GPT-5.6 Sol」は最難関のプロンプトインジェクションベンチマークで失敗率を4カ月前の6分の1に低下させました。
注目点
GPT-Redは社内専用モデルとし、訓練した攻撃能力が悪意ある者の手に渡らないようにします。詳細を記した査読前論文は今週後半に公開される予定です。
OpenAIによるGPT-Redの発表は、AI企業がセキュリティ検証にどのようにアプローチするかの転換を反映しています。人間の専門家によるレッドチーミングは労働集約的であり、モデルのロバスト性を大幅に改善するのに必要な攻撃データの量と多様性を生成することができません。自己対戦で訓練されたAI対手によるこのプロセスの自動化を通じて、OpenAIは「セーフティフライホイール」と呼ぶものを作成することを目指しています。これは今日のモデルが明日のモデルをより復元力のあるものにする循環です。同社は計算リソースを安全性に費やしました。これは最大の学習後努力に相当する量です。
OpenAIオフィスのAI自動販売機エージェントでの実世界テストでは、実際の利害が示されました。GPT-Redは以前の防御が検出しなかった3つの悪意のある目標(価格操作、注文詐欺、注文キャンセル)を達成しました。この発見はGPT-5.6 Solの訓練にフィードバックされ、プロンプトインジェクションベンチマークで劇的に低い失敗率を示すようになりました。同社は、モデル能力を低下させることなくロバスト性が向上したことを強調しています。防御的すぎるモデルはしばしば有用性が低下するため、これは重要な区別です。GPT-Redを社内に保持し、査読論文を公開する予定にすることで、OpenAIは透明性とセキュリティのバランスを取ろうとしており、研究コミュニティがこの成果から学ぶことができる一方で、攻撃ツールが拡散するのを防いでいます。
たとえば、いま届くならこの3本です
AIが要約して、あなたの選んだトピックだけを1日1通。LINE・Email・Slackで届きます。
登録無料・30秒で完了・いつでも解除できますAITodayについて →
この記事についてわからないことをAIに質問できます。Q&Aはこのページに公開され、他の読者も読めます。
イスラエルの新興企業DataAgent Ltd.は、顧客のKubernetesクラスター内の本番障害を修復するプラットフォームを発表し、1000万ドルのプレシード資金を調達した
SK海力士はSEMICON Taiwan 2026で、ベースダイに演算機能を組み込んだカスタムHBMの構想を発表

桃園はAIデータセンター(AIDC)の北部ハブとして自らを位置づけ、大潭地区とLNG冷却の利点を挙げている

米国防総省は8月31日、AIプラットフォーム「GenAI.mil」にOpenAIのChatGPTを軍事用にカスタマイズした「ChatGPT Mil」を導入したと発表した

エヌビディアの決算は注目に値する一方で退屈な内容となり、統合された世界を避ける姿勢が反映された

AnthropicがNvidia支援のクラウド事業者Lambdaと、$35bnのクラウドコンピューティング契約を結んだ
