
OpenAI は GPT-Red という内部 AI モデルを開発した。
これはプロンプトインジェクション攻撃などをシミュレートして GPT システムのセキュリティ欠陥を自動的に検出し、悪用可能な脆弱性の発見成功率は 84% に達し、人間のレッドチームの 13% をはるかに上回る。
この知見はモデル訓練に直結しており、GPT-5.6 Sol は 4ヶ月前のモデルと比べて直接的なプロンプトインジェクション攻撃による障害が 6 倍少ないが、より高度な攻撃の約 3.8% は依然として成功する可能性があり、決意した攻撃者は大規模な試行でシステムを突破できる。
何が起きたか
OpenAI は GPT-Red という内部 AI を構築し、プロンプトインジェクションなどの攻撃をシミュレートして GPT モデルのセキュリティ脆弱性を自動的に探索する。自己対戦強化学習で訓練された GPT-Red は、テストシナリオの 84% で悪用可能な欠陥の発見に成功し、人間のレッドチームの 13% を大きく上回った。1つのテストでは、OpenAI のオフィスの AI 対応自動販売機を操作して価格を変更し、他の顧客の注文をキャンセルした。
なぜ重要か
このテスト結果は次世代モデルの訓練に直結する。GPT-5.6 Sol は、4ヶ月前の最高性能モデル比で直接的なプロンプトインジェクション攻撃による障害を 6 倍削減しており、一般的なパフォーマンスは低下していない。これは AI 駆動型セキュリティテストが人間の努力よりも圧倒的に効果的であり、これらのシステムが機密タスクを扱う中で重要な懸念事項である敵対的攻撃からモデルを強化する点を示唆している。
注目点
GPT-5.6 Sol では「強度の高い」プロンプトインジェクション攻撃の約 3.8% が依然として成功しており、数百~数千回の試行規模では相当数の攻撃が突破する可能性がある。これは Claude Opus 4.5 と同等の状況である。GPT-Red は内部用のままであり、OpenAI は詳細な論文を発表する予定としている。
OpenAI の AI セキュリティへのアプローチは、従来の人間主導のレッドチームから敵対的機械学習へのシフトを示している。GPT-Red を自己対戦強化学習で訓練することで—攻撃モデルと防御モデルが反復的に互いに進化する—OpenAI は人間のテスターが達成できるはるかを超えたプロセスを創出した。GPT-Red の 84% の攻撃成功率対人間の 13% は実質的な効率ギャップを明かしており、人間のレッドチームは価値があるとはいえ、敵対的空間を徹底的かつ迅速に探索することはできない。
GPT-5.6 Sol の具体的な改善は、このテスト体制が本番環境のモデルで測定可能なセキュリティ向上に転換されることを示している。直接的なプロンプトインジェクションの障害が 6 倍削減されることは実質的な強化を表し、モデルの一般的な機能を損なわずに達成されており、防御への過適合は有用性を損傷させるため重要な制約である。しかし 3.8% の成功率の持続性は、プロンプトインジェクションが最先端においても部分的に未解決の問題であることを示唆している。Claude Opus 4.5 との比較は、この残存する脆弱性が OpenAI のアプローチに固有ではなく、主要モデル全体に共通する課題を反映していることを示唆している。
たとえば、いま届くならこの3本です
AIが要約して、あなたの選んだトピックだけを1日1通。LINE・Email・Slackで届きます。
登録無料・30秒で完了・いつでも解除できますAITodayについて →
この記事についてわからないことをAIに質問できます。Q&Aはこのページに公開され、他の読者も読めます。
水曜日のエヌビディア決算で、投資家の間でその強みがGPUだけにとどまらないとの見方が広がった

クリアウェイ・エナジー・グループは、Alphabet傘下のGoogleとデータセンター向けに約1.2GWの電力を供給する長期電力購入契約(PPA)を3件締結した

CMEグループは規制当局の承認を条件に、エヌビディアのH100およびB200グラフィックスプロセッサの時間貸し料金に連動する先物を10月5日に上場する計画

Googleの研究者が、AIエージェントに過去の失敗や成功した戦略を永続的に記憶させるフレームワーク「WikiSkill」を発表した

2026年7月30日から8月4日にかけて実施されたYouGovの調査(米国の労働者1,250人対象)で、2023年以降にAIが原因で失職したと答えた人はわずか約3%だった

MetaやGoogleなど大手が公開する大規模言語モデル(LLM、テキストを理解・生成するAI)の多くが、今や無料でダウンロードでき、自分のパソコン上で動かせる
