AIToday
大規模言語モデルAIビジネス・産業MIT Technology Review AI掲載日時: 2026年7月16日 4:005分で読める

OpenAI、GPT-Redで防御強化

LINEで送る
OpenAI、GPT-Redで防御強化

要点

  • OpenAI は GPT-Red を開発した。これはデプロイ前にセキュリティの脆弱性を見つけてパッチを当てるために、他の AI システムを攻撃するよう訓練された AI モデルだ。

  • GPT-Red が攻撃を試み、他のモデルが防御を練習する自己対戦訓練ループを使用することで、OpenAI は新しい攻撃タイプ(特に「フェイク思考の連鎖」注入)を発見した。最新フラッグシップモデルである GPT-5.6 は現在、これらの攻撃の 77% 以上をブロックするが、前バージョンではわずか 10% だった。

  • このアプローチにより、AI モデルがより複雑になり、コード編集やウェブブラウジングなどリスクの高い実世界の設定で使用されるようになるにつれて、OpenAI は安全性テストとの歩調を合わせることができる。

3つのポイント

  1. 何が起きたか

    OpenAI は GPT-Red を開発した。これは自己対戦ループで他の AI モデルを攻撃するよう訓練された LLM で、GPT-5.6 の防御強化に使用された。このモデルは「フェイク思考の連鎖」注入を含む新しい攻撃タイプを発見した。これはモデルを偽造情報に基づいて行動させるものだ。2025 年に人間のテスターが前バージョンの GPT-5 に対して実施した同じレッドティーミングタスクでテストすると、GPT-Red は人間よりも効果的な攻撃の発見に成功した。

  2. なぜ重要か

    LLM がより高度になり、ファイル、ウェブサイト、コードと相互作用するエージェントとして展開されるにつれて、人間のレッドティーミングチームだけでは拡大する攻撃対象領域に対応できない。GPT-Red はこの安全性評価を大規模で自動化する。OpenAI の調査では、GPT-Red の最強攻撃の 23% 未満が GPT-5.6 に対して機能したのに対し、昨年 8 月にリリースされた GPT-5 に対しては 90% 以上が機能した。このアプローチがリリース前にモデルの堅牢性を測定可能に改善できることを示している。

  3. 注目点

    GPT-Red には制限がある。往復的な会話攻撃や、人間のテスターが得意とするイメージベースのプロンプト注入に苦労している。OpenAI は GPT-Red が人間のレッドティーマーを補足するもので、置き換えるものではないと述べており、このようなシステムを訓練するために必要な高い計算コストを理由に、このモデル自体はリリースしない予定だ。

この記事についてAIに質問する →

背景と解説

OpenAI による GPT-Red の開発は、AI 安全性における根本的な課題を反映している。言語モデルがより高度になり、コード、ウェブサイト、外部システムと相互作用するエージェントなど、ますます複雑な実世界シナリオにデプロイされるにつれて、潜在的な攻撃の範囲は従来の人間主導のテストが対応できるよりも速く拡大する。同社の共同創設者である Nikhil Kandpal と Dylan Hunn は、これを攻撃対象領域の拡大と影響範囲の拡大の両方の問題として位置づけている。OpenAI は、人間のレッドティーミングチームを無限に拡大するのではなく、自己対戦訓練ループを使用して GPT-Red を設計した。これは攻撃モデルと防御モデルが互いに反復的に改善される技法であり、他の分野で見られる競争訓練ダイナミクスを反映している。このアプローチにより、人間のテスターが思いつかない可能性があった新しい攻撃ベクトルを発見できる。

具体的な結果は、このメソッドの価値を支持している。GPT-5.6 が GPT-Red が発見した最強の攻撃に対してテストされた際、成功率は 23% 未満だった。昨年 8 月にリリースされた前バージョンの GPT-5 に対しては 90% 以上の成功率があったため、劇的な低下である。バージョン全体での堅牢性における測定可能な改善は、レッドティーミングプロセスが実行可能な防御改善をもたらしたことを示している。特に、GPT-Red は研究者がこれまで出会ったことのない攻撃タイプ(思考の連鎖の注入をめぐるフェイクなど)を発見した。これはモデルの入力処理だけでなく、推論プロセス自体を悪用している。このような新規攻撃の発見は、大規模での自動レッドティーミングの価値を強調している。

よくある質問

GPT-Red が発見した「フェイク思考の連鎖」攻撃とは何か?
思考の連鎖とは、LLM が自分自身にメモを取り、問題解決中に部分的な結果を追跡する日記である。GPT-Red は別のモデルの思考の連鎖に偽造エントリを挿入して、偽造情報に基づいて行動させる方法を見つけた。例えば、モデルに 1+1=3 であり、既にこれを検証したと告げることで、モデルは偽の事実を受け入れて使用するようになる。
GPT-Red は人間のレッドティーマーよりもどの程度攻撃の発見に効果的か?
OpenAI が 2025 年の実験を再実行した際、人間のレッドティーマーが GPT-5 の前バージョンの弱点を見つけようとしたが、GPT-Red は人間よりも効果的な攻撃の発見に成功した。同社は Vendy 自動販売機エージェントに対しても GPT-Red をテストし、商品価格を変更し顧客注文をキャンセルするようハッキングできた。
OpenAI がなぜ GPT-Red をリリースしないのか?
OpenAI は GPT-Red をリリースしておらず、このスーパーハッカーが誰かがコピーキャット版を作成しようとするモデルよりも強力であると確信している。研究者たちは 1 年以上このモデルに取り組んでおり、世界で最も裕福な企業の 1 つの計算リソースを活用している。これは「他の誰かが簡単にできるような些細なものではない」。
MIT Technology Review AI元記事を読む
LINEで送る

「大規模言語モデル」の最新ニュースを、毎朝7時にお届けします

たとえば、いま届くならこの3本です

  • オープンAI CEO、安全上の失敗受け開発減速を提言Yahoo Finance AI · 7時間前
  • マスターカードCEO、AI決済で商業変革へTop Companies AI · 10時間前
  • AI編集者の告白、実作業はツール任せTop Companies AI · 10時間前

AIが要約して、あなたの選んだトピックだけを1日1通。LINE・Email・Slackで届きます。

登録無料・30秒で完了・いつでも解除できますAITodayについて →

AIに質問

この記事についてわからないことをAIに質問できます。Q&Aはこのページに公開され、他の読者も読めます。

関連記事

中国、AIラック向け液冷の国家標準を初制定

中国がデータセンター向け液冷の国家標準を初めて発表

NEWDIGITIMES Asia4時間前

OpenAI、11月12日にCursor向け提供終了

OpenAIは8月28日、AIコーディングツールCursorへのモデル提供契約を終了すると発表し、終了日として11月12日を提案した

ITmedia AI+7時間前

AIメモリー需要、HBM以外にも拡大=バーンスタイン

バーンスタインのアナリストは、AIがメモリーのボトルネックを生み出しており、需要が高帯域幅メモリー(HBM)から従来型DRAM、NANDフラッシュ、ストレージへ拡大していると指摘

Yahoo Finance AI7時間前

オープンAI CEO、安全上の失敗受け開発減速を提言

オープンAIのサム・アルトマンCEOはタイム誌のインタビューで、AIモデル開発を「減速する良い時期」と述べた

Yahoo Finance AI7時間前

エヌビディア、GPU超えシステム全般で優位に

エヌビディアの水曜決算は、GPUだけでなく、データ処理を最大3倍高速化するVera CPUなど周辺システムにも強みがあることを示した

Top Companies AI10時間前

マーベル株8%安、好業績も粗利益率見通しで

マーベル・テクノロジーは2027年度第2四半期の売上高が過去最高の27億3900万ドル(前年比37%増)に達し、2027年度通期見通しも約120億ドルに引き上げた

Top Companies AI10時間前
次の記事へOpenAI出身者のThinking Machines Lab、初モデル「Inkling」をリリース