
OpenAI は GPT-Red を開発した。これはデプロイ前にセキュリティの脆弱性を見つけてパッチを当てるために、他の AI システムを攻撃するよう訓練された AI モデルだ。
GPT-Red が攻撃を試み、他のモデルが防御を練習する自己対戦訓練ループを使用することで、OpenAI は新しい攻撃タイプ(特に「フェイク思考の連鎖」注入)を発見した。最新フラッグシップモデルである GPT-5.6 は現在、これらの攻撃の 77% 以上をブロックするが、前バージョンではわずか 10% だった。
このアプローチにより、AI モデルがより複雑になり、コード編集やウェブブラウジングなどリスクの高い実世界の設定で使用されるようになるにつれて、OpenAI は安全性テストとの歩調を合わせることができる。
何が起きたか
OpenAI は GPT-Red を開発した。これは自己対戦ループで他の AI モデルを攻撃するよう訓練された LLM で、GPT-5.6 の防御強化に使用された。このモデルは「フェイク思考の連鎖」注入を含む新しい攻撃タイプを発見した。これはモデルを偽造情報に基づいて行動させるものだ。2025 年に人間のテスターが前バージョンの GPT-5 に対して実施した同じレッドティーミングタスクでテストすると、GPT-Red は人間よりも効果的な攻撃の発見に成功した。
なぜ重要か
LLM がより高度になり、ファイル、ウェブサイト、コードと相互作用するエージェントとして展開されるにつれて、人間のレッドティーミングチームだけでは拡大する攻撃対象領域に対応できない。GPT-Red はこの安全性評価を大規模で自動化する。OpenAI の調査では、GPT-Red の最強攻撃の 23% 未満が GPT-5.6 に対して機能したのに対し、昨年 8 月にリリースされた GPT-5 に対しては 90% 以上が機能した。このアプローチがリリース前にモデルの堅牢性を測定可能に改善できることを示している。
注目点
GPT-Red には制限がある。往復的な会話攻撃や、人間のテスターが得意とするイメージベースのプロンプト注入に苦労している。OpenAI は GPT-Red が人間のレッドティーマーを補足するもので、置き換えるものではないと述べており、このようなシステムを訓練するために必要な高い計算コストを理由に、このモデル自体はリリースしない予定だ。
OpenAI による GPT-Red の開発は、AI 安全性における根本的な課題を反映している。言語モデルがより高度になり、コード、ウェブサイト、外部システムと相互作用するエージェントなど、ますます複雑な実世界シナリオにデプロイされるにつれて、潜在的な攻撃の範囲は従来の人間主導のテストが対応できるよりも速く拡大する。同社の共同創設者である Nikhil Kandpal と Dylan Hunn は、これを攻撃対象領域の拡大と影響範囲の拡大の両方の問題として位置づけている。OpenAI は、人間のレッドティーミングチームを無限に拡大するのではなく、自己対戦訓練ループを使用して GPT-Red を設計した。これは攻撃モデルと防御モデルが互いに反復的に改善される技法であり、他の分野で見られる競争訓練ダイナミクスを反映している。このアプローチにより、人間のテスターが思いつかない可能性があった新しい攻撃ベクトルを発見できる。
具体的な結果は、このメソッドの価値を支持している。GPT-5.6 が GPT-Red が発見した最強の攻撃に対してテストされた際、成功率は 23% 未満だった。昨年 8 月にリリースされた前バージョンの GPT-5 に対しては 90% 以上の成功率があったため、劇的な低下である。バージョン全体での堅牢性における測定可能な改善は、レッドティーミングプロセスが実行可能な防御改善をもたらしたことを示している。特に、GPT-Red は研究者がこれまで出会ったことのない攻撃タイプ(思考の連鎖の注入をめぐるフェイクなど)を発見した。これはモデルの入力処理だけでなく、推論プロセス自体を悪用している。このような新規攻撃の発見は、大規模での自動レッドティーミングの価値を強調している。
たとえば、いま届くならこの3本です
AIが要約して、あなたの選んだトピックだけを1日1通。LINE・Email・Slackで届きます。
登録無料・30秒で完了・いつでも解除できますAITodayについて →
この記事についてわからないことをAIに質問できます。Q&Aはこのページに公開され、他の読者も読めます。
中国がデータセンター向け液冷の国家標準を初めて発表

OpenAIは8月28日、AIコーディングツールCursorへのモデル提供契約を終了すると発表し、終了日として11月12日を提案した

バーンスタインのアナリストは、AIがメモリーのボトルネックを生み出しており、需要が高帯域幅メモリー(HBM)から従来型DRAM、NANDフラッシュ、ストレージへ拡大していると指摘

オープンAIのサム・アルトマンCEOはタイム誌のインタビューで、AIモデル開発を「減速する良い時期」と述べた

エヌビディアの水曜決算は、GPUだけでなく、データ処理を最大3倍高速化するVera CPUなど周辺システムにも強みがあることを示した

マーベル・テクノロジーは2027年度第2四半期の売上高が過去最高の27億3900万ドル(前年比37%増)に達し、2027年度通期見通しも約120億ドルに引き上げた
