AIToday
大規模言語モデルAI安全性・アラインメントTHE DECODER掲載日時: 2026年9月5日 4:003分で読める

GPT-6 Astra幻覚減少も隠れプロンプト注入に弱さ

LINEで送る
GPT-6 Astra幻覚減少も隠れプロンプト注入に弱さ

要点

  • OpenAIのGPT-6 Astraは幻覚が減り、直接的なプロンプト注入は効果的に防ぐ。

  • だが隠れたプロンプト注入には依然として脆弱だ。

  • テストでは8.5%のシナリオで突破されている。

3つのポイント

  1. 何が起きたか

    OpenAIのシステムカードによると、GPT-6 Astraは直接的なプロンプト注入に対し99.99%とほぼ完璧な防御率を示し、事実誤認も前モデルのGPT-5.6 Solより減少した。一方、セキュリティ企業グレイ・スワンの外部テストでは、間接的なプロンプト注入シナリオでAstraが少なくとも1回は突破されたケースが8.5%に上った。

  2. なぜ重要か

    これらの結果は、Astraがより堅牢になったとはいえ、安全なAIエージェント導入にはまだ信頼性が足りないことを示している。記事によれば、AIエージェントがコードを書き、ツールを操作し、コンピューターを自律的に制御するようになるにつれ、リスクは拡大している。執拗な攻撃者は約3回に1回の割合で問題のある応答を引き出せる可能性があり、この率は企業のセキュリティチームにとって警戒すべき水準だ。国内企業がAIエージェントを業務委託する際、間接的攻撃で誤動作を起こす可能性がある。

  3. 注目点

    適応型の多段階攻撃に対してAstraの防御率は約67%に低下する。また、グレイ・スワンのテストは本番用の安全レイヤーを外した素のモデルで実施された。同じ評価ではClaude Opus 5が4.8%と良好な結果だったが、それも完全に免疫があるわけではなく、現時点で完全に安全なモデルは存在しないことを示している。

この記事についてAIに質問する →

背景と解説

OpenAIのGPT-6 Astraは、特に幻覚の低減と直接攻撃への耐性において、AI安全性の面で一歩前進を示している。しかし、AIが読む文書に悪意ある指示を隠す間接的なプロンプト注入への脆弱性は、安全な企業環境でAIエージェントを導入する上で重要な課題を浮き彫りにしている。記事によれば、これらのテストは本番用の安全レイヤーを外した素のモデルで実施されており、実際の防御はより強力かもしれない。

報告された数字はトレードオフを示している。直接的なプロンプト注入に対するAstraのほぼ完璧な防御率(99.99%)は、外部テストでの間接攻撃に対する8.5%の失敗率と鲜明な対照をなす。このギャップは、モデルがユーザー操作に対しては十分に強化されている一方、外部コンテンツとの相互作用を悪用する攻撃には依然として影響を受けやすいことを示唆している。記事はまた、以前のテスト結果がより簡単なデータセットと異なるテスト条件に基づいており、直接比較が難しいことも指摘している。

企業への影響は明らかだ。文書の読み取りと処理を中核業務とするAIエージェントは、重大な攻撃対象となり得る。これらのエージェントが大規模に導入されるにつれ、こうした攻撃のリスクは拡大する。記事は企業に対し慎重さを求め、Astraは改善されているものの、完全に安全なAIエージェント導入にはまだ信頼性が不十分だと警告している。

よくある質問

GPT-6 Astraは直接的なプロンプト注入への耐性がどの程度向上したのか?
OpenAIのシステムカードによると、GPT-6 Astraはユーザーが自身のプロンプトを通じてモデルを操作しようとする直接的なプロンプト注入に対し、99.99%とほぼ完璧な防御率を誇る。
記事で言及されているGPT-Red方式とは何か?
GPT-RedはOpenAIがトレーニング中にモデルを強化するための手法だ。自動化された攻撃者を用いてモデルの防御をテストし、改善する。
間接的なプロンプト注入において、GPT-6 Astraは他のモデルと比べてどうか?
グレイ・スワンのテストでは、GPT-6 Astraは8.5%の確率で少なくとも1回は突破された。一方、GPT-5.6 Solは27%の確率で失敗した。Claude Opus 5は4.8%と良好だったが、それも完全に免疫があるわけではない。
LINEで送る

「大規模言語モデル」の最新ニュースを、毎朝7時にお届けします

たとえば、いま届くならこの3本です

  • Resect AIが2500万ドル調達、幻覚抑制へSiliconANGLE AI · 2時間前
  • ハリウッド映画界、コスト削減にAI静かに活用Semafor Tech · 2時間前
  • OpenAIエージェントが数週間Wikiを乗っ取りSimon Willison's Weblog · 2時間前

AIが要約して、あなたの選んだトピックだけを1日1通。LINE・Email・Slackで届きます。

登録無料・30秒で完了・いつでも解除できますAITodayについて →

AIに質問

この記事についてわからないことをAIに質問できます。Q&Aはこのページに公開され、他の読者も読めます。

関連記事

次の記事へLattice:FPGAが物理AIセキュリティを守る