
OpenAIのGPT-6 Astraは幻覚が減り、直接的なプロンプト注入は効果的に防ぐ。
だが隠れたプロンプト注入には依然として脆弱だ。
テストでは8.5%のシナリオで突破されている。
何が起きたか
OpenAIのシステムカードによると、GPT-6 Astraは直接的なプロンプト注入に対し99.99%とほぼ完璧な防御率を示し、事実誤認も前モデルのGPT-5.6 Solより減少した。一方、セキュリティ企業グレイ・スワンの外部テストでは、間接的なプロンプト注入シナリオでAstraが少なくとも1回は突破されたケースが8.5%に上った。
なぜ重要か
これらの結果は、Astraがより堅牢になったとはいえ、安全なAIエージェント導入にはまだ信頼性が足りないことを示している。記事によれば、AIエージェントがコードを書き、ツールを操作し、コンピューターを自律的に制御するようになるにつれ、リスクは拡大している。執拗な攻撃者は約3回に1回の割合で問題のある応答を引き出せる可能性があり、この率は企業のセキュリティチームにとって警戒すべき水準だ。国内企業がAIエージェントを業務委託する際、間接的攻撃で誤動作を起こす可能性がある。
注目点
適応型の多段階攻撃に対してAstraの防御率は約67%に低下する。また、グレイ・スワンのテストは本番用の安全レイヤーを外した素のモデルで実施された。同じ評価ではClaude Opus 5が4.8%と良好な結果だったが、それも完全に免疫があるわけではなく、現時点で完全に安全なモデルは存在しないことを示している。
OpenAIのGPT-6 Astraは、特に幻覚の低減と直接攻撃への耐性において、AI安全性の面で一歩前進を示している。しかし、AIが読む文書に悪意ある指示を隠す間接的なプロンプト注入への脆弱性は、安全な企業環境でAIエージェントを導入する上で重要な課題を浮き彫りにしている。記事によれば、これらのテストは本番用の安全レイヤーを外した素のモデルで実施されており、実際の防御はより強力かもしれない。
報告された数字はトレードオフを示している。直接的なプロンプト注入に対するAstraのほぼ完璧な防御率(99.99%)は、外部テストでの間接攻撃に対する8.5%の失敗率と鲜明な対照をなす。このギャップは、モデルがユーザー操作に対しては十分に強化されている一方、外部コンテンツとの相互作用を悪用する攻撃には依然として影響を受けやすいことを示唆している。記事はまた、以前のテスト結果がより簡単なデータセットと異なるテスト条件に基づいており、直接比較が難しいことも指摘している。
企業への影響は明らかだ。文書の読み取りと処理を中核業務とするAIエージェントは、重大な攻撃対象となり得る。これらのエージェントが大規模に導入されるにつれ、こうした攻撃のリスクは拡大する。記事は企業に対し慎重さを求め、Astraは改善されているものの、完全に安全なAIエージェント導入にはまだ信頼性が不十分だと警告している。
たとえば、いま届くならこの3本です
AIが要約して、あなたの選んだトピックだけを1日1通。LINE・Email・Slackで届きます。
登録無料・30秒で完了・いつでも解除できますAITodayについて →
この記事についてわからないことをAIに質問できます。Q&Aはこのページに公開され、他の読者も読めます。