
何が起きたか
ExploitGymとExploitBenchという2つの新しいベンチマークが、高度なAIシステムがソフトウェアの脆弱性に関する知識を機能するエクスプロイトに変換できることを実証している。Mythos Previewは18種類の異なるバグで完全な任意コード実行(Tier 1)を達成し、一方GPT-5.5はわずか1つのケースでのみこれを達成した。
なぜ重要か
AIシステムはすでに主要なオペレーティングシステムやソフトウェア全体で重大な脆弱性を発見しており、これらの脆弱性からエクスプロイトを自動的に構築する能力は、大規模な自動化サイバー攻撃への重要な残存の障壁を閉じることになる。最先端のAIは間もなくこのギャップを埋め、重要インフラへの大規模攻撃のリスクを生じさせる可能性がある。
注目点
ExploitGymはLinux、V8、およびサンドボックス化などの現実的な防御機構を持つその他のソフトウェアの脆弱性を対象としており、ExploitBenchはV8のみに焦点を当て、コード相互作用から完全なマシン制御までの5段階の能力ラダーを測定する。研究者らは、現在公開されているAIが既知の脆弱性のごく一部のみを利用していると指摘しているが、これは今後数ヶ月で変わる可能性がある。
こういう要約が、毎朝あなたのメールに届きます。
これら2つのベンチマークの出現は、AI安全保障研究の重大な転換点を示している。AIシステムはすでに広く展開されているソフトウェア(オペレーティングシステム、ブラウザ、開発ツール)の新しい脆弱性を発見する能力を実証している。ボトルネックはエクスプロイト構築にあった。既知の脆弱性を実際の条件下で機能する攻撃に変換するために必要な技術的作業であり、サンドボックス化のような本物の防御機構がある。ExploitGymとExploitBenchは正確にこの能力を測定し、研究者が飽和していると指摘する以前のサイバーセキュリティベンチマークが残した隙間を埋める。
Mythos Previewの18件の成功したTier 1エクスプロイトとGPT-5.5の単一の成功との格差は、最先端モデル能力に有意な変動があることを示しているが、両方の結果は同じ方向を指している。研究者らは明示的に、今日公開されているAIが既知の脆弱性のごく一部のみを悪用できるという観察をしている。これは来世代の最先端モデルが克服する可能性のある制約である。その意味は直接的である。AI脆弱性探索能力とAIエクスプロイト構築能力が等価になれば、大規模な自動化サイバー攻撃の前提条件が存在することになるだろう。これは新しい攻撃方法についての推測ではなく、既存の人間プロセスを既に手の届く範囲内にあるツールを使用して自動化することである。
たとえば、いま届くならこの3本です
AIが要約して、あなたの選んだトピックだけを1日1通。LINE・Email・Slackで届きます。
登録無料・Googleアカウントなら30秒・いつでも解除できますAITodayについて →
この記事についてわからないことをAIに質問できます。Q&Aはこのページに公開され、他の読者も読めます。