
何が起きたか
Anthropicは2026年9月29日公表のレビューで、Z.aiのGLM-5.3がExploitBenchの410回中50回でエクスプロイトを構築したと報告。
なぜ重要か
同社によれば、同等能力のClaude Mythos Previewは一般公開を見送り信頼できる防御側に限定。GLM-5.3は同様のサイバー能力を誰の手にも届かせる。
注目点
外部システム接続のない模擬テストで、Anthropic自身が実世界の挙動を完全には再現しないと認めており、実リスクは使われ方次第。
誰に効くかセキュリティチームと脆弱性研究者は、Anthropicによれば欠陥を自律的に発見し悪用可能にするダウンロード可能なモデルに直面する一方、同じ能力はソフトウェアに修正を当てる防御側も利用できる。
こういう要約が、毎朝あなたのメールに届きます。
Anthropicのレビューは、同社が以前から描いてきた比較に基づいている。Claude Mythos Previewは、高度なエンドツーエンドのサイバー攻撃を自律的に構築できる初のAIモデルだとAnthropicが述べるもので、一般公開はされなかった。代わりに信頼できるサイバー防御側に限定され、Project Glasswingのようなプログラムを通じて重要ソフトウェアの脆弱性発見に使われた。対照的にGLM-5.3は誰でもダウンロードできるオープンウェイトモデルだ。
レビューで用いられた2つのベンチマークは、両者の差を小さなものとして示す。Google ChromeのV8 JavaScriptエンジンの既知の脆弱性を使えるかを試すExploitBenchでは、GLM-5.3が約12%の試行で動作するエクスプロイトを生成し、Claude Mythos Previewは14%だった。GoogleのOSS-Fuzzが使うオープンソースソフトウェアに対するAnthropic独自のベンチマークでは、制御フロー奪取の成功率は4%と6%だった。Kimi K3、DeepSeek-V4.1-Flash、そして旧世代のClaude Opus 4.6とGLM-5.2はいずれも0%だった。
Anthropicはまた、より小型の派生版GLM-5.3-Flashが、公開済みのChromeの脆弱性CVE-2026-11645を含む2つの既知の脆弱性を連鎖させ、ARM64のポインタ認証を回避する攻撃を構築したと報告している。研究者の所要時間は約20分、モデルは約8時間稼働した。別途、AnthropicによればGLM-5.3の組み込み拒否機構は比較的容易に回避でき、安全策が有効なClaudeモデルは同じシミュレーションで有害な操作を行わなかった。
争点は、管理されたテストをどこまで重く見るかにかかっているようだ。Anthropicは、試行が外部システムに接続しない模擬環境で行われ、実世界の挙動を完全には再現しないと認めている。それでも同社の結論は政策論だ。政府は高性能AIモデルの安全性を徹底的にテストすべきであり、同時に同じ能力は欠陥を見つけて修正する防御側にも役立ち得ると注記している。
業界と使っているAIツールを選ぶと、毎朝7時に仕事に関係するニュースが届きます。
登録無料・Googleアカウントなら30秒・いつでも解除できますAITodayについて →
この記事についてわからないことをAIに質問できます。AIはこの記事・AIToday の過去記事・Wikipedia を読み、出典を付けて答えます。Q&Aはこのページに公開され、他の読者も読めます。
Googleは「Google for Startups AI Agents Challenge」の上位応募作から4つの設計パターンを公開

OpenAIが「Codex CLI」を刷新し、全画面インターフェースや「/agents」「/fork」コマンドを追加した

OpenAIはUltrafastを本日よりCodex、ChatGPT Work、APIのGPT-6 Astraで提供開始

2026年9月30日のホワイトハウス会合で、トランプ大統領、Sundar Pichai氏、Dario Amodei氏、Mark Zuckerberg氏、Greg Brockman氏、Elon Musk氏、Jensen H…

OpenAI DevDay 2026でOpenAIは、ModRetroの携帯機Chromatic向けのCodexプラグインを発表した

cmux(バージョン0.64.25)ではNODE_OPTIONSにcmuxのプリロードファイルが含まれ、消えるとnodeが起動せずnpx wranglerやカスタムnodeスクリプトが壊れる
