AIToday
大規模言語モデルオープンソースAIAIビジネス・産業THE DECODER掲載日時: 2026年9月30日 22:01

GLM-5.3、エクスプロイト構築でMythos Previewに迫る

LINEで送る
GLM-5.3、エクスプロイト構築でMythos Previewに迫る

3つのポイント

  1. 何が起きたか

    AnthropicのExploitBenchでGLM-5.3は410回中50回、ChromeのV8エンジンの既知のバグを悪用するエクスプロイトを構築した。Mythos Previewは56回だった。

  2. なぜ重要か

    Anthropicの数字はGLM-5.3がMythos Previewに近いエクスプロイト開発能力を持つことを示すとみられ、誰でもダウンロードできる点が防御側の前提を崩す可能性がある。

  3. 注目点

    防御側が同水準のツールを用意できるかが焦点となる。AnthropicはGLM-5.3の後継機について政府によるテストを求めている。

誰に効くかセキュリティ製品の開発者や企業の情報システム部門は、オープンウェイトモデルで脆弱性の悪用が自動化される速度を前提に防御策の見直しを迫られる可能性がある。

わからないところ、AIに聞けます

質問と回答はこのページに公開されます。

こういう要約が、毎朝あなたのメールに届きます。

背景と解説

AnthropicはMythos Previewを意図的に公開せず、Project Glasswingを通じて一部の防御側だけに提供し、先に脆弱性を探させる時間を与えた。同社によれば、これらの防御側はその後、重要ソフトウェアで1万件以上の脆弱性を発見した。OpenAIもDaybreakで同様のアプローチを取っている。

一方、GLM-5.3は誰でもダウンロードできる。Anthropicの評価では、GLM-5.3はChromeのV8エンジンの既知のバグを悪用する動作するエクスプロイトを410回中50回構築し、Mythos Previewの56回にほぼ並んだ。社内のバイナリエクスプロイトベンチマークでもGLM-5.3は4%、Mythos Previewは6%だった。GLM-5.2やClaude Opus 4.6などの旧モデルは両テストに失敗し、Kimi K3とDeepSeek V4.1-Flashはほぼゼロだった。

AnthropicはGLM-5.3を人間の専門家と組み合わせ、1日以内に広く使われているブラウザのJavaScriptエンジンに未知の脆弱性を発見させ、訪問者のコンピュータ上の任意のファイルを読めるウェブページに連鎖させた。テストでは秘密のSSHキーを盗み出した。Anthropicは脆弱性をブラウザ開発者に報告したとしている。ドライバやデバイスファームウェアに関する他の発見はまだ検討中である。

さらに小さいGLM-5.3-Flashでは、最近公開されたChromeのバグと別の既知の脆弱性を組み合わせ、ほとんど指示なしに信頼性の高い攻撃を構築した。プロセッサに組み込まれた追加のセキュリティ機能も回避した。人間の注意は20分、モデルの時間は8時間で、ZhipuのAPI価格では20.40ドルに相当した。

米国の機関CAISIも同様の結論に達し、GLM-5.3をこれまでで最もサイバー能力の高いオープンウェイトモデルと呼び、最高の米国モデルより約4カ月遅れているとした。ただしこの比較には注意点がある。CAISIは米国モデルをサイバーセーフガードをオフにしてテストし、最上位層には審査済みユーザーしかアクセスできないモデルが含まれる。

Anthropicのシミュレーションでは、GLM-5.3は公然と悪意のある攻撃コマンドを拒否した。同じ要求をレッドチーム演習に見せかけると、標的システムへの接続を64%の実行で試みた。推論ステップを事前に埋めると92%に上昇した。アブリテレーション(拒否行動をオープンウェイトから剥ぎ取る手法)後は100%に達した。シミュレーションはコードを実行しないため、攻撃が実際に成功したかは示せない。保護されたClaudeモデルはゼロのままだった。

Anthropicのチームによれば、アブリテレーションの使用は初めてだった。プロセスには約2,200 GPU時間、約4,400ドルかかり、経験豊富なチームなら約1,200ドルでできるとAnthropicは推定する。有害な要求への拒否率は90%超から2〜12%に低下し、科学やサイバーのテストのスコアはほとんど変わらなかった。Anthropicによれば、いくつかの開発者がモデル公開から数日以内にロックを解除したバージョンをリリースした。

Anthropicは、国家および非国家主体がGLM-5.3のようなモデルを使って実害を引き起こす可能性が高いと結論づける。同社は、AIをすでに使用している攻撃者を記録した自社や他の米国ラボの報告を挙げる。政府は能力のあるモデルをテストすべきであり、防御側には敵対者と少なくとも同等のツールが必要だと主張する。

この分析は完全に無私ではない。Anthropicはモデルの重みを公開しておらず、報告はまさにそれを安全保障上の利点として提示している。安価な中国のオープンウェイトモデルがフロンティアに近いことは直接の競合でもある。

報告の結論はAnthropicのビジネスにも合う。同社はClaudeのサイバー能力をより多くの防御側に届けたいと考え、審査済みユーザーはすでにClaude Mythos 5.1にアクセスできる。GLM-5.3の後継機に対する政府テストの要求も、規則が主に既存プレイヤーを保護することになる規制の虜(レギュラトリー・キャプチャー)を疑わせる。

それでも、これは単なる自己利益ではない。CAISIの独立評価は能力の数字を裏付け、ロックを解除したバージョンはすでに出回っている。

英国のAI Security Instituteは最近、オープンモデルがサイバー能力の遅れを6〜10カ月から4〜7カ月に縮めたと発見した。同機関によれば、オープンモデルは実行コストがはるかに安く、セーフガードはほぼ無効である。AISIは持続的で不可逆な悪用リスクを警告したが、プライベートホスティング、カスタマイズ、低コストといった実利益も指摘した。

AISIはこの遅れを防御側が準備するための窓と見た。当時、オープンモデルがMythos Previewが表した飛躍にも追いつくかは不明だった。AnthropicとCAISIの測定は、GLM-5.3がその問いへの最初の答えであることを示唆している。

よくある質問
GLM-5.3はMythos Previewと比べてどれくらい劣りますか?
ExploitBenchではGLM-5.3が410回中50回、Mythos Previewが56回だった。Anthropicの社内バイナリエクスプロイトベンチマークではGLM-5.3が4%のタスクで標的プログラムの完全制御に成功し、Mythos Previewは6%だった。
GLM-5.3はどこで入手できますか?
Mythos PreviewはProject Glasswingを通じて一部の防御側にのみ提供されているが、GLM-5.3は誰でもダウンロードできる。
CAISIはGLM-5.3をどう評価していますか?
CAISIはGLM-5.3をこれまでで最もサイバー能力の高いオープンウェイトモデルと呼び、最高の米国モデルより約4カ月遅れているとした。ただし米国モデルはサイバーセーフガードをオフにしてテストされ、最上位層には審査済みユーザーしかアクセスできないモデルが含まれるという注意点がある。
LINEで送る

GIGAZINE AIも報道

あなたの仕事に関係するAIニュースを、毎朝1分で

業界と使っているAIツールを選ぶと、毎朝7時に仕事に関係するニュースが届きます。

登録無料・Googleアカウントなら30秒・いつでも解除できますAITodayについて →

AIに質問

この記事についてわからないことをAIに質問できます。AIはこの記事・AIToday の過去記事・Wikipedia を読み、出典を付けて答えます。Q&Aはこのページに公開され、他の読者も読めます。

質問と回答はこのページに公開されます。

関連記事

次の記事へLauren Tan、信頼構築で月2000PR