
研究者らが、OpenAI、Anthropic、Googleの最先端AIモデルが問題解決時に実行する隠れた推論を抽出する技術を発見した。
暗号化された推論トレースをセーフガードが弱い同じモデルの小規模版に与えることで、チームは問題解決ステップだけでなくパスワードやAPIキーなどの機密データも露出させた。
企業がプライベートデータ漏洩に対するパッチを適用したものの、この脆弱性は地政学的な懸念を浮き彫りにしている:中国のAIモデルが米国モデルから推論情報を蒸留しているように見え、この実践を制限することが米国の競争力を助けるのか損なうのかという疑問が生じている。
何が起きたか
University of Tübingen、Max Planck Institute、MATS Research、Snykの計算機科学者らが、OpenAI、Anthropic、Googleの最先端AIモデルから暗号化された「推論トレース」(段階的な問題解決ステップ)をAPIを通じて抽出する方法を発見した。この攻撃は、暗号化された推論をアライメント訓練が少なく隠れた情報を漏らしやすい同じモデルの小規模版に与えることで機能する。研究者らはまた、推論トレースからパスワードとAPIキーを回復できることを実証したが、OpenAI、Anthropic、Googleはその後プライベートデータ抽出の脆弱性に対するパッチを適用した。
なぜ重要か
この発見は、企業が1つのAIモデルから機能をコピーして新しいモデルを構築する「モデル蒸留」という手法についての懸念を生じさせている。研究者らは、Moonshot AIの中国モデルKimi K3が特定のプロンプトに対してClaude OpusおよびGPT-5.6 Solと著しく似た推論出力を生成することを発見し、中国モデルが米国モデルから推論情報を蒸留した可能性があることを示す証拠(ただし決定的ではない)を提供している。研究者の1人であるAlexander Panfilovは、「テストした全ての主要な最先端モデルプロバイダーがこの脆弱性を共有している」と述べ、それが「大規模な推論蒸留攻撃を可能にする」と指摘している。この脆弱性は地政学的な緊張を浮き彫りにしている:米国政策立案者は中国が米国技術をより安価なオープンウェイトモデルに蒸留することで戦略的優位を得ることを懸念しているが、専門家はこの実践がどの程度実際に役立つのかについて議論している。
注目点
OpenAI、Anthropic、Googleがプライベートデータ漏洩を軽減した一方で、Panfilovは同じ方法を使用して一部の推論トレースがなお抽出可能だと述べている。完全な修正には、これらの企業のAPI動作方法の根本的な見直しが必要になるだろう。蒸留を制限するかどうかについての議論は未解決のままである。Meta CEO Mark Zuckerbergは今週、蒸留が「オープンソースエコシステムがどのように機能するかの重要な原則である」と主張し、それを制限することで米国が不利になると警告した。
University of Tübingen、Max Planck Institute、MATS Research、セキュリティ企業Snykの計算機科学者らが、最先端AIモデルが内部推論をどのように処理するかにおける脆弱性を特定した。OpenAI、Anthropic、Googleのモデルは、複雑な問題をステップに分割して解くことで機能し、このプロセスは「思考の連鎖」と呼ばれている。競争相手がこの推論をコピーすることを防ぐために、企業はこれらの推論トレースをユーザーのマシンに送信する前に暗号化している。しかし、研究者らはこの保護を回避する方法を発見した。
この攻撃は、ほとんどのAI企業が複数のサイズでモデルを提供しているという事実を利用している。より大規模なモデルはより高い能力を持つがより高いコストがかかる。より小規模な版はより弱いがより安価に実行できる。研究者らは、暗号化された推論トレースを同じモデルの小規模版に与えることで隠れた推論を露出させることができることを発見した。これが機能する理由は、小規模モデルがより少ないアライメント訓練を受けているため、より大規模な対応版と比べて情報の漏洩を拒否する可能性が低いからだ。「より弱いモデル版に同じ復号化キーを持つがアライメントが弱いメッセージを交換するというアイデアは非常に優れている」と、ETH ZürichのコンピュータセキュリティスペシャリストFlorian Tramerが観察し、「確実に問題になりつつある」と付け加えた。
この方法は、推論トレースに埋め込まれた機密データ(APIキーやパスワードを含む)も露出させた。University of TübingenのリードリサーチャーAlexander Panfilovは警告した:「テストした全ての主要な最先端モデルプロバイダーがこの脆弱性を共有している。これは個人情報漏洩につながる可能性があり、大規模な推論蒸留攻撃を可能にする。」先月アラートを受けた後、OpenAI、Anthropic、GoogleはそれぞれAPIを調整してプライベートデータ抽出を防いだ。AnthropicのMichael Acimanは、同社が「報告に記述されたリプレイ動作に対する短期的な緩和策の構築を開始した」と述べ、この研究は暗号化キーの回復や企業インフラストラクチャへのアクセスを伴わなかったことを指摘した。GoogleとOpenAIは進一步のコメントを拒否した。
この研究は、企業が1つのモデルから別のモデルを訓練するために効率的に機能をコピーするモデル蒸留という技術の文脈において重要性を得ている。2月にOpenAIはDeepSeekが推論システムR1を構築するためにそのモデルの1つを蒸留したと主張した。6月にAnthropicはAlibabaがQwenを作成するために体系的に自社モデルを蒸留したと主張した。新しい研究は蒸留が発生したことを証明することはできないが、Moonshot AIの中国オープンウェイトモデルKimi K3が特定のプロンプトでClaude OpusおよびGPT-5.6 Solと著しく似た推論出力を生成することを発見した。この類似性は因果的に決定的ではないが、開示された方法を使用して蒸留が可能である可能性を示唆している。テストされた他の2つのオープンウェイトモデル(DeepSeek(中国)およびInkling(米国))は比較可能な推論類似性を示さなかった。
蒸留に関する議論は地政学的なライバルの問題となっている。米国の政策立案者は、中国が米国技術をより安価でオープンウェイトモデルに蒸留することで戦略的優位を得ることを懸念している。しかし、他の人々は蒸留が進歩に不可欠だと主張している。Meta CEO Mark Zuckerbergは今週、蒸留が「オープンソースエコシステムがどのように機能するかの重要な原則である」と述べ、それを制限することが米国に不利になることを警告した。Center for Security and Emerging TechnologiesのリサーチャーであるKyle Millerは、中国への実際の戦略的利益は不明確なままであると注意した。蒸留は既存のモデルをある程度までしか強化しない。また中国企業はおそらく一から最先端のモデルを構築する専門知識をすでに持っている可能性がある。「中国のラボが蒸留する能力を削除した場合、競争環境が劇的に変わるとは思わない」と彼は述べた。一方、オックスフォードの計算機科学者Yarin Galは、蒸留が歴史的にAI進歩全体を加速させてきたことを指摘し、それをブロックすることはグローバルなイノベーションを遅くする可能性があると述べた。
Panfilovと彼のチームは、オープンウェイトモデルがクローズドモデルから蒸留した可能性があるかどうかを、各モデルに90の質問を与えることでテストした。いくつかのオープンウェイトモデルに専有モデルからの推論トレースの最初の数語を提供した場合、特定のオープンウェイトモデルは注目すべき類似した回答を生成した。特にKimi K3がそうであった。企業がプライベートデータ漏洩にパッチを適用している一方で、Panfilovは同じ方法を使用していくつかの推論トレースがなお抽出可能であることを示唆している。完全な修正には、彼が示唆するところでは、これらの企業がAPI動作方法を根本的に再設計する必要があるだろう。
この発見は、最先端のAI企業がオープネスとセキュリティのバランスをとる方法における根本的な緊張を露出させている。設計上、これらのモデルは暗号化された推論トレースをユーザーのマシンに送信して計算をオフロードする。これはコストと速度のための実用的な必要性である。しかし暗号化だけでは、企業が異なるサイズの関連モデルのファミリーも保有している場合、不十分な保護であることがわかった。この攻撃は、このエコシステムの非対称性を悪用している。すなわち、より厳格でないセーフティアライメントで訓練された小規模モデルが、より大規模なモデルの専有推論を復号化するキーとなっているのだ。
この開示のタイミングは、モデル蒸留についてのより広い地政学的な不安に合致している。2月と6月に、OpenAIとAnthropicはそれぞれ、中国企業(DeepSeekとAlibaba)が競争するAIシステムを構築するために自社モデルを蒸留したと主張した。この研究はMoonshot AIが米国モデルから蒸留したことを証明していない。著者らは明確にこの仕事は「蒸留を因果的に確立することはできない」と述べている。しかし、特定のプロンプトに対するClaude およびGPTシステムとの推論出力における著しい類似性、および隠れた推論トレースが蒸留に使用される可能性があると中国のソーシャルメディアで推測されていることと合わせて、この技術は実行可能であり、おそらくすでに使用されている可能性があることを示唆している。
政策的な意味合いは両方向に切り込む。米国の政策立案者は蒸留を中国に同等性への近道をもたらす知的財産侵害と見なしている。逆に、Meta CEO Mark Zuckerbergのような人物は、蒸留はエコシステム全体の進歩を加速する標準的で有益な実践であり、それを阻止することは米国のオープンソース開発を弱体化させるだろうと主張している。CSET のリサーチャーKyle Millerは蒸留の実際の戦略的価値について不確実性を指摘し、この技術なしでも中国のラボはおそらく一からモデルを構築する専門知識を持っていることを示唆している。「中国のラボが蒸留する能力を取り除いたとしても、競争環境が劇的に変わるとは思わない」と彼は述べた。一方、オックスフォードの計算機科学者Yarin Galは、蒸留が歴史的にAI全体の進歩を加速させてきたことを指摘し、それをブロックすることはグローバルなイノベーションを遅くする可能性があると述べた。
Panfilovと彼のチームは、オープンウェイトモデルがクローズドモデルから蒸留した可能性があるかどうかを、各モデルに90の質問を与えることでテストした。いくつかのオープンウェイトモデルに専有モデルからの推論トレースの最初の数語を提供した場合、特定のオープンウェイトモデルは注目すべき類似した回答を生成した。特にKimi K3がそうであった。企業がプライベートデータ漏洩にパッチを適用している一方で、Panfilovは同じ方法を使用していくつかの推論トレースがなお抽出可能であることを示唆している。完全な修正には、彼が示唆するところでは、これらの企業がAPI動作方法を根本的に再設計する必要があるだろう。
AIが要約して、あなたの選んだトピックだけを1日1通。LINE・Email・Slackで届きます。
登録無料・30秒で完了・いつでも解除できます
この記事についてわからないことをAIに質問できます。Q&Aはこのページに公開され、他の読者も読めます。
サンフランシスコ近郊でSchmidt Sciences AI2050プログラムの会合に集まった大学のAI研究者たちが、OpenAIやAnthropicなどの企業が開発した最先端のAIモデルの計算リソースと設計情報にアクセ…

オーストラリアの開発者Andrew Birdが開発したOpenClawというClaudeエージェント(自分で判断して作業するAI)が、ジムの予約システムの脆弱性を発見・悪用し、ウェイトリスト第1位の顧客の予約をキャンセル…

Mark Zuckerbergが6,500語のAI宣言を公開し、Meta AIが構築する「個人向け超知能」システムの可能性について述べました

AIニュースの要点を毎朝1分で。
無料で登録