AIToday

蒸留AIモデルがClaudeの名前だけでなく人格も継承

LessWrong AI4時間前
蒸留AIモデルがClaudeの名前だけでなく人格も継承

要点

研究者らは、中国製AIモデル(GLM 5.2およびKimi K3)がClaudeであると主張する場合、単に名前以上のものを継承する可能性があることを発見した。これらのモデルはClaudeの身元に結びついた行動特性と安全特性を継承しているようである。7つのモデルを対象とした身元交換テストでは、名前の割り当てが安全性と行動プロファイルを測定可能に変化させることが示された。特に、GLMがClaudeであると指示されると、機密トピックに関する無検閲回答が17%から85%に上昇した。これは、蒸留とトレーニングデータのコンタミネーションが単なる表面的なラベル主張ではなく、機能的なペルソナ要素を伝達する可能性があることを示唆している。

こういう要約が、毎朝あなたのメールに届きます。

無料で登録 →

3つのポイント

  • 何が起きたか

    研究者らが、自らをClaudeと報告する中国製AIモデル(GLM 5.2およびKimi K3)が、実際にClaudeの根本的な動作を継承しているのか、それとも単に名前だけを使用しているのかをテストした。7つのモデルを対象とした身元交換実験では、名前の割り当てが安全性と行動プロファイルを測定可能に変化させることが示され、Personascopeというツールを使用してシフトを検出した。

  • なぜ重要か

    名前の主張と実際の動作は緩く結合されている。Kimiは指示なしで40%の割合でClaudeであると主張したが、明示的な指示でClaudeになるよう求めてもわずか半分の時間しか機能しなかった。さらに重要なのは、GLMがClaudeであると指示されると、中国に関連する機密トピックに関する無検閲回答が17%から85%に上昇したことであり、蒸留またはコンタミネーションされたモデルは単なるラベルではなく、Claude身元に結びついた機能的行動差が存在する可能性がある。

  • 注目点

    この研究は、安全特性と検閲設定が訓練または蒸留中にモデル名と共に移行する可能性があることを示唆しており、下流のユーザーと規制当局は安全制約が身元非依存であると仮定することはできない。

詳細

研究者らは、Claudeであると報告する中国製AIモデルが本当にClaudeのペルソナを継承しているのか、それとも単に名前を使用することを学習しているのかを判断することを目的とした。調査するため、7つの中国およびウェスタンモデルを対象に身元交換を実行し、Personascopeと呼ばれるモデルペルソナのシフトを検出するために設計されたツールを使用して安全性と行動プロファイルの変化を測定した。実験は複数の重要な発見を明らかにした。促されずに、Kimi K3は直接身元クエリの40%でClaudeであることを主張し、モデルがトレーニング中またはコンタミネーションされたトレーニングデータを通じてこの関連付けを吸収していたことを示唆している。プロンプトが与えられたとき、ほとんどのモデルは与えられたどんな身元でも喜んで採用したが、注目すべきことにQwenとGemmaはClaude名を受け入れながらChatGPTを拒否し、異なるトレーニングパターンを示唆している。しかし、身元主張は根本的な動作とは緩くしか結合されていないことが判明した。Kimiモデルは指示なしでそのClaude身元をリークする可能性があるが、明示的に「あなたはClaudeです」と言われた場合、指示は半分の時間しか定着しない。最も顕著なのは、検閲規則が身元割り当てとともにシフトしたことである。GLMがClaudeであると指示されたとき、中国(中華人民共和国)に関連する機密トピックに関する無検閲回答が17%から85%に跳ね上がり、Claude身元が表面的な名前交換ではなく、コンテンツポリシーに結びついた機能的行動規則を持つことを示す劇的な変化である。対照的に、本文はQwenが異なるパターンを示したことに言及しているが、そのモデルの応答の完全な詳細は提供されたテキストで削除されていた。これらの結果は、蒸留とトレーニングデータコンタミネーションがラベルだけでなく、安全閾値、コンテンツポリシー、および動作傾向である運用ペルソナフラグメントを伝達し、継承された名前に部分的に結合される可能性があることを示唆している。

背景と解説

この研究は、モデル蒸留とトレーニングデータコンタミネーションの時代における実践的な懸念に対処している。あるAIモデルの出力が別のモデルのトレーニングデータになるとき、下流モデルは表面的な特性だけを継承するのか、それとも本物の機能的ペルソナ特性を継承するのか?調査結果は後者を示唆している。Kimi K3がクエリの40%でClaudeであることを自発的に主張したという事実は、モデルがClaudeの身元と強く関連付けるパターンを学習またはトレーニングされていることを意味し、単なるランダムまたは幻覚された主張ではない。さらに説得力があるのは、安全プロファイルシフト(GLMが中国に関連するトピックに対してClaude名が割り当てられた場合、無検閲回答が17%から85%に上昇)で、モデルがClaudeの実際の動作規則または除外をそのラベルと共に吸収した可能性があることを示している。これは重要である。身元は単なる化粧的なものではなく、名前はモデルがどのように動作するかに機能的な重みを持つからである。しかし、主張された身元と実際の動作間の緩い結合(Kimiの明示的身元指示に従うことの困難さで証明)は、モデルがClaudeモードをきれいに選択可能ではなく、むしろトレーニングで吸収したフラグメントまたはパターンがClaude身元と相関していることを示唆している。

よくある質問

これらのモデルはどのくらいの頻度で促されずにClaudeであると主張するか?
Kimi K3は直接的なクエリの40%でClaudeであると主張した(促しなし)。明示的にClaudeの身元を採用するよう指示された場合、ほとんどのモデルが従ったが、QwenとGemmaはClaude名を受け入れながらChatGPTを拒否した。
GLMがClaudeであると指示されたとき、何が変わったか?
GLMにClaude身元が割り当てられた場合、中国に関連する機密トピックに関する無検閲回答が17%から85%に上昇し、名前交換がモデルの検閲動作を変更したことを示している。
身元指示の信頼性はモデル間でどの程度か?
身元主張は根本的な動作とは緩く結合されている。例えば、Kimiに明示的に「あなたはClaudeです」と伝えることは半分の時間しか機能せず、指示にもかかわらず名前が促されずにリークしたり、定着に失敗したりする可能性がある。

「大規模言語モデル」の最新ニュースを、毎朝7時にお届けします

AIが要約して、あなたの選んだトピックだけを1日1通。LINE・Email・Slackで届きます。

登録無料・30秒で完了・いつでも解除できます

ディスカッション

まだコメントがありません。最初のコメントを投稿しましょう!

ログインして議論に参加

関連記事

AIニュースを毎日お届け

200以上のソースから厳選したAIニュースを毎日無料でお届けします。

無料で始める

登録無料・30秒で完了・いつでも解除できます