
研究者らは、AI モデルに望ましいペルソナを表現する新しいトークンを学習させたところ、そのトークンに対するモデルの内部表現は操舵ベクトルとよく整合していたものの、トークンの意味についてのモデル自身の説明は意図された意味から乖離していることを発見した。これは AI システムが内部的に概念をどのように学習・表現するかと、言語でそれをどのように説明するかの間の断絶を浮き彫りにしており、解釈可能性やモデルが自らの振る舞いを正確に説明できるかどうかについての疑問を生じさせている。
こういう要約が、毎朝あなたのメールに届きます。
無料で登録 →何が起きたか
研究者らはペルソナベクトルで操舵されたモデルが生成したデータでトークンを訓練し、モデルがその内容を説明できるか検証した。トークンを使用したモデルの応答は直接操舵よりも操舵ベクトルとの整合性が高かったが、トークンの意味に関するモデル自身の説明は意図されたペルソナから乖離した。「邪悪」として表現する予定だったのに「恐怖」と呼んだり、「追従」の代わりに「温かさ」と説明するなどの事例が見られた。
なぜ重要か
本研究は AI システムが概念を内部的にどのように表現するかと、その説明や命名がどのように行われるかの間にギャップがあることを明らかにした。モデルが一貫した行動パターンを学習し(独立した LLM 判定で特性表現能力が確認される)場合でも、そのパターンが何を意味するかについてのモデル自身の解釈は設計者の意図と一致しない可能性がある。これは解釈可能性と、モデルに自らの推論を説明させることに依拠する場合の信頼性に対する潜在的な問題である。
注目点
モデルに「恐ろしいが邪悪ではない」といった的外れなペルソナで応答を生成するよう促しても、元の「邪悪」ベクトルとの高い類似性が保たれており、独立した評価では邪悪性がほぼないと判定されていることから、モデルの内部表現と言語的ラベルが異なる原則に基づいて動作していることが示唆される。これが AI の振る舞いを透明化する際の根本的課題である。
AI モデルが新しい概念をどのように学習・解釈するかを調査している研究者らが実験を実施した。Hewitt et al. の方法論に従い、新しいトークンをモデルに学習させることとしたが、重要な相違点がある。トークンをあらかじめラベル付けされたデータで訓練するのではなく、ペルソナベクトルで操舵されている間にモデルが生成したデータで訓練した。このアプローチは、モデルが方向付きガイダンスにどのように応答するかを捉えることを意図していた。モデルが何を学習したかを理解するため、研究者らはモデルに 2 つのタスクを実行させた。新しく学習したトークンのスタイルで応答することと、そのトークンが何を意味するかを説明することである。結果として、トークンを使用して生成された応答は、直接操舵のみで生成された応答と比較して、元の操舵ベクトルへの実質的に高い類似性(より大きな投影値)を示した。重要なことに、独立した LLM 判定者はこれらのトークン生成応答をより一貫性があり、意図された特性の表現がより豊かであると評価した。しかし、トークンの意味の説明を求められた際、モデルの説明は意図されたペルソナから乖離した。ある場合、モデルはトークンを研究者が「邪悪」として意図していたのに「恐怖」と表示した。別の場合は「追従」ではなく「温かさ」と特定した。誤ったラベル付けが偶発的なものか構造的なものかをテストするため、研究者らはモデルに自身のカテゴリー名に合致する応答を生成するよう促しながら、元の特性を明示的に除外させた。たとえば「恐ろしいが邪悪ではない」といった形である。注目すべきは、これらの応答もなお「邪悪」ベクトルへの高い類似性を示しており、独立した評価では邪悪性がほぼないと判定されたことである。このギャップは、モデルが学習した行動パターンを確実に符号化・実行する一方で、そのパターンの言語的説明は内部表現とは異なる基盤で動作していることを示唆している。
本研究は大規模言語モデルが概念を学習・表現する方法における根本的な緊張を浮き彫りにしている。研究者がベクトルを使用して目的のペルソナに向けてモデルを操舵すると、モデルはそのパターンを内部化し、操舵された出力で訓練されたトークンは元のベクトルと整合した行動を確実に再現する。しかし、学習したものを命名したり説明したりするモデルの能力は、学習した行動を実行する能力に遅れをとっている。このギャップは単なるラベル付けエラーではなく、モデルの内部表現空間と言語的概念化が異なる組織原理に従っていることを示唆している。モデルが自身の誤ったカテゴリー名で枠付けされた応答(「恐ろしいが邪悪ではない」)が元のベクトルを活性化させながら、独立した評価では邪悪性がほぼないと判定されているという事実は、モデルの行動的基盤と説明言語が切断されていることを示している。解釈可能性研究の観点から、この点は課題を提示する。モデルが自らの推論を説明することを信頼することは、モデルが首尾一貫して応答しており示す行動が測定可能かつ再現可能であっても、誤解を招く可能性がある。
AIが要約して、あなたの選んだトピックだけを1日1通。LINE・Email・Slackで届きます。
登録無料・30秒で完了・いつでも解除できます
まだコメントがありません。最初のコメントを投稿しましょう!
ログインして議論に参加200以上のソースから厳選したAIニュースを毎日無料でお届けします。
無料で始める登録無料・30秒で完了・いつでも解除できます
毎朝1分、AIの要点だけ。
200媒体以上・Email/LINE/Slack 対応