
研究者がCHIVEシステムを構築し、プロンプト実験を通じ予期しないLLM振る舞いを発見・説明する。
既存の解釈可能性ツールが結果予測に役立つか検証したところ、役立たないことが判明した。
一方、プロンプト編集からの振る舞い変化を直接予測するよう訓練されたモデルは新設定に一般化した。
何が起きたか
研究者らがCHIVEというエージェント型パイプラインを開発した。このシステムは実世界の設定で言語モデル(LLM)の予期しない振る舞いを発見し、反事実的プロンプト編集を通じてそれを説明する。評価の結果、モデルの内部状態を読み取り理解しようとするアクティベーション読み取り解釈可能性ツールは改善をもたらさなかった。これらのツールを使用したエージェントは、単にトランスクリプトを読んだエージェントと変わらない精度で実験結果を予測した。
なぜ重要か
AI解釈可能性研究の中核的な仮定に疑問を呈している。その仮定とは、モデルの内部状態を読むために設計されたツールが振る舞いの予測と説明に役立つというものだ。これらのツールが単純な観察よりも予測上の利点をもたらさない場合、言語モデルがなぜそのように振る舞うのかを理解するための有用性は未証明のままである。LLMの内部構造を分析する解釈可能性手法が実際の動作予測に役立たない可能性があり、これらのツールに依存する国内のAI開発者は予測精度の向上を期待できない可能性がある。
注目点
研究はまた、プロンプト編集がLLMの振る舞いをどう変えるかを予測するよう訓練されたモデルが、保留されたテスト環境に一般化することも発見した。この予測タスク自体が、既存の解釈可能性手法よりもモデル応答を理解するための、より信頼できる方法である可能性を示唆している。
CHIVEパイプラインは解釈可能性研究を理論ではなく経験的観察に根ざそうとする試みである。自動的に実世界設定での予期しない振る舞いを発見し、反事実的プロンプト編集を通じて説明をテストすることで、実際のモデル振る舞いを反映しないかもしれない手作りの簡易実験という問題を回避している。アクティベーション読み取りツールが単純なトランスクリプト読み取りを上回ることができないという核心的発見は驚くべきものである。こうしたツールは業界で広く使用されており、多大な研究投資を代表しているからだ。結果は解釈可能性研究者がどのように問題をモデル化するか(内部状態の逆算)と、観察可能な振る舞いを実際に駆動するもの(入出力関係)との間のギャップを示唆しているかもしれない。二番目の発見として、振る舞い変化予測が一般化することは別の戦略を示唆している。内部メカニズムを逆算しようとする代わりに、重要な入出力マッピングを経験的に学習することに焦点を当てる。
たとえば、いま届くならこの3本です
AIが要約して、あなたの選んだトピックだけを1日1通。LINE・Email・Slackで届きます。
登録無料・30秒で完了・いつでも解除できますAITodayについて →
この記事についてわからないことをAIに質問できます。Q&Aはこのページに公開され、他の読者も読めます。
イスラエルの新興企業DataAgent Ltd.は、顧客のKubernetesクラスター内の本番障害を修復するプラットフォームを発表し、1000万ドルのプレシード資金を調達した
SK海力士はSEMICON Taiwan 2026で、ベースダイに演算機能を組み込んだカスタムHBMの構想を発表

米国防総省は8月31日、AIプラットフォーム「GenAI.mil」にOpenAIのChatGPTを軍事用にカスタマイズした「ChatGPT Mil」を導入したと発表した

エヌビディアの決算は注目に値する一方で退屈な内容となり、統合された世界を避ける姿勢が反映された

AnthropicがNvidia支援のクラウド事業者Lambdaと、$35bnのクラウドコンピューティング契約を結んだ

消費者庁は24日、全国の消費生活センターに寄せられる年間約90万件の相談を生成AIで分析し、詐欺の手口や事業者の経営破綻の早期サインを検出すると発表した
