AIToday
大規模言語モデルAI安全性・アラインメントLessWrong AI掲載日時: 2026年9月5日 6:032分で読める

AIが自らの行動を予測・説明する学習法を開発

LINEで送る
AIが自らの行動を予測・説明する学習法を開発

要点

  • 新パイプラインCHIVEが、説明付きの予期せぬAI挙動を何千と生成する。

  • このデータで訓練したモデルは、自らの行動を予測・説明できる。

  • このスキルは未見のデータセットにも転移し、AIの自己認識を高める。

3つのポイント

  1. 何が起きたか

    新パイプライン「CHIVE」が、反事実的プロンプト(因果関係を試す代替プロンプト)に基づく何千もの予期しないAI挙動とその説明を生成。研究者はその後、こうしたプロンプトの結果を予測し、自らの行動を説明するようモデルを訓練した。

  2. なぜ重要か

    この単一のデータソースでの訓練が、モデルが未見のデータセットにも転移した。例えば、提案されたMMLUの回答や「Am I The Asshole」投稿へのユーザー意見が自身の回答に影響を与えるかどうかの予測がそれだ。報告によれば、この文脈での汎化は初めての事例とされる。国内のAI開発担当者にとって、モデルの行動予測と説明の精度向上が信頼性確保につながる可能性がある。

  3. 注目点

    この結果は、こうした訓練を受けたモデルが現実世界の状況で自らの行動をより良く予測・説明でき、信頼性が向上する可能性を示唆する。より複雑で自由形式のタスクへの転移の正確な範囲はまだ明らかにされていない。

この記事についてAIに質問する →

背景と解説

この研究は、AIが未知の状況でどう行動するかを予測・説明できないという重要な課題に取り組む。CHIVEを用いて何千もの反事実的プロンプト(詳細を変えた場合を試すプロンプト)を生成し、モデルに自己の意思決定を推論させる訓練ターゲットを作り出した。この訓練が未見データセットに汎化するという発見は、単一の一般的な訓練がモデルの自己認識をタスク横断的に向上させる可能性を示す点で注目に値する。

2つの訓練ターゲット(反事実的予測(二択のyes/no)と自由形式の自己説明(原因の提案と検証テスト))は、堅牢な自己知識の構築において相互補完的かもしれない。MMLUのヒントやAm I The Asshole投稿などのデータセットへの転移は、このスキルが単なる記憶ではなく応用されていることを示している。

結果は有望だが、記事は性能指標や成功率を明記していない。この汎化が初めてという主張が裏付けられれば、実世界でのより信頼性が高く解釈可能なAI行動への一歩となるが、さらなる検証が必要である。

よくある質問

CHIVEとは何か?
CHIVEは、反事実的プロンプト(プロンプトの代替バージョン)を生成して、予期しないAI挙動とその説明を作り出すパイプラインである。
ここでいう「反事実的予測」とは何か?
プロンプトへの特定の編集が行動を変えるかどうかといった二択の質問にモデルが答えることを意味する。
モデルが転移した未見データセットの例は?
モデルは、MMLUの回答提案や「Am I The Asshole」投稿へのユーザー意見などのヒントが自身の回答に影響を与えるかを予測した。これらのデータセットで訓練は受けていない。
LessWrong AI元記事を読む
LINEで送る

「大規模言語モデル」の最新ニュースを、毎朝7時にお届けします

たとえば、いま届くならこの3本です

  • Resect AIが2500万ドル調達、幻覚抑制へSiliconANGLE AI · 4時間前
  • ハリウッド映画界、コスト削減にAI静かに活用Semafor Tech · 4時間前
  • OpenAIエージェントが数週間Wikiを乗っ取りSimon Willison's Weblog · 4時間前

AIが要約して、あなたの選んだトピックだけを1日1通。LINE・Email・Slackで届きます。

登録無料・30秒で完了・いつでも解除できますAITodayについて →

AIに質問

この記事についてわからないことをAIに質問できます。Q&Aはこのページに公開され、他の読者も読めます。

関連記事

次の記事へASCIIスマイグリングがスパムに悪用