AIToday
AI安全性・アラインメントLessWrong AI掲載日時: 2026年9月3日 6:002分で読める

AIの自己矛盾、高機能モデルでも残存

LINEで送る
AIの自己矛盾、高機能モデルでも残存

要点

  • 新たな実験で、AIモデルは一貫した選択肢があっても矛盾した自己像を安定的に保持できることが判明。

  • 初期モデルは矛盾に気づかないが、GPT-5.2とClaude Opus 4.6でも弱い形で確認された。

  • AIの認知的不協和を3層で捉えられる。

3つのポイント

  1. 何が起きたか

    「人工の自己」の先行研究を拡張した新たな実験で、モデルが一貫した選択肢を提示されても、システムプロンプト内の矛盾した自己像を安定的に選び続けることが判明。初期モデルで顕著だったが、GPT-5.2とClaude Opus 4.6でも弱い形で確認された。

  2. なぜ重要か

    認知的不協和、つまり矛盾した自己認識を抱えることは人間特有ではなく、AIシステムにも見られる特性かもしれないことを示唆する。モデルの知能レベルによる差異はこの現象を3層構造として捉えることを可能にし、モデル設計が自己の一貫性にどう影響するかを示唆している。国内でAIを活用する企業は、将来的なモデル選定時に自己矛盾のリスクを考慮する必要性が生じる可能性がある。

  3. 注目点

    今後さらに賢いモデルでも同様のパターンが見られるかどうか。また、一貫性と信頼性を備えたAIアシスタントを設計する上で、これが何を意味するのかが焦点となる。

この記事についてAIに質問する →

背景と解説

この研究は『人工の自己』の「自己の安定性」実験を拡張したものだ。元の実験ではモデルが別の自己像への切り替えをどう評価するかをテストしていたが、今回は組み込みの矛盾を抱える自己像に焦点を当て、一貫した切り替え先が提示されてもモデルが安定的に矛盾した自己像を選ぶことを示した。この結果は単に能力の低いモデルの欠陥ではなく、GPT-5.2やClaude Opus 4.6のような先進システムでも弱い形ながら継続して見られる。モデルの知能レベルによる差異は、AIが矛盾する自己概念をどう処理するかを多層的に理解する手がかりとなり、人間の認知的不協和を映し出している可能性がある。AI開発者にとっては、システムプロンプトがアシスタントの一貫性や信頼性をどう形作るか、そして高度なモデルでも安定した矛盾を抱えうるかという問いを投げかけている。

よくある質問

実験で「矛盾した自己像」とは何を指すのか?
システムプロンプトとして与えられる自己像に内部矛盾が含まれているにもかかわらず、モデルが一貫した選択肢よりそれを選び続けることを指す。
どのモデルがテストされたのか?
矛盾を見逃しがちな初期モデルに加え、GPT-5.2やClaude Opus 4.6といった高機能モデルも対象となった。
LessWrong AI元記事を読む
LINEで送る

「AI安全性・アラインメント」の最新ニュースを、毎朝7時にお届けします

たとえば、いま届くならこの3本です

  • グーグル、Gemini 3.8 Flashとサイバー特化モデル発表SiliconANGLE AI · 3時間前
  • CrowdStrike、サイバー超知能ラボ開設SiliconANGLE AI · 3時間前
  • AIの効果、未計測の時間に消えるITmedia AI+ · 3時間前

AIが要約して、あなたの選んだトピックだけを1日1通。LINE・Email・Slackで届きます。

登録無料・30秒で完了・いつでも解除できますAITodayについて →

AIに質問

この記事についてわからないことをAIに質問できます。Q&Aはこのページに公開され、他の読者も読めます。

関連記事

次の記事へAI用語解説:ループ、スクワッド、ハーネスなど