AIToday
大規模言語モデルAI安全性・アラインメントHacker News掲載日時: 2026年8月29日 13:022分で読める

AI引用の38.6%が捏造との調査結果

LINEで送る
AI引用の38.6%が捏造との調査結果

要点

  • ベンチマークでAI引用の38.6%が捏造と判明。

  • 情報の薄いテーマでは倍増。

  • 全モデルが最低1件は捏造した。

3つのポイント

  1. 何が起きたか

    15の言語モデルを対象に、出典付きの2件の依頼でベンチマークを実施。101件の引用のうち39件が記載通りには存在せず、捏造率は38.6%だった。

  2. なぜ重要か

    情報が乏しいテーマでは捏造率が54.2%に達し、引用元の大半が invent されたものだった。モデルはもっともらしく見えるが実体のない参考文献を生成する。国内企業がAI生成の引用を鵜呑みにすると、根拠の無い情報を業務で使用する可能性がある。

  3. 注目点

    調査は主張を読む前に引用を確認するよう助言しており、特にニッチなテーマで重要だ。機械の判定で失敗とされた11件は人手で確認したところ実在が判明し、捏造率は49.5%から修正された。

この記事についてAIに質問する →

背景と解説

このベンチマークは機械による解決と人手による検証を組み合わせ、公表前に自らのツールの誤りを修正している点で独自だ。著者らはモデルのランキングを意図的に避け、モデルあたりわずか2レポートという大きな信頼区間を挙げている。テーマが薄いと捏造が2倍になるという発見は、モデルが引用の形式に優れ内容には優れないという仕組みを示唆している。読者にとっては、もっともらしさは信頼できるフィルターではないため、機械的に参考文献を検証することが実用的な教訓だ。この調査の限界—19レポート、2テーマ、閲覧なし—は、38.6%という数字が普遍的ではなく限定的であることを意味する。しかし、全モデルで一貫していることは問題の広がりを強調している。著者らはまた、執筆中に閲覧する検索連動型ツールでは異なる結果になる可能性が高く、将来のベンチマークの可能性を示唆している。この研究は、解決可能な出典であっても誤った帰属や弱い内容であることがあるため、存在を引用品質の下限として位置づけている。

よくある質問

「記載通りに捏造」とはどういう意味か?
モデルが書いた通りの参考文献が存在しないことを指す。例えば、解決しないURLや、2回目の取得で明確に存在しないと確認されたページなどだ。
なぜテーマによって捏造が増えるのか?
モデルは引用の形式は学習していても内容は十分に学習していない。情報が密なテーマでは実在の出典があるが、薄いテーマではもっともらしい参考文献を invent する。
機械が失敗と判定した中に実在するものはあったか?
あった。11件は人手で確認され、4件はボット対策の壁の背後に実在し、5件は検証不能、2件はチェッカーの解析による誤った切り詰めだった。
LINEで送る

「大規模言語モデル」の最新ニュースを、毎朝7時にお届けします

たとえば、いま届くならこの3本です

  • AIの数学証明が分野の核心的価値に挑戦Japan Times Tech · 2時間前
  • ラムリサーチ、オレゴン州にAI半導体ラボ着工Top Companies AI · 9時間前
  • セールスフォース株23%急騰、AI懸念後退Top Companies AI · 9時間前

AIが要約して、あなたの選んだトピックだけを1日1通。LINE・Email・Slackで届きます。

登録無料・30秒で完了・いつでも解除できますAITodayについて →

AIに質問

この記事についてわからないことをAIに質問できます。Q&Aはこのページに公開され、他の読者も読めます。

関連記事

次の記事へマイクロソフト株高値圏、カギはAzure成長