
ベンチマークでAI引用の38.6%が捏造と判明。
情報の薄いテーマでは倍増。
全モデルが最低1件は捏造した。
何が起きたか
15の言語モデルを対象に、出典付きの2件の依頼でベンチマークを実施。101件の引用のうち39件が記載通りには存在せず、捏造率は38.6%だった。
なぜ重要か
情報が乏しいテーマでは捏造率が54.2%に達し、引用元の大半が invent されたものだった。モデルはもっともらしく見えるが実体のない参考文献を生成する。国内企業がAI生成の引用を鵜呑みにすると、根拠の無い情報を業務で使用する可能性がある。
注目点
調査は主張を読む前に引用を確認するよう助言しており、特にニッチなテーマで重要だ。機械の判定で失敗とされた11件は人手で確認したところ実在が判明し、捏造率は49.5%から修正された。
このベンチマークは機械による解決と人手による検証を組み合わせ、公表前に自らのツールの誤りを修正している点で独自だ。著者らはモデルのランキングを意図的に避け、モデルあたりわずか2レポートという大きな信頼区間を挙げている。テーマが薄いと捏造が2倍になるという発見は、モデルが引用の形式に優れ内容には優れないという仕組みを示唆している。読者にとっては、もっともらしさは信頼できるフィルターではないため、機械的に参考文献を検証することが実用的な教訓だ。この調査の限界—19レポート、2テーマ、閲覧なし—は、38.6%という数字が普遍的ではなく限定的であることを意味する。しかし、全モデルで一貫していることは問題の広がりを強調している。著者らはまた、執筆中に閲覧する検索連動型ツールでは異なる結果になる可能性が高く、将来のベンチマークの可能性を示唆している。この研究は、解決可能な出典であっても誤った帰属や弱い内容であることがあるため、存在を引用品質の下限として位置づけている。
たとえば、いま届くならこの3本です
AIが要約して、あなたの選んだトピックだけを1日1通。LINE・Email・Slackで届きます。
登録無料・30秒で完了・いつでも解除できますAITodayについて →
この記事についてわからないことをAIに質問できます。Q&Aはこのページに公開され、他の読者も読めます。
AIが現在、いわゆるヤコビアン予想を含む長年の数学問題の解決を支援しており、トップ数学者たちはこれが最終的に良いことなのか悪いことなのか深く迷っている

数十人の抗議者が木曜、オースティンのベンチャーキャピタル企業8VCの外に集まり、医療分野におけるパランティアのAI技術に抗議した

非営利の患者安全団体ECRIが、報告制度の対象を医療現場での人工知能関連の誤りにまで拡大している

ラムリサーチがオレゴン州ツアラティンでAI半導体向け研究開発センターの着工を発表した

看護師100人以上が8月27日、パロアルトのPalantir旧本社前で交通を遮断し、病院経営陣と当局者に同社との関係断絶を求めて抗議した

セールスフォースの株価は木曜日に23%近く急騰し、2020年以来の大幅な上昇を記録した
