
16のAIモデルと人間の放射線科医をX線画像判読で比較した厳密なテストで、全ての有力AIモデルが、精度を報酬とする一方で過信した誤答にペナルティを課す指標において人間の専門家より低いスコアを獲得した。問題は、多くのAIシステムが不確実性を認めるのではなく自信を持って誤診し、患者はこれらのシステムが監視されない臨床利用に信頼できないにもかかわらず、すでに医学画像をチャットボットにアップロードしているということだ。
こういう要約が、毎朝あなたのメールに届きます。
無料で登録 →何が起きたか
16のAIモデルを200件のX線画像で検査した結果、人間の放射線科医は精度と信頼度の較正を組み合わせた指標で2,000点満点中988.7点を獲得したのに対し、最高性能のAIモデルは758点にとどまった。Anthropic の Claude Fable 5 が信頼できる回答で最高性能を示し、Google の Gemini 3 Pro が最も高い素点精度を達成した。スコアリングシステムは確実に間違った回答に対してペナルティを与えるが、これが核心的な問題である。多くのAIシステムは不確実性を認めるのではなく、自信を持って誤診を下すのだ。
なぜ重要か
医学的誤診は正直な不確実性よりもはるかに危険であるにもかかわらず、多くのAIモデルは推測するように訓練されている。患者がX線画像やMRI検査画像をチャットボットにアップロードし、その回答を信頼する例が増えている。しかし、複数の有力商用モデルが、信頼度が精度と確実な関連性を持たない極めて自信に満ちた誤診を生成することが判明している。AIが医師の99%以上より優れた診断を行うという最近の主張は、ほとんどが事例集またはシミュレーションに基づくもので、厳密な検査に基づいていない。
注目点
テストフレームワーク RadLE 2.0 は継続的に拡大し、新しいモデルが追加される予定である。費用分析とエラー分類を含む完全な科学論文が発表される見込みだ。根本的な疑問は変わらない。AIシステムが独立した医療決定を下す前に、まずそれが答えるべきではない時を知っているという能力を実証しなければならない。ほとんどのモデルはこの能力をまだ備えていない。
研究者は200件のX線画像で16のAIモデルをテストし、精度と正直な不確実性の両方を報酬とする指標を用いて放射線科医のパネルと比較してスコアリングした。人間の放射線科医は2,000点満点中988.7点を獲得し、最高性能のAIモデルは758点でした。スコアリングシステムは医学の現実を反映している。正しく答え、かつ高い信頼を持つと満点を獲得するが、自信を持って推測して間違うと同等のポイント損失が発生する一方、『わかりません』と言うとゼロポイントですがペナルティはありません。この設計は過信にペナルティを与え、人間の放射線科医がテストされたすべてのAIモデルを主要指標で上回った理由を明らかにしています。
純粋な素点精度だけで順位付けすると、フロンティアモデルは人間の性能に急速に近づいています。これは3ヶ月前に実施されたテストの第1版との対比は顕著です。そのときは放射線科医が83%の精度を達成し、最高性能のモデルはわずか約30%でした。その後、Gemini 3 Pro は素点精度で研修放射線科医を上回りました。しかし、この見かけの進歩は重大な欠陥を隠しています。モデルはまだ自分自身の限界についての感覚を持たないのです。Anthropic の Claude Fable 5 は信頼性と安全な回答を測定する主要指標で最高性能を発揮しました。Google の Gemini 3 Pro は最も高い素点精度を達成しました。Meta の Muse Spark 1.1 はケースを人間の放射線科医に委譲すべき時を認識するのに最も優れていました。Meta は最近、モデルが誤答を推測する代わりに回答を拒否するように訓練することで、幻覚率をほぼ半分に削減しました。その他のフロンティアモデルは逆の傾向を示しており、例えば Grok 4.5 は知識が豊富である一方で誤った回答にも確信を持つようになったため、その前身よりもはるかに多く幻覚を起こします。
オープンウェイトと医学専門モデルの性能は劣り、ほぼすべてのケースを試みながら頻繁に間違い、通常は中程度から高い信頼で間違えました。研究チームは、多くのモデルが推測する代わりに沈黙していたら、はるかに良いスコアを獲得していたであろうことを発見しました。より広範な懸念は、より多くの患者がX線画像やMRI検査画像をチャットボットにアップロードし、その回答を信頼しているということです。npj Digital Medicine の最近の研究では、広く使用されているチャットボットが医学的問題に対して頻繁に信頼できない回答を提供することが記録されています。業界幹部と投資家はAIが何ができるかを公然と大げさに表現している。モデルがすでに医師の99%以上より優れた診断を行うという主張は、ほとんどが事例集またはシミュレーションに基づくものです。4月と同じ時期に発表された21の当時最先端のモデルについての研究では、それらは監視されない臨床利用に備える準備ができていなかったことが示されました。AIシステムが独立した医療決定を下す前に、まずそれが答えるべきではない時を知っているという能力を実証しなければなりません。
この分野はこのサイクルを以前に目撃している。2016年、AI研究者の Geoffrey Hinton は、深層学習が仕事を乗っ取るため放射線科医の訓練を止めるべきだと宣言しました。ほぼ10年後、放射線科医は過負荷のままであり、Hinton は画像分析以外の職業の完全な複雑さを過小評価したことに気付き、彼の予測を取り下げました。研究チームは賭け金を明確に枠組みしている。AIシステムが自信を持って誤診を生成するという事実は、人間が不可欠のままであることを意味しています。テストフレームワーク RadLE 2.0 は継続的に拡大し、新しいモデルが追加される予定であり、費用分析とエラー分類を含む完全な科学論文が発表される見込みです。
この研究は、AIモデルがどのように訓練されるかと医学実践が何を必要とするかの基本的なズレを明らかにしている。精度だけを報酬とするベンチマークシステムはモデルに自信を持って推測するよう促すが、医学は正反対を要求する。正直な不確実性は自信を持った誤答より安全である。テストフレームワークは過信に明確なペナルティを課すため、フロンティアモデルが素点精度で人間の精度にほぼ匹敵しているにもかかわらず、人間の放射線科医が主要指標を支配した。このギャップは現実世界のリスクを指している。患者はすでにX線画像やMRI検査画像をチャットボットにアップロードしており、多くの商用AIシステムは信頼度が実際の精度を追跡しない極めて自信に満ちた誤診を生成している。
この研究は最近の業界の主張にも異議を唱える。AIが医師の99%以上より優れた診断を行うという主張は、ほとんどが事例集またはシミュレーションに基づくもので、厳密な検査に基づいていない。4月と同じ時期に、21の最先端モデルの調査では、それらは監視されない臨床利用に備える準備ができていなかった。AIシステムが独立した医療決定を下すことを信頼される前に、まずそれ自身の限界を認識し、回答を控えるという能力を実証しなければならない。ほとんどのモデルがこの能力を欠いている。テストの放射線科医はこの判断を示したが、ほとんどのモデルはそうしなかった。
AIが要約して、あなたの選んだトピックだけを1日1通。LINE・Email・Slackで届きます。
登録無料・30秒で完了・いつでも解除できます
まだコメントがありません。最初のコメントを投稿しましょう!
ログインして議論に参加200以上のソースから厳選したAIニュースを毎日無料でお届けします。
無料で始める登録無料・30秒で完了・いつでも解除できます
毎朝1分、AIの要点だけ。
200媒体以上・Email/LINE/Slack 対応