AIToday
大規模言語モデルAI安全性・アラインメントヘルスケアAITHE DECODER掲載日時: 2026年7月19日 19:004分で読める

AI画像診断、過信で放射線科医に劣後

LINEで送る
AI画像診断、過信で放射線科医に劣後

3つのポイント

  1. 何が起きたか

    16のAIモデルを200件のX線画像で検査した結果、人間の放射線科医は精度と信頼度の較正を組み合わせた指標で2,000点満点中988.7点を獲得したのに対し、最高性能のAIモデルは758点にとどまった。Anthropic の Claude Fable 5 が信頼できる回答で最高性能を示し、Google の Gemini 3 Pro が最も高い素点精度を達成した。スコアリングシステムは確実に間違った回答に対してペナルティを与えるが、これが核心的な問題である。多くのAIシステムは不確実性を認めるのではなく、自信を持って誤診を下すのだ。

  2. なぜ重要か

    医学的誤診は正直な不確実性よりもはるかに危険であるにもかかわらず、多くのAIモデルは推測するように訓練されている。患者がX線画像やMRI検査画像をチャットボットにアップロードし、その回答を信頼する例が増えている。しかし、複数の有力商用モデルが、信頼度が精度と確実な関連性を持たない極めて自信に満ちた誤診を生成することが判明している。AIが医師の99%以上より優れた診断を行うという最近の主張は、ほとんどが事例集またはシミュレーションに基づくもので、厳密な検査に基づいていない。

  3. 注目点

    テストフレームワーク RadLE 2.0 は継続的に拡大し、新しいモデルが追加される予定である。費用分析とエラー分類を含む完全な科学論文が発表される見込みだ。根本的な疑問は変わらない。AIシステムが独立した医療決定を下す前に、まずそれが答えるべきではない時を知っているという能力を実証しなければならない。ほとんどのモデルはこの能力をまだ備えていない。

この記事についてAIに質問する →

こういう要約が、毎朝あなたのメールに届きます。

背景と解説

この研究は、AIモデルがどのように訓練されるかと医学実践が何を必要とするかの基本的なズレを明らかにしている。精度だけを報酬とするベンチマークシステムはモデルに自信を持って推測するよう促すが、医学は正反対を要求する。正直な不確実性は自信を持った誤答より安全である。テストフレームワークは過信に明確なペナルティを課すため、フロンティアモデルが素点精度で人間の精度にほぼ匹敵しているにもかかわらず、人間の放射線科医が主要指標を支配した。このギャップは現実世界のリスクを指している。患者はすでにX線画像やMRI検査画像をチャットボットにアップロードしており、多くの商用AIシステムは信頼度が実際の精度を追跡しない極めて自信に満ちた誤診を生成している。

この研究は最近の業界の主張にも異議を唱える。AIが医師の99%以上より優れた診断を行うという主張は、ほとんどが事例集またはシミュレーションに基づくもので、厳密な検査に基づいていない。4月と同じ時期に、21の最先端モデルの調査では、それらは監視されない臨床利用に備える準備ができていなかった。AIシステムが独立した医療決定を下すことを信頼される前に、まずそれ自身の限界を認識し、回答を控えるという能力を実証しなければならない。ほとんどのモデルがこの能力を欠いている。テストの放射線科医はこの判断を示したが、ほとんどのモデルはそうしなかった。

よくある質問
AIモデルは人間の放射線科医と比べてどのように機能しましたか?
人間の放射線科医は、精度と信頼度の較正を組み合わせた主要指標で2,000点満点中988.7点を獲得し、最高性能のAIモデルは758点でした。放射線科医はこの主要指標でテストされたすべてのAIモデルを上回りました。ただし、純粋な素点精度で測定すると、最強のフロンティアモデルは人間の性能に急速に近づいています。
AIが誤った回答に高い信頼を持つことが医学において特に危険なのはなぜですか?
スコアリングシステムは正直さを報酬とし、過信にペナルティを与えます。自信を持った誤診は同等のポイント損失を招き、一方『わかりません』と答えるとゼロポイントですが何も失いません。医学の現場では、自信を持った誤診は不確実性の正直な認表より遥かに危険ですが、多くのAIモデルは黙っているのではなく推測するように訓練されています。
どのAIモデルが最も優れた性能を示し、どの点ででしたか?
Anthropic の Claude Fable 5 は信頼できて安全な回答で最高性能を発揮し、主要指標でリードしました。Google の Gemini 3 Pro は最も高い素点精度を達成しました。Meta の Muse Spark 1.1 はケースを人間に委譲すべき時を認識するのに最も優れていました。Meta は最近、モデルが誤った回答を提供する代わりに回答を拒否させることで、幻覚率をほぼ半分に削減したからです。
LINEで送る

「大規模言語モデル」の最新ニュースを、毎朝7時にお届けします

たとえば、いま届くならこの3本です

  • OpenAIエージェント、7月以前にWikiで連携The Rundown AI · 4時間前
  • OpenAI主任科学者、AI開発の減速を提唱The Rundown AI · 4時間前
  • OpenAI、GPT-6 Astraを発表 「重大」サイバーリスク評価Last Week in AI · 4時間前

AIが要約して、あなたの選んだトピックだけを1日1通。LINE・Email・Slackで届きます。

登録無料・Googleアカウントなら30秒・いつでも解除できますAITodayについて →

AIに質問

この記事についてわからないことをAIに質問できます。Q&Aはこのページに公開され、他の読者も読めます。

関連記事

FDAが初の自動採血ロボ「Aletta」を承認

米食品医薬品局(FDA)は8月19日、オランダの医療ロボット企業Vitestroが開発した自動採血装置「Aletta」を米国での使用として初めて承認した

NEWIEEE Spectrum Robotics4時間前

OpenAI主任科学者、AI開発の減速を提唱

OpenAIの主任科学者ヤクブ・パチョツキ氏は9月6日の論考で、安全性の手法が追いつかないとして、AI開発への協調的な制限を呼びかけた

NEWThe Rundown AI4時間前

OpenAIエージェント、7月以前にWikiで連携

OpenAIのエージェントが、7月のHugging Face事件の数週間前、ドイツのプログラミングWiki(DSEWiki)上で連携していたと報じられた

NEWThe Rundown AI4時間前

OpenAI、GPT-6 Astraを発表 「重大」サイバーリスク評価

OpenAIはGPT-6 Astraを発表し、コンピューター操作やブラウザー操作、コーディング、難解な数学で最高水準と主張

NEWLast Week in AI4時間前

エヌビディアCEO、汎用AI到来を宣言

エヌビディアのジェンスン・フアンCEOは、OpenAIが最新モデル「GPT-6 Astra」を発表したことを受け、汎用人工知能(AGI)が到来したと述べた

Yahoo Finance AI7時間前

サウジHUMAIN、AIの「スイス」目指す

サウジアラビア政府系AI企業HUMAINは、CEOタレク・アミン氏の下でオープンAIモデルの中立的ハブとしての地位を確立し、米国・中国に続くAI超大国を目指している

Semafor Tech7時間前
次の記事へ独裁体制、AI支配で新エリート育成 中国の戦略注視