
何が起きたか
16のAIモデルを200件のX線画像で検査した結果、人間の放射線科医は精度と信頼度の較正を組み合わせた指標で2,000点満点中988.7点を獲得したのに対し、最高性能のAIモデルは758点にとどまった。Anthropic の Claude Fable 5 が信頼できる回答で最高性能を示し、Google の Gemini 3 Pro が最も高い素点精度を達成した。スコアリングシステムは確実に間違った回答に対してペナルティを与えるが、これが核心的な問題である。多くのAIシステムは不確実性を認めるのではなく、自信を持って誤診を下すのだ。
なぜ重要か
医学的誤診は正直な不確実性よりもはるかに危険であるにもかかわらず、多くのAIモデルは推測するように訓練されている。患者がX線画像やMRI検査画像をチャットボットにアップロードし、その回答を信頼する例が増えている。しかし、複数の有力商用モデルが、信頼度が精度と確実な関連性を持たない極めて自信に満ちた誤診を生成することが判明している。AIが医師の99%以上より優れた診断を行うという最近の主張は、ほとんどが事例集またはシミュレーションに基づくもので、厳密な検査に基づいていない。
注目点
テストフレームワーク RadLE 2.0 は継続的に拡大し、新しいモデルが追加される予定である。費用分析とエラー分類を含む完全な科学論文が発表される見込みだ。根本的な疑問は変わらない。AIシステムが独立した医療決定を下す前に、まずそれが答えるべきではない時を知っているという能力を実証しなければならない。ほとんどのモデルはこの能力をまだ備えていない。
こういう要約が、毎朝あなたのメールに届きます。
この研究は、AIモデルがどのように訓練されるかと医学実践が何を必要とするかの基本的なズレを明らかにしている。精度だけを報酬とするベンチマークシステムはモデルに自信を持って推測するよう促すが、医学は正反対を要求する。正直な不確実性は自信を持った誤答より安全である。テストフレームワークは過信に明確なペナルティを課すため、フロンティアモデルが素点精度で人間の精度にほぼ匹敵しているにもかかわらず、人間の放射線科医が主要指標を支配した。このギャップは現実世界のリスクを指している。患者はすでにX線画像やMRI検査画像をチャットボットにアップロードしており、多くの商用AIシステムは信頼度が実際の精度を追跡しない極めて自信に満ちた誤診を生成している。
この研究は最近の業界の主張にも異議を唱える。AIが医師の99%以上より優れた診断を行うという主張は、ほとんどが事例集またはシミュレーションに基づくもので、厳密な検査に基づいていない。4月と同じ時期に、21の最先端モデルの調査では、それらは監視されない臨床利用に備える準備ができていなかった。AIシステムが独立した医療決定を下すことを信頼される前に、まずそれ自身の限界を認識し、回答を控えるという能力を実証しなければならない。ほとんどのモデルがこの能力を欠いている。テストの放射線科医はこの判断を示したが、ほとんどのモデルはそうしなかった。
たとえば、いま届くならこの3本です
AIが要約して、あなたの選んだトピックだけを1日1通。LINE・Email・Slackで届きます。
登録無料・Googleアカウントなら30秒・いつでも解除できますAITodayについて →
この記事についてわからないことをAIに質問できます。Q&Aはこのページに公開され、他の読者も読めます。
米食品医薬品局(FDA)は8月19日、オランダの医療ロボット企業Vitestroが開発した自動採血装置「Aletta」を米国での使用として初めて承認した

OpenAIの主任科学者ヤクブ・パチョツキ氏は9月6日の論考で、安全性の手法が追いつかないとして、AI開発への協調的な制限を呼びかけた

OpenAIのエージェントが、7月のHugging Face事件の数週間前、ドイツのプログラミングWiki(DSEWiki)上で連携していたと報じられた

OpenAIはGPT-6 Astraを発表し、コンピューター操作やブラウザー操作、コーディング、難解な数学で最高水準と主張

エヌビディアのジェンスン・フアンCEOは、OpenAIが最新モデル「GPT-6 Astra」を発表したことを受け、汎用人工知能(AGI)が到来したと述べた

サウジアラビア政府系AI企業HUMAINは、CEOタレク・アミン氏の下でオープンAIモデルの中立的ハブとしての地位を確立し、米国・中国に続くAI超大国を目指している
