AIToday

医療AIに重大欠陥、OpenAI等で共通

Fortune AI2時間前LINEで送る
医療AIに重大欠陥、OpenAI等で共通

要点

大手テック企業と医療プラットフォームの AI ツールを 1,100 件の実際の臨床ケースでテストした新しい独立調査では、テストされたすべてのシステムにおいて、最も一般的な有害なエラーが欠落であることがわかった。つまり、AI が間違ったことを述べたのではなく、重要な情報を見落としたということだ。Doximity の Ask ツールが最高の性能を発揮したが、この研究は、最高のパフォーマンスを発揮している医療 AI にも存在する継続的な欠陥を強調している。医師が頼っているものを見落としている。FDA が 1 月に AI 監視を緩和し、州が新しい法律で要件を厳しくする中、この調査は医療 AI の採用における中心的な課題を浮き彫りにしている。AI 支援による診断または治療推奨が間違った場合、誰が責任を負うかについての未解決の責任問題である。

こういう要約が、毎朝あなたのメールに届きます。

無料で登録 →

3つのポイント

  • 何が起きたか

    スタンフォード大学とハーバード大学、ARISE ネットワークの研究者が構築した新しい独立ベンチマーク「NOHARM」が、OpenEvidence、Doximity、OpenAI(GPT-5.6 Sol)、Anthropic(Claude Fable 5)の AI ツールを、医師の注釈約 13,000 件を含む 1,100 件の実際の臨床ケースでテストした。Doximity Ask が最初にランク付けされたが、重要な発見は、すべてのシステムで有害なエラーの 76.6% が欠落であるということだった。つまり AI が何かを削除してしまい、事実に反することを述べたのではなく、何かを見落としたということだ。

  • なぜ重要か

    医療 AI における欠落は、医師から治療現場で重要な情報を奪うため、特に危険である。Scripps Research の心臓病専門医 Eric Topol は、欠落エラーはほぼゼロに近づける必要があり、今日のモデルは改善されているにもかかわらず「準備完了の幻想」を維持していることを指摘した。タイミングは重要である。FDA は 1 月に AI 監視を緩和したが、2026 年に州は AI 支援による決定が患者に届く前に人間の承認を要求する 12 以上の新しい法律を可決しており、医療過誤責任は法的に不明確なままである。

  • 注目点

    OpenEvidence の CEO Daniel Nadler は NOHARM の方法論に異議を唱え、この調査は査読されていないと述べ、Doximity の完全記憶アプローチが再テストの対象となるべきかどうかに疑問を呈した。未解決の責任問題──モデルの提案が間違っていた場合、医師、病院、または AI ベンダーのいずれが責任を負うかということ──は、規制当局、病院システム、および投資家が今後医療 AI にどのようにアプローチするかを形作る可能性が高い。

詳細

OpenEvidence は 2021 年に設立された無料の広告サポート型医療 AI 検索エンジンで、査読済みの医学雑誌から回答を取得し、エビデンスの強度にラベルを付ける。医療 AI ブームのポスター チャイルドとなっており、約 1 年間で約 7 億ドルをほぼ調達した。2 月に 10 億ドルで評価され、7 月に 35 億ドルに成長し(GV と Kleiner Perkins が共同主導)、10 月に 60 億ドル、1 月に 120 億ドルで、Thrive Capital と DST Global が共同主導するラウンドとなった。

Doximity は医師向けの専門ネットワーク プラットフォームで、異なるアプローチをとっている。医師が患者ノートを要約したり、薬物相互作用をチェックしたり、ドキュメントを作成したりするのを支援する Ask という AI アシスタントを販売している。Ask は 150 以上の医療システムとの有料エンタープライズ契約に統合されており、すべての回答は医師が AI 出力を引用している元のソースに照合して検証する PeerCheck という人間レビュー層を通過する。Doximity は春の四半期収益が 1 億 4,540 万ドルで、前年比 5% 増を計上した。

7 月中旬、スタンフォード大学、ハーバード大学、ARISE ネットワークの研究者は、これらのツールをテストするために NOHARM という独立ベンチマークを立ち上げた。調査では、4 つのシステムそれぞれ──Doximity Ask、OpenEvidence の AI ツール、OpenAI の GPT-5.6 Sol、Anthropic の Claude Fable 5──を 1,100 件の実際の臨床ケースで実行した。各モデルを患者への害についてスコアリングするために約 13,000 件の医師の注釈を収集した。Doximity Ask が最初にランク付けされた。しかし、OpenEvidence の CEO Daniel Nadler は Doximity のスコアの正確性に異議を唱え、メール内で「厳密な調査方法論は、完全記憶を持つ AI が『再テスト』を求めることを許可しない」と述べ、NOHARM 調査自体は査読されていないと述べた──「医学でさえ最も不正な医学的結論についての基本的なテーブル ステーク要件」。

しかし、実際の発見はランクについてではなかった。テストされたすべての AI システムで、有害なエラーの 76.6% が欠落であった──AI が何かを見落としたのであって、事実に反することを述べたのではない。Scripps Research の心臓病専門医で Doximity の PeerCheck プログラムの共同議長である Eric Topol は、その重要性を強調し、診断エラーの研究に人生をかけてきた。「欠落エラーはできるだけゼロに近い状態に保つ必要がある」と述べた。彼は、今日のモデルは医療 AI が改善されても「準備完了の幻想」を維持しており、医師は AI なしよりも AI を備えた医師の方がより良いケアを提供していることを指摘した。しかし、欠落問題は、人間による監視が AI のギャップをキャッチして修正する方法についての仮定を損なう。

規制環境はさらに複雑になっている。FDA は 1 月に AI 駆動型臨床意思決定支援ツールに対する姿勢を緩和し、医師が AI の推論を独立して確認できるかぎり、より多くの操作の余地を与えた。しかし、州は反対方向に動いており、医療での AI 使用を管理する 2026 年に 12 州以上の新しい法律を可決した──ほとんどが AI 支援による決定が患者に到達する前に人間が署名することを要求している。医療過誤法はどちらのトレンドにも追いついていない。裁判所はまだ誰が責任を負うか──医師、病院、または AI ベンダー──モデルの提案が間違った場合に責任を負うかを解きほぐしている。その法的グレーゾーンは、規制当局、病院システム、および医療 AI の次の波の投資家が今後医療 AI について何を求めるかについて、早期の信号となる可能性が高い。

背景と解説

NOHARM 調査は、医療 AI 規制の極めて重要な時期に到来する。FDA の 1 月の AI 駆動型臨床意思決定支援ツールの監視緩和の決定は、医師が AI の推論を独立して確認できなければならないという条件付きだった。これと対照的に、2026 年に 12 州以上が AI 支援による決定が患者に到達する前に人間の承認を要求する新しい法律を可決した。この相違は、医療 AI を安全に管理する方法についての深い不確実性を反映している。規制当局と法制度のいずれも、AI の推奨が間違った場合に誰が責任を負うかは決定していない。調査が強調する相違点──誤った声明ではなく、欠落が最も害をもたらすということ──は、この課題の核心に触れている。症状または薬物相互作用について沈黙している AI は、医師がそれを探すべきことをすでに知っていない限り、医師による事実確認ができず、人間によるレビューだけで AI エラーをキャッチして修正できるという仮定を損なう。

OpenEvidence の急速な成長(2 月の 10 億ドルの評価から 1 月の 120 億ドルへ)は、無料でエビデンスに基づいた医療 AI に対する投資家の熱意を反映しており、Doximity のエンタープライズ モデル(春の四半期収益が 1 億 4,540 万ドルで、前年比 5% 増)は、追加の保護措置付きの病院ワークフローに組み込まれた AI ツールの需要を示している。しかし、両方のアプローチは、より優れたパフォーマンス スコアと人間による監視が欠落問題を解決できることを前提としている。NOHARM データは異なることを示唆している。最高のパフォーマンスを発揮するモデルでもギャップが残っている。CEO Daniel Nadler の防御──調査は査読されていないし、Doximity の方法論に疑問を呈する──は、より広い緊張を反映している。医療 AI ベンダーとプラットフォームは、医療実践を支配するエビデンス フレームワークと責任ルールが適応できるよりも速く成長している。

よくある質問

NOHARM ベンチマークとは何か。
NOHARM は、スタンフォード大学、ハーバード大学、ARISE ネットワークの研究者が構築した独立ベンチマークで、1,100 件の実際の臨床ケースで AI ツールをテストし、約 13,000 件の医師の注釈を収集して、各モデルを患者への害についてスコアリングした。
テストで最高のパフォーマンスを発揮した AI ツールはどれか。
Doximity Ask は NOHARM 調査で最高の成績を収めた。Doximity は医師向けの専門ネットワーク プラットフォームで、医師が患者ノートを要約したり、薬物相互作用をチェックしたり、ドキュメントを作成したりするのを支援する AI アシスタント Ask も販売している。医師が AI 出力を引用元と照合して検証する PeerCheck という人間レビュー層がある。
調査で最も一般的なエラーのタイプは何か。
テストされたすべての AI システムで、有害なエラーの 76.6% が欠落であった。つまり、AI が何かを見落としたのであって、事実に反することを述べたのではない。

「ヘルスケアAI」の最新ニュースを、毎朝7時にお届けします

AIが要約して、あなたの選んだトピックだけを1日1通。LINE・Email・Slackで届きます。

登録無料・30秒で完了・いつでも解除できます

ディスカッション

まだコメントがありません。最初のコメントを投稿しましょう!

ログインして議論に参加

関連記事

AIニュースを毎日お届け

200以上のソースから厳選したAIニュースを毎日無料でお届けします。

無料で始める

登録無料・30秒で完了・いつでも解除できます