
何が起きたか
医療専門AI(OpenEvidenceとUpToDate Expert AI)と、GPT-5.2、Gemini 3.1 Pro、Claude Opus 4.6といった汎用言語モデルを3段階で比較評価しました。医学知識を問うMedQA500問ではGeminiが97.4%の精度で最高となり、OpenEvidenceの89.6%、UpToDateの88.4%を上回りました。実際の医師の質問100件を12人の米国医師がブラインド評価した「実臨床クエリ」ベンチマークでも、汎用モデルが医療専門ツールを上回りました。
なぜ重要か
医療専門AIツールは、その仕組みや学習方法が非公開のまま医療現場に導入されつつあります。本研究は、ドメイン特化と謳われた医療AIが、実際には一般向けの最新モデルより性能が低い可能性を示唆しており、医療現場での安全性評価の重要性を指摘しています。
注目点
実臨床クエリベンチマークでは、医師たちによる1,800件の模型・質問評価が行われました。研究は、臨床現場のAIツール導入前に独立した実世界評価が必要であることを強調しています。
たとえば、いま届くならこの3本です
AIが要約して、あなたの選んだトピックだけを1日1通。LINE・Email・Slackで届きます。
登録無料・30秒で完了・いつでも解除できますAITodayについて →
この記事についてわからないことをAIに質問できます。Q&Aはこのページに公開され、他の読者も読めます。
アナリストのミンチー・クオ氏によると、Nvidiaは大幅に再設計されたアーキテクチャを備えたAIアクセラレータ「Rubin CPX」を復活させ、生産は2027年第1四半期に開始される見込み

英AI安全研究所とLimbic AIによるUK調査で、英国成人6,474人を対象に実施

BroadcomのClayton Donley氏は、企業がAIエージェントで重要な業務を迅速に進めているが、人間の従業員向けに構築された管理策がないと指摘
OpenAIは2026年7月17日(米国時間)、「1ドルあたりの有効なインテリジェンス」という新しい評価指標を提唱した

AIエージェントの業務利用拡大に伴い、「Agentic Identity(AIに固有の身元=社員証を持たせる)」と「Delegated Authorization(人や組織の権限を条件付きの委任状として渡す)」という仕組…

欧州連合(EU)はChatGPTへの規制を拡大し、未成年者を保護する措置を義務付ける方針だ
