
AI は企業が数百万化合物を物理的にスクリーニングする代わりに計算的に候補を設計できるようにして創薬を変革しているが、この転換は根本的なデータ問題を露呈させた。公開データセットは成功例のみを圧倒的に含み、失敗を AI モデルに見えなくしている。負のデータ——失敗実験、機能しない化合物——へのアクセスがなければ、モデルはバイアスを回避し信頼できる予測をするよう訓練できない。医薬品業界は生成 AI で捏造データの作成が容易になり、1 医薬品あたり 10 億ドル~25 億ドルのコストがかかる部門でデータ完全性の賭け金が高まっている。
こういう要約が、毎朝あなたのメールに届きます。
無料で登録 →何が起きたか
AI は医薬品研究を分子ライブラリーの物理的スクリーニングから計算予測へ転換させているが、重大なボトルネックが浮き彫りになった。公開データセットの大半は成功例のみで、失敗実験が欠落しているため、AI モデルは不完全な情報で訓練されバイアスを回避し信頼性を高めるのに必要な失敗データを欠いている。
なぜ重要か
新薬開発には 10~15 年を要し 10 億ドル~25 億ドルの費用がかかり、失敗率は 90% を超える。AI は業界が開発期間短縮と成功率向上に賭けている最大のツールだ。しかし負のデータ(結合しない化合物、失敗実験)にアクセスできなければ、モデルは正確な予測ができず、生成 AI で捏造や改ざんが容易になった今、訓練データに使われれば「潜在的に壊滅的な結果」をもたらしかねない。
注目点
AI 駆動型設計で発見された医薬品は今のところ FDA の完全承認を受けていないが、Belcher は今後 2~3 年で変わると予想している。将来像は完全自動化ラボで、予測・試験・最適化を循環させながら結果を AI モデルへ還元するものだが、これには相互運用可能な実験機器と構造化・包括的なデータセットが必要で、ほとんどのラボはまだそれを保有していない。
創薬は現代ビジネスにおける最も高額でリスクの高い事業の一つだ。1950 年代以来、新薬開発コストはおよそ 9 年ごとに倍増している——Eroom の法則と呼ばれるパターン。今日、単一の医薬品を市場に送り出すには平均 10~15 年を要し、コストは 10 億ドル~25 億ドルの範囲で、失敗率は 90% を超える。高コスト、長い期間、頻繁な失敗のこの組み合わせが医薬品業界を確率を変えるツール探索へ追い立て、AI がそこへの最大の賭けになった。
AI を医薬品に応用する中で最も見込みを示す分野はヒット同定だ——疾患標的(タンパク質など)に対する分子ライブラリーをスクリーニングし、それらに結合する分子を見つけるプロセス。従来これは、二項的閾値ベース技術を使用して数十万または数百万の化合物を物理試験することを意味し、イエスかノーかの答えのみが得られた。医薬品企業は今、AI を使ってゼロから医薬品候補を設計し、研究開発へリソースを投じる前に、それらがいかに疾患標的と相互作用するかを予測している。これは物理スクリーニング限界という制約を排除する。グローバルライフサイエンス企業 Cytiva のタンパク質研究戦略責任者 Paul Belcher は説明する:「AI はそれを排除する。そして物理試験の前に低質候補を除外するのに役立ち、時間とリソースを節約できる。」しかし AI には難しい制限がある。新規化合物の動力学や開発可能性をまだ確実に予測できないため、すべての AI 生成候補は依然として実験室での検証を必要とする。
AI 設計候補への転換は実験室チームに新たな圧力を作った。従来的なスクリーニングワークフローは単純な技術を使って大量のヒットを見つけるよう構築されていた。今、ラボはますます複雑で多様な化合物の増加量を試験、特性評価、精製しなければならない。Belcher は指摘する:「AI はヒットの数を増やすことができ、潜在的により良い質のヒットも提供できる。その後、それらのヒットを検証・特性化するため、より高スループットで情報豊かなテクノロジーへの需要が高まる。」しかし、より大きな問題は上流にある。そもそも AI モデルの訓練に使われるデータだ。
多くの初期 AI モデルは公開データセットで訓練され、今 Belcher が「データの壁」と呼ぶものに当たっている。すべてのモデルが同じデータへアクセスするため、収益逓減とともに同様の結論に達する。より根本的には、これらのデータセットは AI を念頭に置いて構築されなかった——モデルの正確性と偏りのなさを保つのに必要な構造、ラベリング、多様性に欠ける。出版バイアスが事態を悪化させる。「大半の公開データセットと科学出版は成功例のみに焦点を当てる」と Belcher は言う。「誰も失敗を共有したくない。このバイアスはほぼ片手を背中に縛られているようなものだ。AI モデルは成功に関連するパターンを識別できるが、予測をより信頼できるものにするはずの失敗の包括的理解に欠ける。」モデルを最も改善するはずのデータ——失敗実験と結合しない化合物——は実験ノートと個人ファイルに残されたままだ。「失敗データのジャーナルがあるべきと冗談交じりに言うことがしばしばある」と Belcher は付け加える。「それはしばしば実験ノートに埋もれており、将来の研究を知らせたり導いたりするのに決して使われない。」
負のデータへアクセスなしに、モデルはバイアスを回避するよう適切に訓練できない。このリスクは生成 AI が実験結果の捏造を今すぐ可能にする容易さにより複雑化する。Belcher はオランダの微生物学者 Elisabeth Bik の研究を引用し、生物医学論文の約 4% が重複または改ざん画像を含んでいたことを指摘する——これは AI ツールが広く利用可能になる前の 2016 年だ。「改ざんまたは捏造データは科学において常に問題だったが」Belcher は言う「AI の世界では、特にモデル訓練に使われた場合、潜在的に壊滅的な結果をもたらしかねない。データが改ざんされていないことを検証するためのツールがもっと必要だ。」一部ベンダーはこれに対処し始めている。Cytiva はセキュアハッシュアルゴリズム(ブロックチェーンで使われる同じテクノロジー)を使って科学画像が改ざんされたかを検出する Image Integrity Checker を開発した。
前方を見ると、Belcher は完全自動ラボの将来を描く——時にダークラボまたはループ内ラボと呼ばれる。これらの施設は 24 時間稼働し、予測、試験、最適化を循環させながら結果を AI モデルへ還元して次の実験ラウンドを導く。より良い出発点と最適化ラウンドの増加は、より少ない欠陥で臨床に到達した候補が良くなるはずだ。しかしラボの自動化は統合に大きく依存する。「今日、ラボの多くの機器はスタンドアロンだ」と Belcher は説明する。「世界最高のテクノロジーがあっても、それがクローズドエコシステムなら——ユーザーがデータを取り出せなければ——役に立たない。」統合インフラは、計算予測と物理試験のループを閉じるよう、実験室が規模で FAIR データ(検出可能、アクセス可能、相互運用可能、再利用可能)を生成し、各世代の実験が次の世代の AI モデルへ情報を供給できるようにするだろう。
AI 駆動型創薬は依然初期段階にある。注目すべきは、AI 駆動型設計で主に発見された医薬品はまだ FDA の完全承認を受けていないこと。ただし Belcher はこのマイルストーン今後 2~3 年で達成されると予想している。最終目標は Belcher が言う「有効性と毒性の完全インシリコ予測で、大多数の物理ウェット実験室業務への必要性を排除する」こと。しかし、モデル成熟を超えるという重大な障壁が残る。規制上のハードル、コスト上の課題を含む。スタンフォード研究は最先端 AI モデルの訓練コストが 2016 年以来毎年 2 倍以上になっていることを見出し、既に例外的に高い研究開発支出で定義される業界へ財務圧力を追加している。Belcher は緊張を認めるが楽観的で続ける。「コスト観点とリスク観点から、AI とウェット業務の間にバランスがある点に到達すると思う。計算コストが臨床開発コストを決してしのがない限り、AI は優位性になるだろう。」
医薬品業界が AI を創薬期間短縮と成功率向上のツールとして採用することは、厳しい現実と衝突した。これらのモデルを訓練するデータインフラが根本的に不完全なのだ。医薬品開発は既に膨大なコストと時間圧力の下にある——平均期間は 10~15 年、研究開発費は 10 億ドル~25 億ドル、失敗率は 90% を超える——ため、効率化の価値は計り知れない。AI の初期の有望さはヒット同定にあり、分子候補を計算的に設計し低質の候補を物理試験前にふるい落とし、研究者が手作業でスクリーニング可能な範囲という制約を排除できる。しかしこの転換は新たな需要を生じた。AI 生成候補はより多数で多様性に富み、従来の二項スクリーニングより高スループットで豊かなデータを伴う検証・特性評価のため、実験室チームに圧力をかけている。
核心的な問題は AI モデルの訓練に使われるデータセットが AI 向けに構築されなかったことだ。出版バイアス(成功例のみ)を含み、構造注釈に欠け、失敗モードの理解と堅牢な予測を可能にするはずの負のデータ——失敗化合物、不成功な結合実験——を省いている。研究者の冗談として「負のデータのジャーナルがあるべき」とは言うが、失敗実験は代わりに実験ノートに埋もれ共有されない。これは機械学習のパラドックスを生み出す。モデルは結果の包括的範囲へのアクセスなしにバイアスを回避するよう適切に訓練できない。リスクを複雑にするのは、生成 AI が実験データの捏造を自明なものにしたが、既に 2016 年時点で生物医学論文の約 4% が重複または改ざん画像を含んでいたこと(AI ツール一般化前)だ。改ざんされたデータが訓練に使われた場合、モデル信頼性にとって賭け金は実存的である。
前進の道は計算予測と物理実験のループを閉じることを要求する。自律ラボ——24 時間稼働し、予測、試験、最適化を循環させながら結果を AI モデルへ還元する——は業界の展望を表すが、実現は統合に依存する。相互運用可能な実験機器、高度に構造化・包括的なデータセット、出入りするデータフロー。大多数のラボは今日、クローズドエコシステム内のスタンドアロン機器で稼働している。インフラが FAIR データ(検出可能、アクセス可能、相互運用可能、再利用可能)の規模生成を可能にするまで、AI 駆動型創薬の完全な可能性は制約されたままである。
AIが要約して、あなたの選んだトピックだけを1日1通。LINE・Email・Slackで届きます。
登録無料・30秒で完了・いつでも解除できます
まだコメントがありません。最初のコメントを投稿しましょう!
ログインして議論に参加200以上のソースから厳選したAIニュースを毎日無料でお届けします。
無料で始める登録無料・30秒で完了・いつでも解除できます