AIToday

Xaira、遺伝子治療AIを30倍スケーリング

Latent Space19時間前
Xaira、遺伝子治療AIを30倍スケーリング

要点

Xaira Therapeuticsは、観察データではなく因座実験データで訓練された人間細胞の遺伝子発現変化を予測する新しいAIモデルX-Cellを開発した。CRISPRの実験で個々の遺伝子効果を単離することで約30倍の情報量を収集し、従来のアプローチを困難にしていたスケーリングの平坦化を克服した。相関関係から因座関係への転換により、医薬品や遺伝子編集が特定の遺伝子を標的とするときに何が起こるかを予測することで、AI駆動の医薬品開発をより実用的にすることを目指している。

こういう要約が、毎朝あなたのメールに届きます。

無料で登録 →

3つのポイント

  • 何が起きたか

    最高発見責任者Ci Chuと最高AI科学者Bo Wangが率いるXaira Therapeuticsが、X-Cellという新しいAIモデルを開発した。このモデルはCRISPR実験のデータセットX-Atlasで訓練され、個々の遺伝子変化を単離している。従来のアプローチは単一データセットで31億パラメータの壁にぶつかっていたが、因果関係データにより、パラメータと計算量の両面でスケーリングを継続できるようになった。

  • なぜ重要か

    それまでのRNA発現モデルはCELLxGENE(1億6800万細胞のデータベース)で訓練され、細胞型と状態を説明できたが、遺伝子編集や医薬品標的化時の予測ができなかった。遺伝子発現の変化は高度に相関しており、因果関係の推論が困難だったからである。X-Cellの因座データにより、遺伝子変化の実際の結果を予測でき、研究者が医薬品や遺伝子編集の効果を実験前にモデル化でき、AI駆動の医薬品開発を現実化する可能性がある。

  • 注目点

    Xairaの戦略は、X-Cellが実験室の実際の人間細胞実験に一般化するかどうかにかかっている。チームは自己回帰訓練から拡散モデルに転換し、従来のモデルを上回った線形ベースラインをX-Cellが超えたと報告している。このアプローチが検証で機能することの具体的な証拠である。

詳細

Ci Chu(最高発見責任者)とBo Wang(最高AI科学者)が率いるXaira Therapeuticsは、遺伝子が編集または医薬品で標的化されたときに人間の細胞に何が起こるかを予測するために設計されたAIモデルX-Cellを発表した。このモデルはChu氏とBoのチームが実施したCRISPR実験のデータセットX-Atlasで訓練された。これらの実験は並列で数百万のテストを実行し、各テストは単一の遺伝子を変更した場合の効果を単離し、研究者が上流および下流の遺伝子相互作用をマップし、因座関係を決定できる。これは従来の観察的アプローチを大きく上回るものである。

このプロジェクトは具体的な問題から生まれた。Chan Zuckerberg Instituteが構築した1億6800万細胞のデータベースであるCELLxGENEで訓練された初期のAIモデルは、どの遺伝子がどの細胞型と状態で発現しているかを説明できたが、遺伝子撹乱の結果を予測することはできなかった。CELLxGENEは細胞ごとに約2万~3万個の遺伝子の発現カウントをマップし、1億6800万細胞それぞれの詳細なメタデータを含む。約4兆エントリの行列であり、RNA発現モデルの多くにインスピレーションを与えている。Bo Wangはこれらのモデルの中で最も影響力のあるものの1つであるscGPTを構築し、X-Cellの出発点となった。問題は、遺伝子発現の変化は高度に相関しており、観察データだけからは因座関係を決定することがほぼ不可能だということだった。

スケーリング制限は明らかだった。単一の小さなデータセットで訓練されたXairaの初期の31億パラメータモデルは、訓練損失が続く一方でテスト損失が横ばいになるプラトーに達した。これは情報不足の特徴である。「この壁を超えてパフォーマンスを改善するには、パラメータも計算もできない」とチームは発見した。「遺伝子発現の変化を予測するには、より情報豊富なデータが必要である」CRISPR撹乱を通じた因座実験データを収集することで、約30倍多くの情報を生成し、チームはその壁を突き破った。モデルはパラメータと訓練計算の両方でスケーリングを続けることができるようになった。この取り組みは、データ収集とインフラストラクチャに数千万ドル、さらに計算、人員、研究に数百万ドルのコストがかかったと考えられる。これは従来の事前訓練ではなく、強化学習ロールアウトに似た予算構造である。

X-Cellは検証で自己回帰訓練を放棄して拡散に転向し、従来のRNA発現モデルをすべて上回った線形ベースラインを上回ることを実証した。チームは実際の人間細胞の実験室実験への一般化を報告しているが、その検証の詳細はポッドキャスト全体で見られる予定である。このアプローチは、AI駆動の医薬品開発の戦略転換を表している。Xairaは、モデルサイズだけをスケーリングするのではなく、遺伝子発現の変化の原因となるデータである因座情報が、医薬品の有効性と毒性を予測するための制限要因であると賭けている。

背景と解説

Xairaの研究を推進する中心的な洞察は、遺伝子発現モデリングにおける相関関係と因座関係の区別である。CELLxGENEで訓練された従来のAIモデルは、どの遺伝子がどの細胞で発現しているかを捉えられるが、遺伝子が撹乱されたときに何が起こるかを確実に予測することはできない。遺伝子発現の変化は高度に相互依存しており、観察データだけから因座方向を逆算することはほぼ不可能だからである。Xairaの解決策は、CRISPRを使って一度に1つの遺伝子を撹乱する実験データを収集し、数百万の並列テストを実行して因座関係を明示的にエンコードするデータセットを構築することである。この因座データが瓶首であることが判明した。チームの初期モデルは31億パラメータで平坦化したのは、小さく相関的なデータセットがその情報内容を使い果たしたからだが、データを約30倍スケーリングすることでパラメータと計算が増加するにつれて改善が続いた。これは、モデルが容量ではなく以前は情報不足だったという古典的な信号である。Chuを最高発見責任者に、Wangを最高AI科学者に昇進させたことは、Xairaがこのデータ中心で因座モデリングのアプローチを長期的な医薬品発見戦略の中心と見ているのを示す。

よくある質問

X-Atlasとは何か、どのように構築されたのか
X-Atlasはchu氏とBoのチームがCRISPR実験を使って構築したデータセットで、並列で数百万のテストを実行する。各テストは一度に1つの遺伝子の変化の効果を単離し、チームは与えられた標的の上流と下流にある遺伝子を観察し、遺伝子相互作用の因座マップを構築できる。
なぜ旧モデルはスケーリングに失敗したのか
単一の小さなデータセットで訓練された31億パラメータモデルは平坦化に達した。訓練損失が続く一方でテスト損失は横ばいになり、モデルがデータ内の情報によって制限されていることを示した。この壁を超えてパフォーマンスを向上させることはできず、より情報豊富なデータだけが追加のスケーリングを可能にした。
CELLxGENEとの関連性は何か
CELLxGENEはChan Zuckerberg Instituteが構築した1億6800万細胞のデータベースで、細胞型と状態全体のRNA発現カウントをマップしている。このデータベースはRNA発現モデルの多くにインスピレーションを与え、Bo Wangの影響力のあるモデルの1つであるscGPTを含む。scGPTはXairaのX-Cellの出発点となった。

「ヘルスケアAI」の最新ニュースを、毎朝7時にお届けします

AIが要約して、あなたの選んだトピックだけを1日1通。LINE・Email・Slackで届きます。

登録無料・30秒で完了・いつでも解除できます

ディスカッション

まだコメントがありません。最初のコメントを投稿しましょう!

ログインして議論に参加

関連記事

AIニュースを毎日お届け

200以上のソースから厳選したAIニュースを毎日無料でお届けします。

無料で始める

登録無料・30秒で完了・いつでも解除できます

毎朝1分、AIの要点だけ。

200媒体以上・Email/LINE/Slack 対応

無料で受け取る →