
NvidiaはAIモデルが会話全体を再計算せずにタスクをハンドオフできる技術を導入した。
線形数学を使ってモデル間で計算状態を転送する。
従来の再計算より2.7~25倍高速で、パフォーマンスを最大98%保持する。
何が起きたか
Nvidiaの研究者が、線形数学を使ってAIモデル間で計算状態を直接マッピングするKVキャッシュ転送技術を開発した。タスクが異なるサイズのモデル間で移行する際、会話全体を再計算する必要がなくなる。
なぜ重要か
エージェント型AIシステムがモデル間でタスクをハンドオフする場合、受け取るモデルは通常、会話全体をゼロから再計算し、計算コストと遅延が増加する。これは複数のLLMワークフローを構築するエンタープライズにとって大きなボトルネックだ。新しい技術はこのペナルティを回避する。
注目点
互換性のあるモデルペアでは、線形マッピングは再計算より2.7~25倍高速に実行され、パフォーマンスを最大98%保持している。これはNvidiaの実験による。
マルチモデルAIワークフローはエンタープライズ環境で一般的になっており、複雑さとコストに応じて、タスクが特化した小さいモデルと汎用的な大きいモデルの間を流れる。従来のアプローチ—モデルがハンドオフするたびにゼロから再計算する—は複合的なオーバーヘッドを生む。新しいモデルは質問に答えるための計算リソースが必要なだけでなく、内部状態(KVキャッシュと呼ばれる)全体をそれまでの会話から再構築する必要がある。多くのやり取りを行うエージェント型システムでは、このコストが急速に積み重なり、ドル単位のコストと応答遅延の両方が増加する。
Nvidiaのソリューションは深層学習の再トレーニングを完全に回避する。新しいモデルに前のモデルの状態を「理解」させるのではなく、研究者は線形代数を使ってあるモデルのKVキャッシュを別のモデルに直接マッピングする。キャッシュは本質的に、モデルがこれまでの会話から「学んだ」ことの数学的表現であるため、これが機能する。互換性のあるモデルペアでは、マッピングはパフォーマンスを最大98%保持しながら、素朴な再計算アプローチより2.7~25倍高速に実行される。速度範囲はモデルサイズと会話長の違いを反映しており、より長いコンテキストはより大きなゲインを得る。
たとえば、いま届くならこの3本です
AIが要約して、あなたの選んだトピックだけを1日1通。LINE・Email・Slackで届きます。
登録無料・30秒で完了・いつでも解除できますAITodayについて →
この記事についてわからないことをAIに質問できます。Q&Aはこのページに公開され、他の読者も読めます。
バーンスタインのアナリストは、AIがメモリーのボトルネックを生み出しており、需要が高帯域幅メモリー(HBM)から従来型DRAM、NANDフラッシュ、ストレージへ拡大していると指摘

オープンAIのサム・アルトマンCEOはタイム誌のインタビューで、AIモデル開発を「減速する良い時期」と述べた

医療・バイオ分野のAI関連株として、メルク(MRK)が年初来42%上昇し、S&P500を約29ポイント上回った

KLAは第4四半期決算で予想を上回る利益を計上し、短期的な見通しも良好とした

ビザは2026年度第3四半期の好決算を発表し、オープンソースのAIサイバーセキュリティフレームワーク「Visa Vulnerability Agentic Harness(VVAH)」を拡充

マスターカードのマイケル・ミーバックCEOは、AI主導の商業と機械間決済を支える新プロトコル「Agent Pay」と、大手ステーブルコインプラットフォームBVNKの買収について説明した
