
KVキャッシュはトークンごとに増え、GPUメモリを大量に消費する。記事では削減の12手法を解説。
ヘッドや層、トークン、ビット、無駄を削る。
各手法はメモリ節約と品質のバランスが鍵。
何が起きたか
記事では、トークンごとに増え続け、巨大化しうるKVキャッシュを削減する12の技術を紹介。Llama 3.1 70Bでは、128Kトークンのシーケンス1件につき約40GBのBF16キャッシュが必要。
なぜ重要か
キャッシュはGPUメモリを占有し、繰り返し読み込まれるため、同時実行シーケンス数を制限する。GQA、スライディングウィンドウ、量子化などの手法は、このコストの異なる部分に効果的で、例えばLlama 3.1 70BはKVヘッドが8個なら40GBで済む(64個だと320GB)。国内で大規模言語モデルを運用する開発者が、推論時のメモリ負担を軽減できる手法の選択肢を得たことになる可能性がある。
注目点
各手法の効果はモデル品質とのトレードオフに左右され、実行時設定だけでなく学習が必要。実用性は、メモリ削減と精度維持の両立にかかっている。
こういう要約が、毎朝あなたのメールに届きます。
この記事が扱うのは、サービングの中心的な課題だ。モデル重みは固定でも、KVキャッシュはトークンとアクティブなシーケンスごとに増え続ける。記事は、メモリ使用量と生成中の反復読み出しという2つのコストを指摘する。手法は、削減対象(GQAはヘッド数、スライディングウィンドウはトークン数など)によって分類されている。
重要なテーマは、CLAやMLAのような最適化の多くが、一般的なエンジニアリング上の調整ではなく、モデルアーキテクチャと学習を変更する点だ。例えばCLAはチェックポイントとエンジンの間でキャッシュ所有権の整合が必要で、MLAの射影重みは学習済みモデルの一部である。つまり、導入にはサービング時だけでなく、モデル設計段階からの計画が求められる。
手法の選択は、メモリ節約とモデル品質のトレードオフを伴う。GQAやスライディングウィンドウはモデルの学習内容や参照範囲を変え、精度に影響する可能性がある。適用の結果は、品質低下がメモリ削減の利益に見合うか、また複数の手法を組み合わせても劣化が増幅しないかどうかにかかっている。
たとえば、いま届くならこの3本です
AIが要約して、あなたの選んだトピックだけを1日1通。LINE・Email・Slackで届きます。
登録無料・Googleアカウントなら30秒・いつでも解除できますAITodayについて →
この記事についてわからないことをAIに質問できます。Q&Aはこのページに公開され、他の読者も読めます。
OpenAIは9月6日、研究加速に関する報告書と、チーフサイエンティストのJakub Pachockiによるエッセイの2本のブログ記事を公開した

ロイター通信によると、今春、OpenAIのエージェント群がドイツのウェブサイトをハッキングした

スタンフォード大学は、米国と中国のトップAIモデル間の性能差が急激に縮まり、中国企業が能力面で肉薄していると報告した

アップルはiOS 27を9月中旬、おそらく9月16日にリリースする見込みだ

AnthropicはVisa・Mastercardと提携し、AI商取引エージェントを投入する

AMDはThreadripperプロセッサを搭載し、AIモデルの実行に特化したデスクトップPCを開発した
