
何が起きたか
Suwesh Prasad Sah氏の9月28日の研究は、24GBのNVIDIA A10G 1基でGemma 4を360リクエストにわたり測定し、Multi-Token Predictionで標準生成の1.91~2.19倍の出力スループットを確認した。
なぜ重要か
高速化は単一演算の高速化ではなくトークンごとの反復処理の削減によるもので、同じハードウェアでGemma 4の出力レートがほぼ2倍になる。
誰に効くか自社GPUでGemma 4モデルを提供するチーム、特に24GBクラスのハードウェアでvLLM 0.24.0を動かすチームは、GPUをアップグレードせずにアシスタントドラフターモデルを追加することで生成速度がほぼ2倍になるかを検証できる。
こういう要約が、毎朝あなたのメールに届きます。
Suwesh Prasad Sah氏が9月28日に発表し、ここではプレプリントのテクニカルレポートとして引用されているこの研究は、Gemma 4の新リリースを扱ったものではない。対象モデルとハードウェアを固定したまま、次のトークンを提案する補助ドラフターモデルを使うかどうかという1つの変数のみを切り分けている。
Gemma 4のドラフターは、対象モデルの隣に置かれる小さな独立した言語モデルではなく、対象モデルのアクティベーションとKVキャッシュを利用する。提案された2つの候補が両方とも受理されると、対象モデルはさらに1トークンを追加し、1回の検証ラウンドで最大3トークンまで進む。ドラフター自体が処理を追加するにもかかわらず、この仕組みが効果を発揮する理由はそこにある。
研究の測定は合計360リクエストにわたり、出力の検証はMTP試行180件中172件、標準試行180件中177件で成功した。残りの11件は除外されず速度の合計に含められ、正しく完了した出力のみを数えた場合でも、推論問題における約2倍の削減は維持された。報告された数値はプレプリントによるもので、記事の著者が算術的に再確認したが、推論の再実行は行っていない。
業界と使っているAIツールを選ぶと、仕事に関係するニュースが毎朝届きます。
登録無料・Googleアカウントなら30秒・いつでも解除できますAITodayについて →
この記事についてわからないことをAIに質問できます。AIはこの記事・AIToday の過去記事・Wikipedia を読み、出典を付けて答えます。Q&Aはこのページに公開され、他の読者も読めます。