AIToday
大規模言語モデルオープンソースAIQiita 機械学習掲載日時: 2026年10月8日 19:00

Gemma 4、MTPで最大2.19倍高速化

LINEで送る
Gemma 4、MTPで最大2.19倍高速化

3つのポイント

  1. 何が起きたか

    Suwesh Prasad Sah氏の9月28日の研究は、24GBのNVIDIA A10G 1基でGemma 4を360リクエストにわたり測定し、Multi-Token Predictionで標準生成の1.91~2.19倍の出力スループットを確認した。

  2. なぜ重要か

    高速化は単一演算の高速化ではなくトークンごとの反復処理の削減によるもので、同じハードウェアでGemma 4の出力レートがほぼ2倍になる。

誰に効くか自社GPUでGemma 4モデルを提供するチーム、特に24GBクラスのハードウェアでvLLM 0.24.0を動かすチームは、GPUをアップグレードせずにアシスタントドラフターモデルを追加することで生成速度がほぼ2倍になるかを検証できる。

わからないところ、AIに聞けます

質問と回答はこのページに公開されます。

こういう要約が、毎朝あなたのメールに届きます。

背景と解説

Suwesh Prasad Sah氏が9月28日に発表し、ここではプレプリントのテクニカルレポートとして引用されているこの研究は、Gemma 4の新リリースを扱ったものではない。対象モデルとハードウェアを固定したまま、次のトークンを提案する補助ドラフターモデルを使うかどうかという1つの変数のみを切り分けている。

Gemma 4のドラフターは、対象モデルの隣に置かれる小さな独立した言語モデルではなく、対象モデルのアクティベーションとKVキャッシュを利用する。提案された2つの候補が両方とも受理されると、対象モデルはさらに1トークンを追加し、1回の検証ラウンドで最大3トークンまで進む。ドラフター自体が処理を追加するにもかかわらず、この仕組みが効果を発揮する理由はそこにある。

研究の測定は合計360リクエストにわたり、出力の検証はMTP試行180件中172件、標準試行180件中177件で成功した。残りの11件は除外されず速度の合計に含められ、正しく完了した出力のみを数えた場合でも、推論問題における約2倍の削減は維持された。報告された数値はプレプリントによるもので、記事の著者が算術的に再確認したが、推論の再実行は行っていない。

よくある質問
Gemma 4におけるMulti-Token Predictionの高速化はどの程度か?
9つの固定プロンプトで出力スループットは1.91~2.19倍に上昇したが、初回出力時間は10.0~14.2%しか短縮されず、最大の改善は最初のトークン以降の生成にある。
GPUカーネル自体が速くなっていないのに、なぜ高速化したのか?
代表的なカーネルは通常2.78ms、MTP使用時2.79msだったが、出力トークンあたりのCUDA Graphの反復実行回数が56.4~78.1%減少し、同じ処理の呼び出し回数が大幅に減った。
本番環境でも同じ高速化が保証されるか?
保証されない。360回の測定は9つの固定プロンプトを各20回、同時実行数1で繰り返したもので、実際の本番負荷での性能は別途測定する必要がある。
Qiita 機械学習元記事を読む
LINEで送る

あなたの仕事に関係するAIニュースを、毎朝お届けします。

業界と使っているAIツールを選ぶと、仕事に関係するニュースが毎朝届きます。

登録無料・Googleアカウントなら30秒・いつでも解除できますAITodayについて →

AIに質問

この記事についてわからないことをAIに質問できます。AIはこの記事・AIToday の過去記事・Wikipedia を読み、出典を付けて答えます。Q&Aはこのページに公開され、他の読者も読めます。

質問と回答はこのページに公開されます。

次の記事へNous Researchが9000万ドル調達