AIToday
大規模言語モデルDaily Dose of Data Science掲載日時: 2026年6月25日 10:002分で読める

推測デコーディング技術の新モデルが1000トークン/秒以上を達成、従来の2~3倍の速度上限を突破しました。

LINEで送る
推測デコーディング技術の新モデルが1000トークン/秒以上を達成、従来の2~3倍の速度上限を突破しました。

要点

  • Modal が新しい DFlash ドラフトモデルをリリースし、推測デコーディングによる推論速度の上限を従来の 2~3 倍から大幅に超える水準へ引き上げました。

  • Qwen 3.5 122B-A10B では 1000 トークン/秒以上の速度を達成し、従来の 250 トークン/秒から 4 倍以上高速化しています。

  • ブロック拡散方式により複数トークンを並列に予測し、ターゲットモデルの内部表現を活用することで、トークン採用率が大幅に向上した結果です。

3つのポイント

  1. 何が起きたか

    Modal が新しい DFlash ドラフトモデルを Qwen モデル向けにリリースしました。従来の推測デコーディングは 1 トークンずつ予測する方式で 2~3 倍の速度上限に留まっていましたが、DFlash はブロック拡散モデルを使って複数トークンを一度に並列予測するため、この上限を超えることができます。Qwen 3.5 122B-A10B では 250 トークン/秒から 1000 トークン/秒以上に高速化しました。

  2. なぜ重要か

    推論処理の高速化は、AI サービスの応答時間短縮やコスト削減に直結するため、LLM を実運用するビジネスにとって重要な課題です。DFlash モデルが実データに基づいて訓練されているため、提案トークンの採用率が baseline の 3 から 9 以上に向上し、より実用的な速度向上が実現できるとみられます。

  3. 注目点

    DFlash ドラフトモデルは既に vLLM、SGLang、Transformers に統合済みであり、HuggingFace で Qwen および他のモデルファミリー向けに提供されています。

この記事についてAIに質問する →

よくある質問

従来の推測デコーディングとの違いは何ですか?
従来の推測デコーディングは、小さなドラフトモデルが 1 トークンずつ左から右へ順序立てて生成するため、2~3 倍の速度上限に留まっていました。DFlash はブロック拡散モデルを使って複数トークンを一度に並列処理するため、ドラフトコストが一定に抑えられ、より高い速度向上が可能になります。
採用率が重要なのはなぜですか?
LLM の推論処理はメモリ読み込み律速であり、各ステップはモデルの重みを GPU メモリから計算ユニットに移動するのにほとんどの時間を費やします。ドラフトモデルが提案したトークンがターゲットモデルに採用される割合(採用率)が高いほど、スループットが向上するため、実運用での性能向上に直結します。
利用するにはどうすればよいですか?
DFlash ドラフトモデルは既に vLLM、SGLang、Transformers に統合済みで、HuggingFace で Qwen および他のモデルファミリー向けのモデルが提供されています。
Daily Dose of Data Science元記事を読む
LINEで送る

「大規模言語モデル」の最新ニュースを、毎朝7時にお届けします

たとえば、いま届くならこの3本です

  • Google WikiSkill、AIが失敗記憶THE DECODER · 2時間前
  • AIによる失業は米労働者のわずか3%Fortune AI · 2時間前
  • 自宅PCで無料オフラインのチャットボットWIRED AI · 2時間前

AIが要約して、あなたの選んだトピックだけを1日1通。LINE・Email・Slackで届きます。

登録無料・30秒で完了・いつでも解除できますAITodayについて →

AIに質問

この記事についてわからないことをAIに質問できます。Q&Aはこのページに公開され、他の読者も読めます。

関連記事

Google WikiSkill、AIが失敗記憶

Googleの研究者が、AIエージェントに過去の失敗や成功した戦略を永続的に記憶させるフレームワーク「WikiSkill」を発表した

NEWTHE DECODER2時間前

AIによる失業は米労働者のわずか3%

2026年7月30日から8月4日にかけて実施されたYouGovの調査(米国の労働者1,250人対象)で、2023年以降にAIが原因で失職したと答えた人はわずか約3%だった

NEWFortune AI2時間前

自宅PCで無料オフラインのチャットボット

MetaやGoogleなど大手が公開する大規模言語モデル(LLM、テキストを理解・生成するAI)の多くが、今や無料でダウンロードでき、自分のパソコン上で動かせる

NEWWIRED AI2時間前

AIエージェント、Solana版提供へ

8月24日、Virtuals ProtocolはSolana上でAIエージェントの作成・所有ツールの新スイートを展開し、投資家がエージェント連動トークンを購入できるようにした

NEWYahoo Finance AI5時間前

AIの数学証明が分野の核心的価値に挑戦

AIが現在、いわゆるヤコビアン予想を含む長年の数学問題の解決を支援しており、トップ数学者たちはこれが最終的に良いことなのか悪いことなのか深く迷っている

Japan Times Tech11時間前

AI引用の38.6%が捏造との調査結果

15の言語モデルを対象に、出典付きの2件の依頼でベンチマークを実施

Hacker News11時間前
次の記事へOpenAIとBroadcomが、大規模言語モデルの推論(AIが答えを導き出す処理)に特化した新しいチップ「Jalapeño」を発表しました。