
Modal が新しい DFlash ドラフトモデルをリリースし、推測デコーディングによる推論速度の上限を従来の 2~3 倍から大幅に超える水準へ引き上げました。
Qwen 3.5 122B-A10B では 1000 トークン/秒以上の速度を達成し、従来の 250 トークン/秒から 4 倍以上高速化しています。
ブロック拡散方式により複数トークンを並列に予測し、ターゲットモデルの内部表現を活用することで、トークン採用率が大幅に向上した結果です。
何が起きたか
Modal が新しい DFlash ドラフトモデルを Qwen モデル向けにリリースしました。従来の推測デコーディングは 1 トークンずつ予測する方式で 2~3 倍の速度上限に留まっていましたが、DFlash はブロック拡散モデルを使って複数トークンを一度に並列予測するため、この上限を超えることができます。Qwen 3.5 122B-A10B では 250 トークン/秒から 1000 トークン/秒以上に高速化しました。
なぜ重要か
推論処理の高速化は、AI サービスの応答時間短縮やコスト削減に直結するため、LLM を実運用するビジネスにとって重要な課題です。DFlash モデルが実データに基づいて訓練されているため、提案トークンの採用率が baseline の 3 から 9 以上に向上し、より実用的な速度向上が実現できるとみられます。
注目点
DFlash ドラフトモデルは既に vLLM、SGLang、Transformers に統合済みであり、HuggingFace で Qwen および他のモデルファミリー向けに提供されています。
たとえば、いま届くならこの3本です
AIが要約して、あなたの選んだトピックだけを1日1通。LINE・Email・Slackで届きます。
登録無料・30秒で完了・いつでも解除できますAITodayについて →
この記事についてわからないことをAIに質問できます。Q&Aはこのページに公開され、他の読者も読めます。
Googleの研究者が、AIエージェントに過去の失敗や成功した戦略を永続的に記憶させるフレームワーク「WikiSkill」を発表した

2026年7月30日から8月4日にかけて実施されたYouGovの調査(米国の労働者1,250人対象)で、2023年以降にAIが原因で失職したと答えた人はわずか約3%だった

MetaやGoogleなど大手が公開する大規模言語モデル(LLM、テキストを理解・生成するAI)の多くが、今や無料でダウンロードでき、自分のパソコン上で動かせる

8月24日、Virtuals ProtocolはSolana上でAIエージェントの作成・所有ツールの新スイートを展開し、投資家がエージェント連動トークンを購入できるようにした

AIが現在、いわゆるヤコビアン予想を含む長年の数学問題の解決を支援しており、トップ数学者たちはこれが最終的に良いことなのか悪いことなのか深く迷っている

15の言語モデルを対象に、出典付きの2件の依頼でベンチマークを実施
