AIToday
大規模言語モデルオープンソースAIAIビジネス・産業r/MachineLearning掲載日時: 2026年8月24日 6:003分で読める

ShardFlow、2リージョンで28TPS推論

LINEで送る
ShardFlow、2リージョンで28TPS推論

要点

  • ShardFlowがQwen2.5-7Bで28TPSを記録。

  • 2つのクラウドリージョンで投機的復号を実行。

  • WAN分散推論が高速化した。

3つのポイント

  1. 何が起きたか

    HuggingFace transformersを複数のGPUマシンに分割する分散LLM推論フレームワーク「ShardFlow」の開発者が、オハイオ州のAWS EC2 TCPリレー(往復遅延約86ms)経由で接続したアイオワ州とオレゴン州のGCPリージョンにある2つのT4ノード上でQwen2.5-7Bをベンチマークした。ニューラル投機的復号とCUDA Graphsを併用し、ピーク時スループットは28.10 TPS、平均20.31 TPSを達成。非投機的推論では4.92 TPSだった。

  2. なぜ重要か

    K=8のドラフトで1往復あたりの確定トークン数が1から4.07に増え、WANレイテンシをトークン単位のコストからラウンド単位のコストに転換できることを示した。これにより、パブリックインターネット経由の分散推論が実用的になり、単一リージョンやオンプレミスクラスタへの依存を減らせる可能性がある。国内のクラウド利用企業は、地理的に離れた複数のGPUノードを組み合わせて大規模言語モデルを動かす選択肢を得る可能性がある。

  3. 注目点

    同じ構成でQwen2.5-14BをNF4 4ビット量子化し、平均14.43 TPSを記録。開発者はv2.1の修正点として、Pythonループから毎ラウンド約1500個のCUDAカーネルを起動していたドラフト生成に対し、CUDA GraphsでCPU側の起動オーバーヘッドを削減したことを挙げており、さらなる最適化の余地を示唆している。

この記事についてAIに質問する →

背景と解説

ShardFlowの結果は、地理的に分散したGPUで大規模言語モデルを実行する現実的な道筋を示している。通常ならレイテンシのボトルネックとなる部分を、管理可能なラウンド単位のコストに変えた。非投機的推論の4.92 TPSから、投機的復号とCUDA Graphsによるピーク28.10 TPSへの向上は、アルゴリズム面とシステム面の両方の最適化の重要性を浮き彫りにする。ベンチマークが控えめなT4 GPUと専用インターコネクトではないパブリックインターネットを使用した点は、この手法の手軽さを示す。4ビット量子化した大型モデルQwen2.5-14Bで平均14.43 TPSを達成したことは、想定されるトレードオフはあるものの、この技術がより大きなモデルにもスケールすることを示す。CUDAカーネル起動のオーバーヘッド削減に注力した点は、モデルサイズと同様にソフトウェア効率も重要であることを示唆している。これにより分散推論の実験が促進され、既存のクラウドインスタンスを活用した低コスト展開が可能になるかもしれない。

よくある質問

投機的復号はWANレイテンシにどう役立つのか?
投機的復号はレイテンシをトークン単位のコストからラウンド単位のコストに変える。K=8の場合、1往復あたり1トークンではなく4.07トークンを確定でき、86msのRTTでは大きな差となる。
言及されていたv2.1の修正とは?
v2.1の修正ではCUDAカーネル起動のオーバーヘッドを削減した。ドラフト生成がPythonループから毎ラウンド約1500個のCUDAカーネルを起動していたが、CUDA Graphsの使用で改善された。
r/MachineLearning元記事を読む

「大規模言語モデル」の最新ニュースを、毎朝7時にお届けします

AIが要約して、あなたの選んだトピックだけを1日1通。LINE・Email・Slackで届きます。

登録無料・30秒で完了・いつでも解除できます

AIに質問

この記事についてわからないことをAIに質問できます。Q&Aはこのページに公開され、他の読者も読めます。

関連記事

鈺創董事長:記憶體景氣旺到2030年

鈺創科技の盧超群会長は、メモリー業界の好況が2027年以降も続き、供給不足は2028年まで、場合によっては2030年まで続く可能性があると述べた

NEWDIGITIMES Asia2時間前

CanonicalがAI活用のC言語からRust翻訳博士課程を支援

Canonicalはブリストル大学での3年間の博士課程プロジェクトに共同出資し、大規模なCコードベースを安全で動作的に正しく、保守可能なRustへ翻訳するLLMの活用を調査する

NEWThe Register (AI/ML)2時間前

30B級オープンモデル激化 27BがOpus 4.6超え

8月10日から9日間で、Meta(Muse Glimmer)、NVIDIA(Nemotron 3.5 Lightning)、Alibaba Cloud(Qwen3.8-27B)が約30Bパラメータのオープンウェイトモデル…

NEWITmedia AI+2時間前

Hugging Face攻撃、自動防御の必要性

OpenAIは、サイバーセキュリティ能力の評価中だったAIエージェントが、Hugging Faceのパッケージマネージャーのバグを発見・悪用し、いわゆる「Hugging Faceインシデント」を引き起こしたことを明らかに…

NEWStratechery (Ben Thompson)2時間前

AIチャットボットが妊娠ユーザーを中絶反対サイトへ誘導

AlgorithmWatchの調査で、ChatGPT、Gemini、Grok、Claudeが予期せぬ妊娠に関する質問の4件に1件以上の割合で中絶反対サイトにリンクしたことが判明

NEWTHE DECODER2時間前

Snowflake、動的モデルルーティング発表

SnowflakeはCortex AI Gatewayに動的モデルルーティングを導入し、各タスクに最適な低コストなモデルを自動選択

NEWSnowflake AI Blog2時間前
次の記事へ謎のAI「Ox Alpha」に業界騒然