AIToday
大規模言語モデルオープンソースAIAIビジネス・産業Amazon AI Blog掲載日時: 2026年9月10日 10:003分で読める

アリババ、Qwen3.8-2.4T-A95Bの重みを公開

LINEで送る
アリババ、Qwen3.8-2.4T-A95Bの重みを公開

3つのポイント

  1. 何が起きたか

    2026年8月12日、アリババのQwenチームはQwen3.8-2.4T-A95Bを公開した。Qwen-Max級モデルとして初のオープンウェイトである。

  2. なぜ重要か

    Qwen-Max級モデルはこれまでオープンウェイトとして利用できなかった。2.4兆パラメータの公開はNVFP4量子化で約1.2 TBに圧縮された。

  3. 注目点

    ml.p6-b300.48xlargeインスタンスタイプはオンデマンドで利用できないため、導入はFlexible Training Planの予約確保にかかっている。

誰に効くか主な対象は、トークン単位のAPI料金を払うのではなく兆パラメータ級モデルを自社ホスティングしたい企業のAIチームと開発者であり、加えて導入を実行する前にFlexible Training Planを通じて予約GPUキャパシティを確保しなければならないインフラエンジニアも対象となる。

この記事についてAIに質問する →

こういう要約が、毎朝あなたのメールに届きます。

背景と解説

この公開が注目されるのは、Qwen-Max級モデルがこれまでオープンウェイトとして提供されたことがなく、チームがデータ、推論動作、大規模運用時のコストを完全に制御できるようになるからだ。トレードオフは運用面にある。2.4兆パラメータをホストするには専用のGPUインフラと最適化されたサービングスタックが必要であり、だからこそAWSの記事はGPUそのものよりも、モデルのダウンロード、コンテナのスケジューリング、ヘルス監視、オートスケーリング、ノード障害からの復旧といったオーケストレーション層に焦点を当てている。

アーキテクチャは長文脈の推論を実行可能にするために作られている。92層のうち69層は有界の再帰状態を持つGated DeltaNet線形アテンションを使うため、メモリ使用量は文脈長に比例して増えない。文脈依存のメモリを追加するのは23層のフルアテンション層だけだ。この設計と、重みを約1.2 TBに圧縮するNVFP4量子化によって、2.4兆パラメータのモデルが単一の8 GPUノードに収まる。細粒度MoEは1回のフォワードパスで約95 billionのパラメータしか活性化しないため、サービングコストは総パラメータ数ではなく活性化パラメータ数に連動する。

自社ホスティングと独自APIを比較検討するチームにとって、実務上の問題は生の能力よりも運用準備にある。インスタンスがオンデマンドで利用できないため、導入はFlexible Training Planによる予約キャパシティの確保にかかっており、またAWSのベンチマークがレイテンシとスループットに大きな差をもたらすと示すMTP投機的デコーディングやExpert Parallelismといった調整レバーにもかかっている。ベンダーのベンチマーク結果は、このモデルをコーディングエージェントや研究パイプライン向けのフロンティア級と位置づけているが、AWSはより難しいリポジトリレベルのタスクや一般的なツール使用にはなお改善の余地があると注記している。

よくある質問
Qwen3.8-2.4T-A95Bの実行にはどのようなハードウェアが必要か?
AWSは8基のNVIDIA B300 Blackwell Ultra GPUを搭載した単一のml.p6-b300インスタンスで実証している。NVFP4量子化では重みは約1.2 TBに圧縮され、ノードの合計GPUメモリ2.1 TBに収まる。
MTP投機的デコーディングはどれくらい高速か?
AWSのベンチマークでは、MTPを有効にすると初回トークン生成までの時間がほぼ59パーセント削減され、1,244 msから513 msになった。Expert Parallelismと組み合わせると、レイテンシが12.2パーセント減少し、出力スループットが12.6パーセント増加した。
インスタンスをオンデマンドで起動できるか?
できない。ml.p6-b300.48xlargeインスタンスタイプはオンデマンドで利用できない。Flexible Training Planを通じてキャパシティを確保し、ターゲットのアベイラビリティゾーンをプランの割り当てに合わせて設定する必要がある。
Amazon AI Blog元記事を読む
LINEで送る

「大規模言語モデル」の最新ニュースを、毎朝7時にお届けします

たとえば、いま届くならこの3本です

  • Anthropic、Claude悪用を報告THE DECODER · 3時間前
  • Apple、CapQuizを公開Apple Machine Learning · 3時間前
  • Anthropic、UAE関与のAI悪用を指摘Semafor Tech · 6時間前

AIが要約して、あなたの選んだトピックだけを1日1通。LINE・Email・Slackで届きます。

登録無料・Googleアカウントなら30秒・いつでも解除できますAITodayについて →

AIに質問

この記事についてわからないことをAIに質問できます。Q&Aはこのページに公開され、他の読者も読めます。

関連記事

次の記事へユナイテッドヘルス、AIに15億ドル投資