AIToday
大規模言語モデルAIビジネス・産業THE DECODER掲載日時: 2026年8月25日 22:013分で読める

Nvidia Groq 3 LPX、毎秒3400トークンでCerebrasの4倍

LINEで送る
Nvidia Groq 3 LPX、毎秒3400トークンでCerebrasの4倍

要点

  • NvidiaのGroq 3 LPXが本格生産に入った。

  • 標準テストで毎秒3,400トークンの記録を達成。

  • Cerebrasの4倍と主張するが、比較はNvidia有利との指摘もある。

3つのポイント

  1. 何が起きたか

    NvidiaはGroq 3 LPX推論アクセラレータを本格生産に移した。Artificial Analysisによる独立ベンチマークでは、オープンモデルのGemma 4 31Bで毎秒3,400トークンを記録し、同モデルで過去最高となった。

  2. なぜ重要か

    Nvidiaはこのチップが毎秒882トークンのCerebrasチップより4倍高速だと主張する。エージェント型AIは多数の推論ステップで膨大なトークンを生成するため、速度は不可欠だ。トークン生成が速ければ、ユーザーが待てる時間内に推論ステップやツール呼び出しを増やせる。国内のAI推論を手掛ける企業は、応答速度の競争が激化する可能性がある。

  3. 注目点

    このベンチマークは実運用の性能を反映していない可能性がある。比較ではチップ数を考慮しておらず、Cerebrasは1〜2個のアクセラレータを使うのに対し、Nvidiaは少なくとも64個必要だ。さらにCerebrasの最新世代CS-4も考慮に入っていない。NebiusはこのチップをToken Factoryを通じて提供する最初のクラウドプロバイダーになる計画で、Groq自身も初期ユーザーだ。

この記事についてAIに質問する →

背景と解説

NvidiaがGroq 3 LPXを生産に移したのは、12月下旬にGroqライセンスを約200億ドルで買収し、創業者のJonathan Ross氏と社長のSunny Madra氏を迎え入れた後のことだ。Groqのプロセッサはトレーニングではなく推論に特化しており、高速なトークン生成が鍵となるエージェント型AIへのNvidiaの注力に合致する。ベンチマーク結果は印象的だが、The Registerが指摘するように、各LPUのメモリがわずか500MBというアーキテクチャ上の制約により、DeepSeek V3のような大規模モデルでは5ラック以上のアクセラレータが必要になる。またCerebrasとの比較ではチップ数や新しいCS-4世代が省略されている。つまり実際の優位性は、特に複雑で大規模な展開では、見出しの数字が示すほど大きくない可能性がある。Nebiusが最初のクラウドプロバイダーとして登場すれば、Nvidiaのエコシステム外でのチップ性能を実践的に試す機会になるだろう。

よくある質問

Groq 3 LPXのメモリ容量はどのくらいですか?
各LPUはわずか500MBのメモリしかなく、Rubin GPUの288GBの576分の1です。
Groq 3 LPXはいつ利用可能になりますか?
Nvidiaは年内に稼働すると述べています。Nebiusが最初のクラウドプロバイダーになる計画です。
なぜベンチマークは決定的でないのですか?
ベンチマークは1ラックに完全に収まるモデルを使っており、チップ数やCerebrasの最新CS-4世代を考慮していません。より大きなモデルではさらに多くのアクセラレータが必要になる可能性があります。

「大規模言語モデル」の最新ニュースを、毎朝7時にお届けします

AIが要約して、あなたの選んだトピックだけを1日1通。LINE・Email・Slackで届きます。

登録無料・30秒で完了・いつでも解除できます

AIに質問

この記事についてわからないことをAIに質問できます。Q&Aはこのページに公開され、他の読者も読めます。

関連記事

次の記事へAIへの自信、貯蓄不足を隠す