
何が起きたか
IntelはMLPerf Inference v6.1で、Xeon 6980P構成のままソフトウェア改善のみによりLlama 3.1 8BのServerを2.4倍、Offlineを56%高めた。
なぜ重要か
既に導入済みのXeonインフラでもソフト最適化で性能を引き出せることを示し、顧客が追加投資なしに処理能力を高められる可能性があるとみられる。
注目点
性能向上が実運用の多様なモデルでも再現されるかが焦点。パートナー検証はv6.0の29件からv6.1で39件に増え、OracleやRed Hatが初参加した。
誰に効くか既存のXeonサーバーでAI推論を運用する企業のインフラ担当者や、GPU調達コストを抑えたいAIサービスの開発チームに影響する。ソフトウェア更新だけで処理性能を引き出せる可能性があり、ハード買い替えの必要性を再検討する材料になる。
こういう要約が、毎朝あなたのメールに届きます。
今回のMLPerf Inference v6.1でIntelが強調したのは、新しいチップではなく既存チップの使い方の改善である。v6.0と同じXeon 6980Pと同じソケット数で、Llama 3.1 8BのServerスループットが2.4倍、Offlineが56%伸びた。つまり顧客がすでに持つサーバーでも、ソフトウェアを更新すれば性能が上がる余地があることを示している。
もう一つの変化は検証の広がりだ。Intelプラットフォームでのパートナーや顧客の結果は29件から39件に増え、Oracleは初のIntelベース提出、Red Hatは初のXeon CPU推論提出を行った。Quanta Cloud TechnologyとSupermicroはArc Pro B70を使う初のパートナー提出を出した。Intel自身の主張だけでなく、第三者の検証が増えている点は、導入を検討する企業にとって判断材料になる。
モデル対応も広がった。4基のArc Pro B70で128GBのVRAMを構成し、Llama 3.1 8BやLlama 2 70B、gpt-oss-120B、Whisper、E2E-RAGといった複数モデルで結果を出した。特にgpt-oss-120Bは同じ4基構成でServerが36%、Offlineが27%改善した。新設のE2E-RAGではXeon 6787Pと4基のArc Pro B70を組み合わせ、CPUが埋め込みやベクトル検索、GPUがLLM生成を分担する構成で結果を出した。
こうした性能向上が実際の運用環境でも再現されるかどうかが焦点となる。ベンチマークは構成や条件で結果が変わるため、導入企業は自社のモデルや負荷で確認する必要があるとみられる。
たとえば、いま届くならこの3本です
AIが要約して、あなたの選んだトピックだけを1日1通。LINE・Email・Slackで届きます。
登録無料・Googleアカウントなら30秒・いつでも解除できますAITodayについて →
この記事についてわからないことをAIに質問できます。Q&Aはこのページに公開され、他の読者も読めます。
Dellは前四半期に約610億ドルのAIサーバーを受注し、受注残は950億ドルに達した

Procter & GambleがSiemensと協力し、AIベースの品質検査技術の導入を拡大している

Bank of AmericaのCEO、Brian Moynihan氏は投資家に対し、AIが同行のレイオフ回避に役立ったと述べた

Alphabetはバークシャーの成長株だ

デンバー拠点のCrusoeは、多くのビットコインマイナーを倒産寸前に追い込んだ2022年と2023年の仮想通貨の冬を生き延び、目立たないながらも重要なAIデータセンターの革新企業として浮上した

ウェルズ・ファーゴのCFOは、AIによる効率化が「人員をさらに減らす」として、今後さらに解雇が増えるとの見通しを示した
