注目★★★★★Techmeme
Nvidia傘下Groq、LPU推論加速で3,400トークン/秒—Cerebras比4倍
30秒で把握
- 1Groq 3 LPX、100Kトークン入力時に秒間3,400トークン達成・Cerebras比4倍
- 2SRAM活用のデータフロー型設計でメモリ帯域幅ボトルネック解決・ただしモデルあたり64+チップ必要
- 3Gemma 4 31B単体の最適ケース・大規模MoEモデルやチップ効率での実装比較が次の課題
要約
NvidiaがGroq買収後初となるLPU推論ベンチマーク結果を発表した。Groq 3 LPXラック上でGemma 4 31Bを10万トークン入力で実行した際、Artificial Analysisの独立ベンチマークで秒間3,400トークンを達成した。これはCerebrasの882トークン/秒比で4倍高速だとNvidiaが主張している。Groq LPUはDRAMではなくオンダイSRAMを活用するデータフロー型設計で、推論のメモリ帯域幅ボトルネックを回避する。ただし31BモデルはFP8で64チップ以上が必要で、CebrerasはCS-3チップ1~2個で同じモデルを実行できるため、チップ効率の比較が重要となる。
あなたへの影響
大規模言語モデルのエージェント化に伴い、推論レイテンシの削減が企業の生成AI導入で重要になりつつある。
推奨:ただしベンチマーク結果は31B程度の小規模モデル・単一最適化シナリオであり、実運用でのより大規模なMoEモデル対応やCerebrasよりも多くチップが必要な実装効率まで考慮して評価を進める必要がある。