Asayomu Tech
注目★★★★★Techmeme

Nvidia傘下Groq、LPU推論加速で3,400トークン/秒—Cerebras比4倍

30秒で把握

  • 1Groq 3 LPX、100Kトークン入力時に秒間3,400トークン達成・Cerebras比4倍
  • 2SRAM活用のデータフロー型設計でメモリ帯域幅ボトルネック解決・ただしモデルあたり64+チップ必要
  • 3Gemma 4 31B単体の最適ケース・大規模MoEモデルやチップ効率での実装比較が次の課題

要約

NvidiaがGroq買収後初となるLPU推論ベンチマーク結果を発表した。Groq 3 LPXラック上でGemma 4 31Bを10万トークン入力で実行した際、Artificial Analysisの独立ベンチマークで秒間3,400トークンを達成した。これはCerebrasの882トークン/秒比で4倍高速だとNvidiaが主張している。Groq LPUはDRAMではなくオンダイSRAMを活用するデータフロー型設計で、推論のメモリ帯域幅ボトルネックを回避する。ただし31BモデルはFP8で64チップ以上が必要で、CebrerasはCS-3チップ1~2個で同じモデルを実行できるため、チップ効率の比較が重要となる。

あなたへの影響

大規模言語モデルのエージェント化に伴い、推論レイテンシの削減が企業の生成AI導入で重要になりつつある。

推奨:ただしベンチマーク結果は31B程度の小規模モデル・単一最適化シナリオであり、実運用でのより大規模なMoEモデル対応やCerebrasよりも多くチップが必要な実装効率まで考慮して評価を進める必要がある。

詳細を読む → 元記事へ※ 本文は元記事をご確認ください (asayomu は要約のみ提供)

関連する記事

※ 外部記事の権利は原著作者に帰属します。著作権削除要請は copyright@asayomu.jp までご連絡ください(受領確認 24h・実処理 72h 以内)。