Asayomu Tech
注目★★★★AWS

Gemma 4 31B、SageMakerで2.5倍高速な4-bit版を提供

30秒で把握

  • 1AWSがGemma-4-31Bのassistant版とNVFP4版をSageMakerで提供開始
  • 2NVFP4版はメモリ約18.5GB、68%削減、推論約2.5倍高速化
  • 3assistant版は256Kトークン、140超言語、画像・動画入力に対応

要約

AWSはGoogle DeepMindのGemma-4-31B-it-assistantと、NVIDIAのGemma-4-31B-IT-NVFP4をAmazon SageMaker JumpStartで提供開始した。assistant版はテキスト・画像・動画フレームを扱い、256Kトークンのコンテキスト、140超の言語、ネイティブなfunction callingに対応する。NVFP4版はNVIDIA ModelOptで4-bit FP4に量子化し、メモリ使用量を約18.5GBへ68%削減、推論を約2.5倍高速化しながら、元モデルの品質の97〜99%を維持する。両モデルはSageMakerコンソールまたはSageMaker Python SDKから数クリックでデプロイできる。

あなたへの影響

AWS上でGemma 4 31Bを使うチームは、用途に応じてassistant版とNVFP4版を比較し、次スプリントで推論性能・品質・GPUメモリ使用量を検証する価値がある。

推奨:NVFP4は4-bit FP4量子化モデルで、同等品質を狙いながらメモリ消費を抑える選択肢となる。

詳細を読む → 元記事へ※ 本文は元記事をご確認ください (asayomu は要約のみ提供)

関連する記事

※ 外部記事の権利は原著作者に帰属します。著作権削除要請は copyright@asayomu.jp までご連絡ください(受領確認 24h・実処理 72h 以内)。