Asayomu Tech
注目★★★★★Hugging Face Blog

拡散モデルの 4 ビット量子化が Diffusers に統合、メモリ 50% 削減・速度 30% 向上

30秒で把握

  • 1Hugging Face が SVDQuant ベース Nunchaku Lite を Diffusers に統合・4 ビット推論を標準サポート
  • 2メモリ 50% 削減 (24GB → 12GB) + 速度 30% 向上・torch.compile で最大 1.8 倍化実現
  • 3Blackwell GPU 対応・from_pretrained() で直接ロード可能・diffuse-compressor で自モデル量子化も可能

要約

Hugging Face は SVDQuant 量子化手法を用いた Nunchaku Lite を Diffusers に統合し、拡散モデルの推論を 4 ビット重み・活性化 (W4A4) で実行できるようにした。RTX 5090 で ERNIE-Image-Turbo は約 1.7 秒の生成時間にメモリ使用量を 24GB から 12GB に削減しつつ、約 30% の速度向上を実現する。from_pretrained() で事前量子化チェックポイントを直接ロード可能で、ローカルコンパイルや専用推論エンジンが不要になった。diffuse-compressor ツールキットで新規アーキテクチャの量子化も可能であり、標準 Diffusers リポジトリとして公開できる。

あなたへの影響

テキスト・画像生成を本番運用するチームは、既存パイプラインを Nunchaku Lite に移行することで GPU メモリ圧力を軽減でき、同じハードウェアで処理スループットを上げられる可能性がある。

推奨:Blackwell 世代 GPU (RTX 50 シリーズ以降) を保有する場合は、提供済みのチェックポイントで即座に検証可能。

詳細を読む → 元記事へ※ 本文は元記事をご確認ください (asayomu は要約のみ提供)

関連する記事

※ 外部記事の権利は原著作者に帰属します。著作権削除要請は copyright@asayomu.jp までご連絡ください(受領確認 24h・実処理 72h 以内)。