注目★★★★★Hugging Face Blog
拡散モデルの 4 ビット量子化が Diffusers に統合、メモリ 50% 削減・速度 30% 向上
30秒で把握
- 1Hugging Face が SVDQuant ベース Nunchaku Lite を Diffusers に統合・4 ビット推論を標準サポート
- 2メモリ 50% 削減 (24GB → 12GB) + 速度 30% 向上・torch.compile で最大 1.8 倍化実現
- 3Blackwell GPU 対応・from_pretrained() で直接ロード可能・diffuse-compressor で自モデル量子化も可能
要約
Hugging Face は SVDQuant 量子化手法を用いた Nunchaku Lite を Diffusers に統合し、拡散モデルの推論を 4 ビット重み・活性化 (W4A4) で実行できるようにした。RTX 5090 で ERNIE-Image-Turbo は約 1.7 秒の生成時間にメモリ使用量を 24GB から 12GB に削減しつつ、約 30% の速度向上を実現する。from_pretrained() で事前量子化チェックポイントを直接ロード可能で、ローカルコンパイルや専用推論エンジンが不要になった。diffuse-compressor ツールキットで新規アーキテクチャの量子化も可能であり、標準 Diffusers リポジトリとして公開できる。
あなたへの影響
テキスト・画像生成を本番運用するチームは、既存パイプラインを Nunchaku Lite に移行することで GPU メモリ圧力を軽減でき、同じハードウェアで処理スループットを上げられる可能性がある。
推奨:Blackwell 世代 GPU (RTX 50 シリーズ以降) を保有する場合は、提供済みのチェックポイントで即座に検証可能。