注目★★★★★Hacker News
Gemma 4 を拡散モデル化、1GPU で毎秒 1,500 トークン生成
30秒で把握
- 1DiffusionGemma は拡散モデルで 256 トークル並列生成・H100 GPU で毎秒 1,500 トークン達成
- 2Gemma 4(3.8B 有効パラメータ)を元モデル訓練予算の 10% 未満で微調整・思考モード等既存機能保持
- 3自己回帰型 LLM の逐次処理ボトルネック解消・本番推論コスト削減の新パラダイム
要約
Google は DiffusionGemma という実験的な言語モデルを発表し、離散拡散を用いて従来の自己回帰デコーディングの逐次処理ボトルネックを回避した。Gemma 4(有効パラメータ 3.8B・総 25.2B)を微調整し、256 トークンのブロックを並列に反復生成することで、単一の NVIDIA H100 GPU 上で毎秒およそ 1,500 出力トークンを実現し、投機的デコーディングを備えた自己回帰モデルを大幅に上回る速度を達成した。訓練は元モデルの総トークン予算の 10% 未満を使用し、教師付き微調整と強化学習・サンプラー蒸留の 2 段階パイプラインで構成された。思考モード・マルチモーダル入力・長文脈処理は既存機能を保持し、自己回帰生成へのフォールバックも可能な設計となっている。
あなたへの影響
拡散ベース生成は並列処理により LLM 推論の根本的な遅延問題を解く可能性を示唆しており、コスト制約の厳しい本番環境での採用検討が進む可能性がある。
推奨:同時に Gemma 4 のような混合専門家モデルを拡散形に変換する訓練効率が実証されたことで、他の言語モデルへの応用も視野に入る。