Asayomu Tech
注目★★★★Hugging Face Papers

Uno、LLM生成を品質無損失で最大3倍高速化

30秒で把握

  • 1UnoがARモデルの品質を保ち、LLM生成を最大3倍高速化
  • 2AR重みと拡散重みを分離し、別ドラフトモデルなしで並列生成
  • 38B Unoが26B DiffusionGemmaとMercury 2を全評価で上回る

要約

研究チームは、ARモデルの品質を保ったまま複数トークンを並列生成するLLM「Uno」を提案した。通常のNTPで学習したAR重みと、並列生成用の軽量な拡散重みを分離し、Ψ-SpecサンプラーでAR分布からトークンを生成する。別途ドラフトモデルを必要とせず、既存のopen-weight AR LLMにも追加できる。Unoは評価した全バッチサイズで主要なspeculative decoding手法を上回り、基盤ARモデル比で最大3倍の高速化を達成した。8B版は、agentic tool use、コーディング、長文脈推論の全評価で26B DiffusionGemmaとMercury 2を上回った。

あなたへの影響

LLM推論基盤を運用する日本のエンジニアは、Unoのチェックポイントを実運用に近いバッチサイズとKV cache負荷で検証し、導入可否を評価すべき。

推奨:離散拡散のdenoising回数が増えると並列化の効果が薄れる可能性があるため、tokens/sだけでなく総レイテンシーと品質を測定する必要がある。

詳細を読む → 元記事へ※ 本文は元記事をご確認ください (asayomu は要約のみ提供)

関連する記事

※ 外部記事の権利は原著作者に帰属します。著作権削除要請は copyright@asayomu.jp までご連絡ください(受領確認 24h・実処理 72h 以内)。