注目★★★★★Hugging Face Papers
Domino:因果モデリングと自己回帰ドラフトを分離し推論を最大5.8倍高速化
要約
投機的デコーディングにおける草稿品質と生成コストのトレードオフを解消する新フレームワーク「Domino」が提案された。並列ドラフトバックボーンでブロック全体の草稿分布を生成し、軽量な Domino ヘッドで因果依存情報を後処理として付与する設計により、逐次処理のオーバーヘッドを排除する。Qwen3 モデルでの実験では、Transformers バックエンドで最大 5.49 倍のエンドツーエンド高速化、SGLang サービング環境では最大 5.8 倍のスループット向上を達成した。
あなたへの影響
LLM 推論基盤の高速化を検討しているチームにとって、既存の投機的デコーディング手法を大幅に上回る実測値は注目に値する。
推奨:Qwen3 を本番または評価環境で利用中であれば、次スプリントで Domino の適用可否を検証する価値がある。