Asayomu Tech
注目★★★★Hugging Face Papers

Domino:因果モデリングと自己回帰ドラフトを分離し推論を最大5.8倍高速化

要約

投機的デコーディングにおける草稿品質と生成コストのトレードオフを解消する新フレームワーク「Domino」が提案された。並列ドラフトバックボーンでブロック全体の草稿分布を生成し、軽量な Domino ヘッドで因果依存情報を後処理として付与する設計により、逐次処理のオーバーヘッドを排除する。Qwen3 モデルでの実験では、Transformers バックエンドで最大 5.49 倍のエンドツーエンド高速化、SGLang サービング環境では最大 5.8 倍のスループット向上を達成した。

あなたへの影響

LLM 推論基盤の高速化を検討しているチームにとって、既存の投機的デコーディング手法を大幅に上回る実測値は注目に値する。

推奨:Qwen3 を本番または評価環境で利用中であれば、次スプリントで Domino の適用可否を検証する価値がある。

詳細を読む → 元記事へ※ 本文は元記事をご確認ください (asayomu は要約のみ提供)

関連する記事

※ 外部記事の権利は原著作者に帰属します。著作権削除要請は copyright@asayomu.jp までご連絡ください(受領確認 24h・実処理 72h 以内)。