注目★★★★★Hugging Face Blog
LFM2.5-DSpark、推論速度最大3.2倍高速化・関数呼び出しレイテンシ57%削減
30秒で把握
- 1LFM2.5-DSpark 公開・GPU で最大 3.18 倍、MacBook で最大 2.87 倍のスループット向上を実測
- 2LFM2.5-2.6B の関数呼び出しレイテンシ平均 57% 削減・オンデバイス推論で ~140 トークン/秒を実現
- 3llama.cpp・SGLang で即日サポート・Safetensors / GGUF 形式で Hugging Face から利用可能
要約
Liquid AI が LFM2.5 向けの推論高速化手法 DSpark を公開し、H100 GPU で最大 3.18 倍、MacBook M4 Max では最大 2.87 倍のスループット向上を達成した。LFM2.5-2.6B では関数呼び出しレイテンシを平均 57% 削減し、オンデバイス推論が ~140 トークン/秒を実現、クラウドモデル水準のレスポンス性能をもたらす。DSpark は軽量ドラフトモデルで候補トークンを生成し、ターゲットモデルが一度の順伝播で検証する推測デコーディング手法で、llama.cpp と SGLang で即日サポートされ、Safetensors / GGUF 形式で公開されている。
あなたへの影響
LFM2.5-2.6B をローカル環境で運用するチームは、DSpark ドラフトモデルを統合することで クラウドモデル水準のレスポンスを手元で実現でき、推論コスト削減と遅延改善が同時に得られるため。
推奨:次スプリントで導入検証を開始する価値がある。