Asayomu Tech
注目★★★★★Hugging Face Blog

LFM2.5-DSpark、推論速度最大3.2倍高速化・関数呼び出しレイテンシ57%削減

30秒で把握

  • 1LFM2.5-DSpark 公開・GPU で最大 3.18 倍、MacBook で最大 2.87 倍のスループット向上を実測
  • 2LFM2.5-2.6B の関数呼び出しレイテンシ平均 57% 削減・オンデバイス推論で ~140 トークン/秒を実現
  • 3llama.cpp・SGLang で即日サポート・Safetensors / GGUF 形式で Hugging Face から利用可能

要約

Liquid AI が LFM2.5 向けの推論高速化手法 DSpark を公開し、H100 GPU で最大 3.18 倍、MacBook M4 Max では最大 2.87 倍のスループット向上を達成した。LFM2.5-2.6B では関数呼び出しレイテンシを平均 57% 削減し、オンデバイス推論が ~140 トークン/秒を実現、クラウドモデル水準のレスポンス性能をもたらす。DSpark は軽量ドラフトモデルで候補トークンを生成し、ターゲットモデルが一度の順伝播で検証する推測デコーディング手法で、llama.cpp と SGLang で即日サポートされ、Safetensors / GGUF 形式で公開されている。

あなたへの影響

LFM2.5-2.6B をローカル環境で運用するチームは、DSpark ドラフトモデルを統合することで クラウドモデル水準のレスポンスを手元で実現でき、推論コスト削減と遅延改善が同時に得られるため。

推奨:次スプリントで導入検証を開始する価値がある。

詳細を読む → 元記事へ※ 本文は元記事をご確認ください (asayomu は要約のみ提供)

関連する記事

※ 外部記事の権利は原著作者に帰属します。著作権削除要請は copyright@asayomu.jp までご連絡ください(受領確認 24h・実処理 72h 以内)。