Asayomu Tech
注目★★★★Hugging Face Papers

LSA で KV キャッシュを 13.5% に圧縮、超長文コンテキスト推論を高速化

30秒で把握

  • 1LSA が KV キャッシュをフルコンテキスト比 13.5% に圧縮・精度 +0.6% 維持
  • 2500K トークンスケールで KV キャッシュオーバーヘッド 90% 超削減を達成
  • 3バックボーン不要の独立訓練戦略により大規模 GPU なしでインデクサを学習可能

要約

DeepSeek-V4 アーキテクチャ上に構築した Lookahead Sparse Attention (LSA) を提案し、超長文コンテキスト推論時の GPU メモリボトルネックを解消した。LSA は将来のコンテキスト需要を事前予測し、クエリに重要な KV チャンクのみ GPU メモリに保持する。LongBench-v2・LongMemEval・RULER の評価では、平均物理 KV キャッシュ使用量をフルコンテキスト比 13.5% まで圧縮しつつ、下流精度を平均 +0.6% 絶対値で維持・微向上させた。500K トークンの極端なスケールでは KV キャッシュのオーバーヘッドを 90% 超削減し、バックボーンの推論能力を損なわなかった。

あなたへの影響

長文コンテキスト対応の LLM を推論サービスとして運用しているチームは、GPU メモリ効率が大幅に改善できる可能性があるため、同手法の実装・検証を優先課題として検討する価値がある。

推奨:バックボーンモデルを GPU メモリにロードせずインデクサを独立訓練できる点は、大規模モデル非保有チームにとっても採用障壁を下げ得る。

詳細を読む → 元記事へ※ 本文は元記事をご確認ください (asayomu は要約のみ提供)

関連する記事

※ 外部記事の権利は原著作者に帰属します。著作権削除要請は copyright@asayomu.jp までご連絡ください(受領確認 24h・実処理 72h 以内)。