注目★★★★★Hugging Face Papers
LSA で KV キャッシュを 13.5% に圧縮、超長文コンテキスト推論を高速化
30秒で把握
- 1LSA が KV キャッシュをフルコンテキスト比 13.5% に圧縮・精度 +0.6% 維持
- 2500K トークンスケールで KV キャッシュオーバーヘッド 90% 超削減を達成
- 3バックボーン不要の独立訓練戦略により大規模 GPU なしでインデクサを学習可能
要約
DeepSeek-V4 アーキテクチャ上に構築した Lookahead Sparse Attention (LSA) を提案し、超長文コンテキスト推論時の GPU メモリボトルネックを解消した。LSA は将来のコンテキスト需要を事前予測し、クエリに重要な KV チャンクのみ GPU メモリに保持する。LongBench-v2・LongMemEval・RULER の評価では、平均物理 KV キャッシュ使用量をフルコンテキスト比 13.5% まで圧縮しつつ、下流精度を平均 +0.6% 絶対値で維持・微向上させた。500K トークンの極端なスケールでは KV キャッシュのオーバーヘッドを 90% 超削減し、バックボーンの推論能力を損なわなかった。
あなたへの影響
長文コンテキスト対応の LLM を推論サービスとして運用しているチームは、GPU メモリ効率が大幅に改善できる可能性があるため、同手法の実装・検証を優先課題として検討する価値がある。
推奨:バックボーンモデルを GPU メモリにロードせずインデクサを独立訓練できる点は、大規模モデル非保有チームにとっても採用障壁を下げ得る。