注目★★★★★Hugging Face Papers
KVarN:KV-Cache量子化の誤差蓄積を解消する新手法
要約
テスト時スケーリングによる長文推論ではKV-cacheが増大しメモリがボトルネックになる。既存の量子化手法は自己回帰デコード時に誤差が時系列を跨いで蓄積する問題があった。新手法KVarNはHadamard回転と双軸分散正規化を組み合わせ、キャリブレーション不要でトークンスケール異常値を抑制する。
あなたへの影響
LLM推論サービスのメモリ効率を高めたいチームには注目の成果で。
推奨:vLLM実装も公開済みのため次スプリントで実験環境に導入して効果を検証することを推奨する。