注目★★★★★Hugging Face Papers
Random Attention、KV Cacheをランダム削減してスループット43%向上
30秒で把握
- 1Random Attention がKV Cacheをランダム削減し従来手法と性能一致
- 24モデル・6タスクでvLLMスループット32〜43%向上
- 3プロンプト保持と推論履歴の冗長性がスコア不要を支える
要約
Random Attention はプロンプトを保持し、各 attention head 内のKV Cacheをスコア計算なしで一様ランダムに削減する手法を提案した。4モデル・6つの推論タスクで従来最強の削減手法と性能が一致し、vLLM ではスループットが32〜43%向上した。性能差の大半はプロンプトを保持できるかで決まり、推論履歴はテキスト内の再記述とattention head間の複製によって削減に耐える。これにより、プロンプトを保護すればトークン選択用のスコアは不要になる。
あなたへの影響
LLM推論基盤の開発者は、既存のKV Cache削減器と比較し、Random AttentionをvLLM上の実ワークロードで評価すべきです。
推奨:選択スコアを省ける可能性があるため、メモリ使用量とスループットの測定を分けて検証してください。