Asayomu Tech
注目★★★★Hugging Face Papers

Random Attention、KV Cacheをランダム削減してスループット43%向上

30秒で把握

  • 1Random Attention がKV Cacheをランダム削減し従来手法と性能一致
  • 24モデル・6タスクでvLLMスループット32〜43%向上
  • 3プロンプト保持と推論履歴の冗長性がスコア不要を支える

要約

Random Attention はプロンプトを保持し、各 attention head 内のKV Cacheをスコア計算なしで一様ランダムに削減する手法を提案した。4モデル・6つの推論タスクで従来最強の削減手法と性能が一致し、vLLM ではスループットが32〜43%向上した。性能差の大半はプロンプトを保持できるかで決まり、推論履歴はテキスト内の再記述とattention head間の複製によって削減に耐える。これにより、プロンプトを保護すればトークン選択用のスコアは不要になる。

あなたへの影響

LLM推論基盤の開発者は、既存のKV Cache削減器と比較し、Random AttentionをvLLM上の実ワークロードで評価すべきです。

推奨:選択スコアを省ける可能性があるため、メモリ使用量とスループットの測定を分けて検証してください。

詳細を読む → 元記事へ※ 本文は元記事をご確認ください (asayomu は要約のみ提供)

関連する記事

※ 外部記事の権利は原著作者に帰属します。著作権削除要請は copyright@asayomu.jp までご連絡ください(受領確認 24h・実処理 72h 以内)。