注目★★★★★Hugging Face Papers
LLMが自ら注目範囲を宣言、長文推論のKV読み出しを52%削減
30秒で把握
- 1Declarative Attention がLLMの注目範囲を宣言しKV読み出しを削減
- 2Gemma-4-31Bで52.0%、Qwen-3.6-27Bで31.1%削減
- 3精度低下は1.27ポイントと2.75ポイントでモデル規模により縮小
要約
Declarative Attention(DA)は、LLMが推論中に必要なコンテキスト範囲を宣言し、KV cacheの読み出しを省くプロトコルだ。<global>、<focus>、<local>の3モードを使い、推論エンジンが宣言をtool callのように解釈する。15の長文コンテキスト課題で、Gemma-4-31Bは読み出し対象トークンを52.0%、Qwen-3.6-27Bは31.1%削減した。精度低下はそれぞれ1.27ポイント、2.75ポイントで、モデル規模が大きいほど縮小した。
あなたへの影響
長文コンテキストを扱う日本の開発チームは、既存モデルにDAを適用した場合の精度とKV cache読み出し量をベンチマークで検証するとよい。
推奨:注意範囲の宣言に誤りがあると回答品質へ影響する可能性があるため、導入時はタスク別の精度監視を組み合わせるべきだ。