Asayomu Tech
注目★★★★★Hugging Face Papers

LLMが自ら注目範囲を宣言、長文推論のKV読み出しを52%削減

30秒で把握

  • 1Declarative Attention がLLMの注目範囲を宣言しKV読み出しを削減
  • 2Gemma-4-31Bで52.0%、Qwen-3.6-27Bで31.1%削減
  • 3精度低下は1.27ポイントと2.75ポイントでモデル規模により縮小

要約

Declarative Attention(DA)は、LLMが推論中に必要なコンテキスト範囲を宣言し、KV cacheの読み出しを省くプロトコルだ。<global>、<focus>、<local>の3モードを使い、推論エンジンが宣言をtool callのように解釈する。15の長文コンテキスト課題で、Gemma-4-31Bは読み出し対象トークンを52.0%、Qwen-3.6-27Bは31.1%削減した。精度低下はそれぞれ1.27ポイント、2.75ポイントで、モデル規模が大きいほど縮小した。

あなたへの影響

長文コンテキストを扱う日本の開発チームは、既存モデルにDAを適用した場合の精度とKV cache読み出し量をベンチマークで検証するとよい。

推奨:注意範囲の宣言に誤りがあると回答品質へ影響する可能性があるため、導入時はタスク別の精度監視を組み合わせるべきだ。

詳細を読む → 元記事へ※ 本文は元記事をご確認ください (asayomu は要約のみ提供)

関連する記事

※ 外部記事の権利は原著作者に帰属します。著作権削除要請は copyright@asayomu.jp までご連絡ください(受領確認 24h・実処理 72h 以内)。