Asayomu Tech
注目★★★★★Hugging Face Papers

SAS、Transformerの長文Attentionを予算内で最適化

30秒で把握

  • 1SASが言語モデリング損失でcontext rankingを直接最適化
  • 2連続ゲートをAttention softmaxへ注入し勾配をselectorへ伝播
  • 3厳しいattention予算ほど既存の疎Attention手法との差が拡大

要約

SASは、言語モデリング損失でcontext rankingをエンドツーエンド最適化する疎Attention機構を提案した。従来手法はhard Top-K選択で勾配が遮断され、元モデルのdense attention重みに近い順位を学習していた。SASはselectorの連続スコアをattention softmax内のlog形式のゲートとして注入し、予測への影響に基づく順位を直接学習する。正規化softmaxゲートで過去のcontextと常時保持するcurrent blockを調整し、Triton kernelでFlashAttention型の長系列処理にも対応した。推論、長文理解、エージェントタスクで既存の学習型疎Attentionを上回り、特に厳しいattention予算で差が大きくなった。

あなたへの影響

長文LLMを運用する日本のエンジニアは、厳しいattention予算でSASの精度とメモリ使用量を既存手法と比較検証するとよい。

推奨:selectorの連続スコアを学習に反映する設計が、限られたcontext枠の配分改善につながり得るため、Triton実装を含む推論基盤との適合性も確認したい。

詳細を読む → 元記事へ※ 本文は元記事をご確認ください (asayomu は要約のみ提供)

関連する記事

※ 外部記事の権利は原著作者に帰属します。著作権削除要請は copyright@asayomu.jp までご連絡ください(受領確認 24h・実処理 72h 以内)。