注目★★★★★Hugging Face Papers
SAS、Transformerの長文Attentionを予算内で最適化
30秒で把握
- 1SASが言語モデリング損失でcontext rankingを直接最適化
- 2連続ゲートをAttention softmaxへ注入し勾配をselectorへ伝播
- 3厳しいattention予算ほど既存の疎Attention手法との差が拡大
要約
SASは、言語モデリング損失でcontext rankingをエンドツーエンド最適化する疎Attention機構を提案した。従来手法はhard Top-K選択で勾配が遮断され、元モデルのdense attention重みに近い順位を学習していた。SASはselectorの連続スコアをattention softmax内のlog形式のゲートとして注入し、予測への影響に基づく順位を直接学習する。正規化softmaxゲートで過去のcontextと常時保持するcurrent blockを調整し、Triton kernelでFlashAttention型の長系列処理にも対応した。推論、長文理解、エージェントタスクで既存の学習型疎Attentionを上回り、特に厳しいattention予算で差が大きくなった。
あなたへの影響
長文LLMを運用する日本のエンジニアは、厳しいattention予算でSASの精度とメモリ使用量を既存手法と比較検証するとよい。
推奨:selectorの連続スコアを学習に反映する設計が、限られたcontext枠の配分改善につながり得るため、Triton実装を含む推論基盤との適合性も確認したい。