注目★★★★★Hugging Face Papers
MoE Transformerの中間層を2回ループ、学習FLOPsを最大18%削減
30秒で把握
- 1SMELTがMoE Transformerの中間層を2回実行し学習FLOPsを6.8〜18.0%削減
- 2非埋め込み54Bまで4規模で評価しFLOPs・パラメータ・KV cacheを整合
- 3Codeで優位性が最大化しサンプル長とin-context例数に伴い拡大
要約
研究チームは、MoE Transformerの中間半分の層を2回通すSMELTを提案した。1トークン当たりのFLOPs、非埋め込みパラメータ数、KV cacheを非ループ型Baselineと揃えたまま、最大54Bパラメータまで4規模で評価した。計算量に対する損失の低下が速く、計算最適フロンティアで訓練FLOPsを6.8〜18.0%削減した。下流ベンチマークでも優位性が移り、特にCodeで大きく、入力サンプル長とin-context例の数が増えるほど拡大した。2回目の層通過はattention sinkを減らし、内容に関係するトークンへ注意を振り向けた。
あなたへの影響
MoEやLLMの学習基盤を設計するチームは、既存モデルとFLOPs・パラメータ・KV cacheを揃えたSMELT構成を次の評価対象に加えるべきです。
推奨:層のループは共有層を再実行して実効深度を増やす手法で、Code用途や長いコンテキストでの検証が有効です。