Asayomu Tech
注目★★★★Hugging Face Papers

MoE Transformerの中間層を2回ループ、学習FLOPsを最大18%削減

30秒で把握

  • 1SMELTがMoE Transformerの中間層を2回実行し学習FLOPsを6.8〜18.0%削減
  • 2非埋め込み54Bまで4規模で評価しFLOPs・パラメータ・KV cacheを整合
  • 3Codeで優位性が最大化しサンプル長とin-context例数に伴い拡大

要約

研究チームは、MoE Transformerの中間半分の層を2回通すSMELTを提案した。1トークン当たりのFLOPs、非埋め込みパラメータ数、KV cacheを非ループ型Baselineと揃えたまま、最大54Bパラメータまで4規模で評価した。計算量に対する損失の低下が速く、計算最適フロンティアで訓練FLOPsを6.8〜18.0%削減した。下流ベンチマークでも優位性が移り、特にCodeで大きく、入力サンプル長とin-context例の数が増えるほど拡大した。2回目の層通過はattention sinkを減らし、内容に関係するトークンへ注意を振り向けた。

あなたへの影響

MoEやLLMの学習基盤を設計するチームは、既存モデルとFLOPs・パラメータ・KV cacheを揃えたSMELT構成を次の評価対象に加えるべきです。

推奨:層のループは共有層を再実行して実効深度を増やす手法で、Code用途や長いコンテキストでの検証が有効です。

詳細を読む → 元記事へ※ 本文は元記事をご確認ください (asayomu は要約のみ提供)

関連する記事

※ 外部記事の権利は原著作者に帰属します。著作権削除要請は copyright@asayomu.jp までご連絡ください(受領確認 24h・実処理 72h 以内)。