Asayomu Tech
注目★★★★Hugging Face Papers

言語モデルにメモリ機能を分離、6.9Bパラメータで検証—39%削減で12Bレベルの性能実現

30秒で把握

  • 1Memory Decoder at Scale、6.9B パラメータで 300B トークン学習・分散 Faiss パイプラインで大規模索引実現
  • 2メモリ 1.7B + 基本 410M で Pythia-12B 同等スコア達成・総パラメータ 39% 削減・17 ベンチで効果確認
  • 3推論とメモリ独立スケーリングがパラメータ効率で優位・モデル設計選択肢として次世代実装に影響

要約

Memory Decoder at Scale は、言語モデルの推論能力とメモリを分離する手法を大規模で検証した。6.9B パラメータのモデルに 1.7B パラメータの専用メモリモジュールを組み合わせることで、Pythia-12B (37.24) と同等のスコア 37.34 を達成しつつ、総パラメータ数を 39% 削減した。300B トークンの学習スケールで Faiss インデックスの計算ボトルネックを分散パイプラインと疎な kNN ロード技術で解決。

あなたへの影響

この記事が日本のエンジニアに与える影響と、今日取るべきアクションは、Personal会員向けに掲載しています。

7日間無料で読む

クレカ不要・いつでも解約

詳細を読む → 元記事へ※ 本文は元記事をご確認ください (asayomu は要約のみ提供)

関連する記事

※ 外部記事の権利は原著作者に帰属します。著作権削除要請は copyright@asayomu.jp までご連絡ください(受領確認 24h・実処理 72h 以内)。