注目★★★★★Hugging Face Papers
言語モデルにメモリ機能を分離、6.9Bパラメータで検証—39%削減で12Bレベルの性能実現
30秒で把握
- 1Memory Decoder at Scale、6.9B パラメータで 300B トークン学習・分散 Faiss パイプラインで大規模索引実現
- 2メモリ 1.7B + 基本 410M で Pythia-12B 同等スコア達成・総パラメータ 39% 削減・17 ベンチで効果確認
- 3推論とメモリ独立スケーリングがパラメータ効率で優位・モデル設計選択肢として次世代実装に影響
要約
Memory Decoder at Scale は、言語モデルの推論能力とメモリを分離する手法を大規模で検証した。6.9B パラメータのモデルに 1.7B パラメータの専用メモリモジュールを組み合わせることで、Pythia-12B (37.24) と同等のスコア 37.34 を達成しつつ、総パラメータ数を 39% 削減した。300B トークンの学習スケールで Faiss インデックスの計算ボトルネックを分散パイプラインと疎な kNN ロード技術で解決。
あなたへの影響
この記事が日本のエンジニアに与える影響と、今日取るべきアクションは、Personal会員向けに掲載しています。
クレカ不要・いつでも解約