Asayomu Tech
注目★★★★★Hugging Face Papers

LatentPress、文脈を4〜16倍圧縮する連続メモリ

30秒で把握

  • 1LatentPress が会話と文書を連続メモリトークンへ変換
  • 24〜16倍圧縮、LongMemEvalで正解率0.504を達成
  • 3書き込み43ms、読み取りは生文脈やOCRより5〜9倍高速

要約

LatentPressは、会話履歴や長文書を連続メモリトークンへ変換し、テキストへ再構成せず凍結済みDecoderに直接読ませる手法を提案した。4〜16倍の圧縮に対応し、学習するAdapterは4.2M〜26.2MパラメータでDecoderの約0.1%に抑えた。LongMemEvalでは7.70倍圧縮時に正解率0.504を達成し、未圧縮の0.490、テキスト要約の0.184、OCR圧縮の0.426〜0.312を上回った。書き込みは会話あたり43ms、読み取りは生の文脈やキャッシュ済みOCRより5〜9倍高速だった。LongBench-QAでは4〜8倍圧縮で生文脈と同等以上だが、16倍では下回った。

あなたへの影響

長文コンテキストを扱う日本の開発チームは、既存の要約やOCRと比較して推論速度・精度・転移性能を評価するとよい。

推奨:連続メモリトークンは、人間向けの文章を介さずモデルへ文脈を渡す方式であり、実運用では対象Decoderとの適合性確認が必要になる可能性がある。

詳細を読む → 元記事へ※ 本文は元記事をご確認ください (asayomu は要約のみ提供)

関連する記事

※ 外部記事の権利は原著作者に帰属します。著作権削除要請は copyright@asayomu.jp までご連絡ください(受領確認 24h・実処理 72h 以内)。