Asayomu Tech
最重要★★★★★Hugging Face Papers

DeepSeek-V4.1-Flash、KVキャッシュを最大8分の1に圧縮

30秒で把握

  • 1DeepSeek-V4.1-Flash が最大100万トークン対応の552B MoEを公開
  • 2HBM上のKVキャッシュを890バイト/トークン、従来比4分の1に削減
  • 3SWA Bounded Replayで永続KVキャッシュを従来比8分の1に圧縮

要約

DeepSeek は DeepSeek-V4.1-Flash を公開し、KVキャッシュ圧縮で長期エージェントの推論コスト削減を狙う。552BパラメータのマルチモーダルMoEで、最大100万トークンのコンテキストに対応する。CED構 architecture により、decode時は1トークンあたり16B、prefill時は8Bのパラメータだけを活性化する。CSA2の層間KV再利用とFP4 KVキャッシュにより、HBM上のKVキャッシュを890バイト/トークン、DeepSeek-V4-Flash比で約4分の1に削減した。SWA Bounded Replayにより、SSDまたはホストメモリ上の永続KVキャッシュも約8分の1に圧縮した。45Tトークンで事前学習し、テキスト・マルチモーダルのエージェント用途でベースラインを上回る性能を達成した。

あなたへの影響

長文コンテキストやエージェントを運用する日本の開発チームは、KVキャッシュ容量と転送帯域を含めて推論コストを再評価し、次の検証候補として性能・メモリ使用量・SSD運用を測定すべきです。

推奨:KVキャッシュは過去のトークン情報を保持する推論用データで、HBMはGPU内の高速メモリを指します。

詳細を読む → 元記事へ※ 本文は元記事をご確認ください (asayomu は要約のみ提供)

関連する記事

※ 外部記事の権利は原著作者に帰属します。著作権削除要請は copyright@asayomu.jp までご連絡ください(受領確認 24h・実処理 72h 以内)。