最重要★★★★★Hugging Face Papers
DeepSeek-V4.1-Flash、KVキャッシュを最大8分の1に圧縮
30秒で把握
- 1DeepSeek-V4.1-Flash が最大100万トークン対応の552B MoEを公開
- 2HBM上のKVキャッシュを890バイト/トークン、従来比4分の1に削減
- 3SWA Bounded Replayで永続KVキャッシュを従来比8分の1に圧縮
要約
DeepSeek は DeepSeek-V4.1-Flash を公開し、KVキャッシュ圧縮で長期エージェントの推論コスト削減を狙う。552BパラメータのマルチモーダルMoEで、最大100万トークンのコンテキストに対応する。CED構 architecture により、decode時は1トークンあたり16B、prefill時は8Bのパラメータだけを活性化する。CSA2の層間KV再利用とFP4 KVキャッシュにより、HBM上のKVキャッシュを890バイト/トークン、DeepSeek-V4-Flash比で約4分の1に削減した。SWA Bounded Replayにより、SSDまたはホストメモリ上の永続KVキャッシュも約8分の1に圧縮した。45Tトークンで事前学習し、テキスト・マルチモーダルのエージェント用途でベースラインを上回る性能を達成した。
あなたへの影響
長文コンテキストやエージェントを運用する日本の開発チームは、KVキャッシュ容量と転送帯域を含めて推論コストを再評価し、次の検証候補として性能・メモリ使用量・SSD運用を測定すべきです。
推奨:KVキャッシュは過去のトークン情報を保持する推論用データで、HBMはGPU内の高速メモリを指します。