DeepSeek-V4.1-Flash 技术解读:持久化 KV Cache 压到约 1/8,百万上下文 Agent 的成本拐点
0. 摘要 / TL;DR DeepSeek-V4.1-Flash 是一个 552B backbone、196B Engram 参数的多模态 MoE 模型,prefill 每 token 激活 8B,decode 每 token 激活 16B,支持 100 万 token 上下文。它的核心目标不是继续堆参数,而是把长上下文 Agent 的部署成本打到新低。 它通过 CED、CSA2、FP4 KV