摘要:DeepSeek 发布 V4.1-Flash(552B MoE、MIT 开源),实测 KV cache 占用约为 V4 Flash 的四分之一,显著压低长上下文 Agent 部署成本。

DeepSeek 在 9 月 10 日连发多则消息:API 更新日志正式发布 V4.1-Flash,硅基流动 Day 0 上线,Hugging Face 以 MIT 许可开源。这是全新模型结构系列里的最小尺寸,却带着一组很"工程向"的硬指标——552B MoE,prefill 约 8B 激活、decode 约 16B 激活,原生视觉,1M 上下文窗口,KV cache 占用约为 V4 Flash 的四分之一。官方评测包括 GPQA Diamond 90.9、HLE 36.8、Codeforces 3471、Terminal-Bench 2.1 90.6。把这些数字摆一起看,它的定位不是"最大最强",而是"最划算地跑长任务"。

把"KV cache 压缩"单独拎出来说,是因为它直接戳中 Agent 部署的成本命门。长上下文 Agent 跑起来,显存里最贵的往往不是模型权重,而是随上下文长度线性膨胀的 KV cache——对话越长、工具调用越多,显存越炸,单位推理成本越高。V4.1-Flash 把这块压到约四分之一,意味着同样一张卡能扛更长的会话、更多的并发 Agent,长任务的单位成本显著下降。对要做"7×24 跑流程"的 Agent 应用,这是比单次跑分更实在的利好。一个跑一整天的代码审计 Agent,省下的显存就是省下的真金白银。

11-deepseek-v41flash.jpg

实测视角下,它的定位很清楚:不是去和超大旗舰拼极限智能,而是用"够用的能力 + 极低的部署成本 + 原生多模态 + 超长上下文"去吃 Agent 和海量并发场景。MIT 开源又让它能被自部署,对数据合规和成本敏感的企业尤其友好。硅基流动 Day 0 上线则证明生态接得住。对中小团队,这意味着可以用更低成本把长上下文 Agent 真正跑起来,而不是停在 demo。

当然,"Flash"命名和"约四分之一 KV"都是厂商口径,真实吞吐和稳定性还得靠社区在大规模部署里验证。但方向没错:当模型竞争从"谁更聪明"延伸到"谁更便宜地跑长任务",KV cache 工程会是下一阶段的分水岭。一个值得关注的细节是它 prefill/decode 激活参数不同,说明在"读入"和"生成"两个阶段做了差异化的算力分配,这正是长上下文优化的典型思路。对创业团队,这释放出明确信号:先把成本算清楚,再谈智能上限。