摘要:DeepSeek V4.1-Flash 采用新 Causal Encoder-Decoder 架构,支持原生视觉、1M 上下文与 FP4 KV 缓存,大幅压缩 Agent 内存。

DeepSeek V4.1-Flash 最硬核的看点,是架构。它用了一套新的 Causal Encoder-Decoder(因果编码器-解码器)结构,配 552B 参数的 MoE,支持原生视觉理解和 1M token 上下文,还把 KV 缓存压到 FP4 精度、用跨层注意力复用省显存。MarkTechPost 的解析把这几点拆得很细——对做系统的工程师,这套组合拳比「又降了价」更有嚼头。

先说 Causal Encoder-Decoder。传统解码器-only 模型处理长上下文和多模态时,计算和显存压力都大;DeepSeek 这次把「编码」和「解码」分开设计,让视觉这类输入有专门的编码通路,文本推理走解码通路,各管各的。这让「原生带视觉」不是外挂模块,而是底座能力,推理时不用在两种模态间反复切换,效率和一致性都更好。

12-deepseek-arch.jpg

FP4 KV 缓存是另一个关键。Agent 每步都要带着历史上下文跑,KV 缓存就是那块随上下文线性膨胀的显存大头。把它从常见的 FP16/BF16 压到 FP4,意味着同样一张卡能塞下长得多、便宜得多的上下文——这对「长流程 Agent」是命脉级优化。跨层注意力复用则进一步摊薄了重复计算。两项叠加,直接把 V4.1 Flash 的单位成本打下来,也解释了第 10 篇里那波降价从哪来。

1M 上下文的工程意义,不在「能读一百万字小说」,而在「能一次塞进整个代码库或一整本企业知识库」。过去 RAG 是不得已的折中——因为上下文装不下才去检索;当上下文真的够长,很多检索和切分的逻辑可以简化,Agent 的链路更短、出错更少。当然长上下文也有自己的坑:位置编码、注意力退化、长程依赖丢失,这些 DeepSeek 在架构里都要专门处理。

对研发团队,V4.1-Flash 是一份现成的「降本架构样例」:用更激进的量化、更聪明的注意力复用、更清晰的模态分工,去换推理成本和延迟。当下模型能力逼近天花板,架构工程正在取代单纯堆参数,成为性价比的主战场。谁先把这套思路吃透,谁就能用更少的卡跑出更能打的服务。

对做推理服务的团队,V4.1 Flash 的 FP4 KV 是个可直接借鉴的思路:在精度损失可控的前提下,把最占显存的环节狠狠量化,往往比换更大模型更划算。显存和延迟,很多时候是「量化策略」省出来的。

长上下文的另一面是被忽视的「成本陷阱」:1M 上下文不是免费午餐,每次请求都要为长度付钱。实际用时要做上下文裁剪和分层缓存,别一股脑把所有历史塞进去。会省,才用得起。

对研究侧,V4.1 Flash 说明「架构创新」仍是性价比主战场。当堆参数边际收益递减,更聪明的模态分工、更激进的量化、更省显存的注意力,才是拉开差距的地方。

一个工程提醒:新架构往往伴随新坑。Causal Encoder-Decoder 这类结构在长上下文下的位置退化、跨层复用的一致性,都需要在真实负载里充分验证,别被发布跑分带节奏。

对推理平台,V4.1 Flash 的跨层注意力复用值得抄:在精度可接受范围内,让相邻层共享部分表示,能显著降显存。这类「工程小聪明」累积起来,就是性价比。

提醒评测别只看发布数字:新架构的真实表现,要在你自己的负载上重测。发布 benchmark 和你的业务分布往往差很远,盲信会交学费。