7月31日,DeepSeek通过API文档更新日志,正式宣布DeepSeek-V4-Flash API进入公测阶段。距离DeepSeek V4预览版上线过去了整整三个月。与以往“Pro强、Flash弱”的分层逻辑不同,这次更新释放了一个值得关注的信号——Flash正式版在多项Agent基准测试中的表现,已经逼近甚至超越了三个月前V4-Pro预览版的水平。
130亿激活参数,9项基准测试全面碾压自家Pro预览版
根据官方更新日志,DeepSeek-V4-Flash正式版采用MoE架构,总参数规模达到2840亿,激活参数仅130亿。模型结构与预览版保持一致,仅重新进行了后训练。就是这“仅重新进行了后训练”的五个字,让Flash在Agent能力上完成了一次质的飞跃。
九项Agent基准测试成绩全部公开披露:
Terminal Bench 2.1:82.7分——终端操作能力逼近行业顶尖
NL2Repo:54.2分——代码仓库生成能力大幅跃升
Cybergym:76.7分——网络安全任务表现出色
DeepSWE:54.4分——软件工程能力从预览版的7.3分暴涨超6倍
Toolathlon Verified:70.3分——工具调用与多步骤任务执行能力
Agent Last Exam:25.2分
Automation Bench Public:25.1分
DSBench-FullStack:68.7分(内部全栈开发测试集)
DSBench-Hard:59.6分(内部Coding Agent难题测试集)
作为对比,V4-Pro预览版在Terminal Bench 2.0上的得分仅为67.9分。一个激活参数仅130亿的轻量版,在Agent能力上跑出这样的分数——后训练阶段的优化空间,可能比单纯堆参数更具杠杆效应。
0.2元/百万Token,用最低成本跑最强的Agent任务
DeepSeek-V4-Flash在定价上保持了极致性价比。输入命中缓存仅需0.2元/百万Token,未命中输入为1元/百万Token,输出为2元/百万Token。高峰时段价格翻倍,缓存命中输入涨至0.04元,未命中输入涨至2元,输出涨至4元。
这意味着什么?一个需要反复调用工具、执行多轮任务的Agent场景,Flash的低价优势会在反复调用中形成显著的累积竞争力。低价不等于低能——Flash用更低的价格,交出了比自家Pro预览版更强的Agent能力。
自研Harness首次亮相,原生适配Codex与Responses API
此次升级还有两个技术层面的看点。
第一,DeepSeek自研的Agent框架DeepSeek Harness首次以正式命名亮相。公开基准测试中的Code Agent任务,正是使用DeepSeek Harness极简模式作为测试框架完成的。这暗示DeepSeek在Agent框架层面也做了针对性优化,而不仅仅是模型本身的提升。
第二,V4-Flash正式版原生支持OpenAI力推的Responses API格式,并针对性适配了Codex。开发者无需修改Base URL即可切换模型,OpenAI生态的Agent应用可以低成本迁移至DeepSeek平台。
Agent,才是2026年大模型竞争的新标尺
2023年的大模型竞争是“拼通用能力”,2024年是“拼长上下文”,2026年的关键词,毫无疑问是Agent。Agent能力——即模型自主规划、调用工具、执行复杂任务的能力——正在成为衡量大模型实力的新标尺。
DeepSeek创始人梁文锋曾把AGI的实现路径比作爬楼梯:语言模型是第一级,去年解决的是CoT(思维链),今年的台阶是Agent,而Agent之后必须解决的问题是持续学习。DeepSeek的Harness团队组建于今年3月,由90后、手握6枚ACM亚洲区域赛金牌的崔添翼挂帅。
从4月24日预览版上线,到7月31日Flash正式版公测,再到即将到来的V4-Pro正式版,DeepSeek用三个月时间完成了从“开源模型”到“Agent交付”的关键跨越。价格战拼的是入场券,Agent能力才是决赛圈。
DeepSeek-V4-Flash正式版API即日起向公众开放公测,调用方式不变,仅需将model参数设为deepseek-v4-flash即可使用最新版本。App和网页端暂无法体验,但API已经准备好了。



