7月31日,DeepSeek通过API文档发布日志,宣布DeepSeek-V4-Flash正式版API上线公测。距离V4预览版上线过去三个月,DeepSeek用一个轻量模型给出了一个信号:Agent能力的提升,不一定靠堆参数。

130亿激活参数,撬动逼近旗舰的Agent能力

DeepSeek-V4-Flash总参数2840亿,激活参数仅130亿。而V4-Pro总参数1.6万亿,激活参数490亿——两者在模型规模上相差一个数量级。V4-Flash的定位很明确:面向对速度和成本极度敏感的工作负载,主打“快”和“省”。

但正式版的变化不止于快。DeepSeek明确表示,此次更新“仅重新进行了后训练”,模型结构和尺寸与预览版完全一致。这意味着Flash的Agent能力提升,几乎全部来自训练方法和数据质量的优化——用更聪明的训练,而不是更大的模型。

九项Agent基准测试,全线超越预览版

正式版V4-Flash在多项Agent基准测试中取得显著提升:

Terminal Bench 2.1:82.7分(预览版61.8分)

NL2Repo:54.2分(预览版39.4分)

Cybergym:76.7分(预览版38.7分)

DeepSWE:54.4分(预览版7.3分)

Toolathlon Verified:70.3分(预览版49.7分)

Agent Last Exam:25.2分(预览版15.8分)

Automation Bench Public:25.1分(预览版10.8分)

DSBench-FullStack:68.7分(预览版37.0分)

DSBench-Hard:59.6分(预览版25.8分)

部分成绩甚至逼近三个月前V4-Pro预览版的水平。一个激活参数仅130亿的轻量模型,在Agent能力上跑出这样的分数,说明后训练阶段的优化空间,可能比单纯堆参数更具杠杆效应。

横向对比来看,V4-Flash正式版在多项基准测试中也超越了智谱GLM-5.2等模型。在Cybergym上76.7分的成绩,虽然与Opus-4.8的83.1分仍有差距,但考虑到模型规模的量级差异,这个表现已经超出预期。

原生支持Responses API + Codex适配,降低迁移成本

正式版V4-Flash原生支持OpenAI力推的Responses API格式,并针对性适配了Codex。开发者可以将OpenAI生态的Agent应用低成本迁移至DeepSeek平台。

同时,DeepSeek自研的Agent框架DeepSeek Harness首次以正式命名亮相。公开基准测试中的Code Agent任务,正是使用DeepSeek Harness的极简模式作为框架进行测试。这意味着DeepSeek不仅在模型层面做优化,在Agent框架层面也做了针对性部署。

性价比路线:用低价撬动Agent市场

DeepSeek-V4-Flash的定价延续了DeepSeek一贯的“价格屠夫”风格。平时价格:缓存命中输入0.02元/百万Token,缓存未命中输入1元/百万Token,输出2元/百万Token。高峰时段价格为平时的2倍。

Agent场景对推理速度和成本极度敏感——在需要反复调用工具的多轮任务中,Flash的低价优势将形成显著竞争力。对于开发者来说,这意味着可以用更低的成本跑更多的Agent任务,把“试错”变成“常规操作”。

此次发布距离DeepSeek完成超500亿元首轮融资不足两个月,公司估值已攀升至约710亿美元。从“不融资不上市”到加速商业化冲刺,DeepSeek正在用V4-Flash正式版在Agent战场上投下第一枚棋子。

2026年的关键词是Agent。DeepSeek-V4-Flash正式版用130亿激活参数证明了一件事:Agent能力不一定非要用最大模型才能跑出来。更聪明的后训练、更精准的框架优化、更具竞争力的定价——这三件事叠加在一起,可能比单纯堆参数更能决定Agent战争的走向。