7月31日,DeepSeek官宣DeepSeek-V4-Flash正式版API开启公测。消息一出,全球AI开发者圈直接炸了。

真正引爆讨论的,是AI深度开发者张泽的一组实测对比数据。

40秒 vs 1分47秒:速度碾压,但差距不止于此

张泽将V4-Flash正式版接入Hermes后,完成相同任务用了约40秒;而GPT-5.6 Sol搭配Codex耗时1分47秒。

差距是2.7倍。但他承认,Codex的输出质量确实更高——不过V4-Flash的交付结果已经达到可用水平,在及格线之上。

价格不是“便宜一点”,是“便宜几十倍到上百倍”

按官方API定价:

模型

输入(缓存未命中)

输出

GPT-5.6 Sol

5美元(≈36元)

30美元(≈216元)

DeepSeek V4-Flash

1元

2元

成本差距在数十倍到上百倍。

张泽实测一次本地文件阅读加全网信息检索汇总任务消耗51万tokens,费用仅为0.53元。51万Token处理完一个复杂任务,五毛三分钱。

DeepSeek在自有API上提供了约98%的缓存命中折扣。用户通过缓存命中机制进一步拉低实际使用成本。

Agent能力直追顶级闭源模型

基准测试数据显示:

V4-Flash正式版Agent得分:25.2分

Opus-4.8:25.7分(顶级闭源模型标杆)

V4-Pro预览版:15.8分(自家上一代)

从Terminal Bench到网络安全对抗,从全栈开发到自动化测试,9项基准测试全面铺开。其中Terminal Bench 2.1拿下82.7分,CyberGym斩获76.7分。

DeepSWE从预览版的7.3分暴涨至54.4分——性能翻了6倍多。前端代码竞技场Frontend Code Arena得分1586分,较预览版提升154分。

一个值得注意的细节:模型结构没变,变的是后训练

DeepSeek官方披露,V4-Flash正式版的模型结构和尺寸与Preview版完全一致,仅重新进行了后训练。底座没变,变的是“后天教育”。

小参数模型,打出大参数级别的成绩

V4-Flash只是个小参数模型,但GLM-5.2总参数高达7440亿,激活参数400亿,均远高于V4 Flash。

行业判断:Agent时代正式开启

DeepSeek Harness作为支撑Agent任务交付的基础设施,负责上下文准备、工具调度、状态管理与边界控制。中信证券指出,Harness核心价值在于解决长程任务交付痛点,实现稳定、低成本端到端交付。AI竞争正由模型能力转向任务交付能力。

当40秒能跑完一个任务、成本不到一块钱、还能给出“可用水平”的交付结果,开发者转向V4-Flash的速度可能比想象中的更快。DeepSeek正在用V4-Flash证明一件事——AI的下一个战场不在参数规模,而在任务交付的效率与成本之间找到那个最优解。