7月31日,DeepSeek官宣DeepSeek-V4-Flash正式版API开启公测。消息一出,全球AI开发者圈直接炸了。
真正引爆讨论的,是AI深度开发者张泽的一组实测对比数据。
40秒 vs 1分47秒:速度碾压,但差距不止于此
张泽将V4-Flash正式版接入Hermes后,完成相同任务用了约40秒;而GPT-5.6 Sol搭配Codex耗时1分47秒。
差距是2.7倍。但他承认,Codex的输出质量确实更高——不过V4-Flash的交付结果已经达到可用水平,在及格线之上。
价格不是“便宜一点”,是“便宜几十倍到上百倍”
按官方API定价:
模型 | 输入(缓存未命中) | 输出 |
GPT-5.6 Sol | 5美元(≈36元) | 30美元(≈216元) |
DeepSeek V4-Flash | 1元 | 2元 |
成本差距在数十倍到上百倍。
张泽实测一次本地文件阅读加全网信息检索汇总任务消耗51万tokens,费用仅为0.53元。51万Token处理完一个复杂任务,五毛三分钱。
DeepSeek在自有API上提供了约98%的缓存命中折扣。用户通过缓存命中机制进一步拉低实际使用成本。
Agent能力直追顶级闭源模型
基准测试数据显示:
V4-Flash正式版Agent得分:25.2分
Opus-4.8:25.7分(顶级闭源模型标杆)
V4-Pro预览版:15.8分(自家上一代)
从Terminal Bench到网络安全对抗,从全栈开发到自动化测试,9项基准测试全面铺开。其中Terminal Bench 2.1拿下82.7分,CyberGym斩获76.7分。
DeepSWE从预览版的7.3分暴涨至54.4分——性能翻了6倍多。前端代码竞技场Frontend Code Arena得分1586分,较预览版提升154分。
一个值得注意的细节:模型结构没变,变的是后训练
DeepSeek官方披露,V4-Flash正式版的模型结构和尺寸与Preview版完全一致,仅重新进行了后训练。底座没变,变的是“后天教育”。
小参数模型,打出大参数级别的成绩
V4-Flash只是个小参数模型,但GLM-5.2总参数高达7440亿,激活参数400亿,均远高于V4 Flash。
行业判断:Agent时代正式开启
DeepSeek Harness作为支撑Agent任务交付的基础设施,负责上下文准备、工具调度、状态管理与边界控制。中信证券指出,Harness核心价值在于解决长程任务交付痛点,实现稳定、低成本端到端交付。AI竞争正由模型能力转向任务交付能力。
当40秒能跑完一个任务、成本不到一块钱、还能给出“可用水平”的交付结果,开发者转向V4-Flash的速度可能比想象中的更快。DeepSeek正在用V4-Flash证明一件事——AI的下一个战场不在参数规模,而在任务交付的效率与成本之间找到那个最优解。



