摘要:8月13日凌晨,DeepSeek V4 Pro正式版API悄然上线,1.6万亿参数MoE架构,Agent能力大幅提升,多项测试逼近甚至超越Claude Fable 5,定价仅为Fable 5的1/57。
8月13日凌晨,DeepSeek官网API文档悄悄更新了。
没有发布会,没有预告,甚至没来得及写更新日志。模型版本从V4-Pro预览版直接切到了DeepSeek-V4-Pro-0813。DeepSeek V4 Pro正式版就这么上线了。
价格没涨,但已经预告了
先说钱的事。
V4 Pro正式版定价延续预览版标准:缓存命中输入0.025元/百万Token,缓存未命中输入3元,输出6元。正好是V4 Flash的三倍。
但DeepSeek已经在定价页上写明了:计划近期整体上调API服务定价,“预计涨幅较大”。这次没涨,算是给开发者留了个窗口期。
Agent能力是这次真正的升级
V4 Pro的底层架构没变——混合专家模型,总参数1.6万亿,每次激活约490亿参数。1M上下文窗口,最大输出384K Token。
真正变的是能力方向。
DeepSeek这次把重心压在了智能体、编程、工具调用和长流程任务上。模型不光要回答问题,还得进代码仓库、调工具、执行任务、改代码,然后根据结果继续往下走。
看数据就知道变化有多大。
DeepSWE软件工程测试,预览版12.8分,正式版直接跳到62.7分——涨了将近五倍。Terminal Bench 2.1从72.1分升到87.9分。Cybergym从52.7分涨到83.3分。AutomationBench从12.8分涨到31.8分。
这不是修修补补,是直接换了个打法。
跟Fable 5比,差多少?
官方群里流出了一张评测对比表。
Terminal Bench 2.1上,V4 Pro 87.9分,Anthropic Fable 5是88.0分——差0.1分。Cybergym上V4 Pro 83.3分,反而超了Fable 5的83.1。AutomationBench也是V4 Pro领先。
DeepSWE上V4 Pro 62.7分,Fable 5是70.0分。HLE(无工具)V4 Pro 42.7分,Fable 5是53.3分——这个差距还在。
整体看,V4 Pro在智能体相关任务上已经能和Fable 5掰手腕了。有些项目赢了,有些还差一截。
真正的杀招在价格
Fable 5每百万输出Token定价50美元。DeepSeek V4 Pro是0.87美元。约57倍的差距。
外媒算过一笔账:Fable 5性能平均只比V4 Pro高5.3%,但价格贵了45倍。还有个更扎心的对比——Claude Fable 5完成一个任务的成本是3.48美元,DeepSeek V4 Pro max只要0.03美元,性能差距只有12分。
比单项指标,V4 Pro不是处处赢。但把性能和价格放一起看,竞争力就完全不同了。
几个现实问题
先说好的。V4 Pro兼容OpenAI和Anthropic两种API格式。开发者不用改代码,就能把Claude应用切到DeepSeek。调用方式也没变,直接用deepseek-v4-pro就行。
再说不太好的。
有开发者发现,网页端和API调用的思维链输出有明显差异,API出来的话术“读起来十分生硬、语序别扭”。长时间连续执行时,模型还会出现提前停止、反复思考、任务完成质量不稳定的问题。
另外,V4 Pro正式版的并发限制是500,远低于V4 Flash的2500。
还有个更根本的问题:这批智能体基准结果,截至发稿时还没有经过独立评测机构完整复现。DeepSeek自己报的数据确实亮眼,但第三方验证还没跟上。
凌晨发布的意味
DeepSeek以往偏好白天流量时段发布新模型。这次选在凌晨悄悄上线,连更新日志都没来得及写。
可能是赶时间,也可能是不想抢白天其他产品的风头——同一天马斯克发了Grok 4.6,阿里开源了Qwen3.8Max。
但不管怎样,V4 Pro正式版总算是来了。从4月24日预览版上线到8月13日正式版转正,111天。Flash版7月31日先转正,Pro版晚了不到半个月。
DeepSeek的旗舰模型,正式进入GA阶段。



