摘要:8月13日凌晨,DeepSeek V4 Pro正式版API悄然上线,1.6万亿参数MoE架构,Agent能力大幅提升,多项测试逼近甚至超越Claude Fable 5,定价仅为Fable 5的1/57。

8月13日凌晨,DeepSeek官网API文档悄悄更新了。

没有发布会,没有预告,甚至没来得及写更新日志。模型版本从V4-Pro预览版直接切到了DeepSeek-V4-Pro-0813。DeepSeek V4 Pro正式版就这么上线了。

价格没涨,但已经预告了

先说钱的事。

V4 Pro正式版定价延续预览版标准:缓存命中输入0.025元/百万Token,缓存未命中输入3元,输出6元。正好是V4 Flash的三倍。

但DeepSeek已经在定价页上写明了:计划近期整体上调API服务定价,“预计涨幅较大”。这次没涨,算是给开发者留了个窗口期。

Agent能力是这次真正的升级

V4 Pro的底层架构没变——混合专家模型,总参数1.6万亿,每次激活约490亿参数。1M上下文窗口,最大输出384K Token。

真正变的是能力方向。

DeepSeek这次把重心压在了智能体、编程、工具调用和长流程任务上。模型不光要回答问题,还得进代码仓库、调工具、执行任务、改代码,然后根据结果继续往下走。

看数据就知道变化有多大。

DeepSWE软件工程测试,预览版12.8分,正式版直接跳到62.7分——涨了将近五倍。Terminal Bench 2.1从72.1分升到87.9分。Cybergym从52.7分涨到83.3分。AutomationBench从12.8分涨到31.8分。

这不是修修补补,是直接换了个打法。

跟Fable 5比,差多少?

官方群里流出了一张评测对比表。

Terminal Bench 2.1上,V4 Pro 87.9分,Anthropic Fable 5是88.0分——差0.1分。Cybergym上V4 Pro 83.3分,反而超了Fable 5的83.1。AutomationBench也是V4 Pro领先。

DeepSWE上V4 Pro 62.7分,Fable 5是70.0分。HLE(无工具)V4 Pro 42.7分,Fable 5是53.3分——这个差距还在。

整体看,V4 Pro在智能体相关任务上已经能和Fable 5掰手腕了。有些项目赢了,有些还差一截。

真正的杀招在价格

Fable 5每百万输出Token定价50美元。DeepSeek V4 Pro是0.87美元。约57倍的差距。

外媒算过一笔账:Fable 5性能平均只比V4 Pro高5.3%,但价格贵了45倍。还有个更扎心的对比——Claude Fable 5完成一个任务的成本是3.48美元,DeepSeek V4 Pro max只要0.03美元,性能差距只有12分。

比单项指标,V4 Pro不是处处赢。但把性能和价格放一起看,竞争力就完全不同了。

几个现实问题

先说好的。V4 Pro兼容OpenAI和Anthropic两种API格式。开发者不用改代码,就能把Claude应用切到DeepSeek。调用方式也没变,直接用deepseek-v4-pro就行。

再说不太好的。

有开发者发现,网页端和API调用的思维链输出有明显差异,API出来的话术“读起来十分生硬、语序别扭”。长时间连续执行时,模型还会出现提前停止、反复思考、任务完成质量不稳定的问题。

另外,V4 Pro正式版的并发限制是500,远低于V4 Flash的2500。

还有个更根本的问题:这批智能体基准结果,截至发稿时还没有经过独立评测机构完整复现。DeepSeek自己报的数据确实亮眼,但第三方验证还没跟上。

凌晨发布的意味

DeepSeek以往偏好白天流量时段发布新模型。这次选在凌晨悄悄上线,连更新日志都没来得及写。

可能是赶时间,也可能是不想抢白天其他产品的风头——同一天马斯克发了Grok 4.6,阿里开源了Qwen3.8Max。

但不管怎样,V4 Pro正式版总算是来了。从4月24日预览版上线到8月13日正式版转正,111天。Flash版7月31日先转正,Pro版晚了不到半个月。

DeepSeek的旗舰模型,正式进入GA阶段。