Kimi K3的热度还没散,DeepSeek的“靴子”就要落地了。
7月16日,月之暗面发布2.8万亿参数的Kimi K3,全球最大开源权重模型,三天后因算力爆表紧急暂停C端新用户订阅。紧接着,多方消息证实,DeepSeek V4正式版已进入灰度测试阶段,有望于7月20日(下周一)正式发布。
四天之内,国产大模型密集出牌。
一、实测性能:Opus 4.8水平,3D生成远超预期
据流出的测试信息与海外博主反馈,DeepSeek V4正式版在多项核心指标上表现惊艳。
开发者Pankaj Kumar体验后的总结颇为中肯:整体表现接近Claude Opus 4.8级别,编码直追GPT-5.6 Sol;Agent能力大幅增强,3D和SVG生成显著变好。有测试者甚至指出,在特定测试(如游戏代码生成)中,V4正式版已压过Fable 5与GPT-5.6一头。
一位博主展示的《鱿鱼游戏》小游戏编码测试中,V4生成3000行代码总成本仅0.12美元。另有测试者用V4 Pro一次性跑出了3D模拟射击游戏、《我的世界》混搭游戏以及经典“割绳子”游戏的完整HTML代码,可玩度相当高。
交互体验上也有微调。测试者注意到其思维链风格更加接近Claude,不再堆砌代码墙,而是以“编写核心功能”、“编写主要场景代码”等总结性步骤呈现,可读性大幅增强。
二、两个版本,一个策略
V4正式版延续预览版的规格,分为两个版本:
DeepSeek V4 Pro:总参数1.6T,激活参数49B
DeepSeek V4 Flash:总参数284B,激活参数13B
两个版本均原生支持100万Token超长上下文。预览版发布时,官方自测的SWE-bench Verified中,DeepSeek-V4-Pro-Max距Claude Opus 4.6 Max仅差0.2个百分点。
三、首次引入“峰谷计费”,价格屠夫的算盘
真正引发关注的不只是性能,而是价格。
上个月底,DeepSeek向所有API用户发了一封邮件:V4正式版上线后同步调整API定价,首次引入“峰谷计费”。高峰时段(每日9:00-12:00和14:00-18:00)价格为平时2倍。
具体定价:
版本 | 场景 | 百万输出Token |
V4 Pro | 平时 | 0.87美元 |
V4 Pro | 高峰 | 1.74美元 |
V4 Flash | 平时 | 0.28美元 |
V4 Flash | 高峰 | 0.56美元 |
对比来看,Anthropic Claude Fable 5的百万输出定价为50美元。V4 Flash的平时价格仅为Fable 5的0.56%——约1/179。即便按高峰价计算,V4 Pro的1.74美元也仅为Fable 5的3.5%,约1/29。更激进的说法是,V4 GA以Opus 4.8级别的编程性能,输出成本仅为Fable 5的约1.7%,即约1/57。
四、“DeepSeek时刻2.0”:打不过K3,但价格碾压
一个被多位观察者反复提及的判断:V4在绝对性能上大概率赢不了刚发布的Kimi K3,但价格会显著更低。
这两家厂商的路线分化已经十分明显:
Kimi K3:在编程榜单上与海外闭源模型正面对标,以能力上限为核心卖点。Agentic类别平均得分91.2,大幅领先DeepSeek V4 Pro(Max)的74.5。
DeepSeek V4:将Opus级别的能力压缩至七分之一的价格,以成本优势撬动市场。
前者卷的是能力天花板,后者卷的是能力下限的价格门槛。
有分析认为,如果V4的性能真配上这个价格,那可能又是一次“DeepSeek时刻”。V3时代用低价颠覆市场的那一幕,正在重演。
五、一个值得注意的细节
deepseek-chat和deepseek-reasoner两个老模型名,将于7月24日正式下线,分别对应deepseek-v4-flash的非思考与思考模式。
这意味着V4正式版将全面接管DeepSeek的API服务。从预览版到正式版,从固定定价到峰谷计费,DeepSeek正在完成一次从“技术验证”到“商业运营”的系统性升级。
而那个从不涨价的“价格屠夫”,第一次给自己的算力装上了计价器。对个人用户影响不大,但对那些把Agent挂在工作时间不间断跑的团队来说,这是实打实要重新算的一笔账。


