7月16日,WAIC开幕前夜,月之暗面发布2.8万亿参数的Kimi K3,全球最大开源模型。三天后,7月19日深夜,官网挂出公告:暂停C端新用户订阅。
一款大模型上线三天就被迫关闭新用户入口——这件事本身,比任何技术参数都更能说明问题。
一、48小时,从发布即巅峰到紧急刹车
K3的参数规模达2.8万亿,原生支持视觉理解,拥有100万Token上下文窗口。据Artificial Analysis第三方评测,K3综合智能评分57分,全球第三,仅次于Claude Fable 5与GPT-5.6 Sol。在Frontend Code Arena榜单上,K3以1679分登顶,成为中国首个拿下该榜榜首的大模型。
用户蜂拥而至。开发者用它搓游戏、建3D场景、做交互应用。请求量一路狂飙。7月19日,Kimi公告称:“过去48小时,用户请求量已大幅超出我们的预估,并且逼近现有集群的承载极限。”
Kimi宣布:即日起暂停C端新用户订阅,已有算力全部投入服务已订阅用户。未来新订阅将拆分Kimi主权益与Kimi Code权益,独立核算。
“K3太火了,服务器扛不住了,先别进新人了。”
二、2.8万亿参数的“算力黑洞”
暂停订阅的直接原因是算力紧缺。但“算力紧缺”四个字背后,是2.8万亿参数在物理世界里的真实消耗。
K3采用MoE架构,896个专家,每次推理仅激活16个。稀疏激活降低了单次计算量,但模型权重体积近3TB——仅仅加载模型,就需要数十张高端GPU的HBM。100万Token的超长上下文产生的KV缓存,对显存的吞噬是毁灭性的。华泰证券指出,K3建议采用64张以上加速卡组成的超节点部署。
在美国高端芯片禁售背景下,国内AI公司能拿到的算力底座多为存量A800/H800或国产替代卡。2.8万亿参数的“核动力航母”下水了,但手里的卡不够烧。
有头部云厂商AI Infra负责人拆解道:“MoE架构就像一家拥有896个顶级专家的超级医院。虽然每个病人只看16个科室,但为了维持896个专家随时待命,必须把整个医院的空调、安保和后勤系统全部拉满。”
公告里那句“用户请求量逼近承载极限”,翻译成商业大白话就是:手里的卡,真的不够烧了。
三、限流背后:一场财务自救与客群清洗
这绝不只是“产品太火”的凡尔赛。在高端芯片受限的“算力贫困”下,C端海量用户的涌入不仅无法转化为利润,反而成了榨干算力池的负担。
数据说明问题。今年3月,月之暗面ARR首次突破1亿美元;5月突破2亿;6月接近3亿,三个月翻了三倍。K3发布当天,ARR创下历史最大单日增幅。
但推理成本同样在飙升。如果继续放开C端新订阅,不仅新用户会排队和宕机,连高净值API客户和付费会员的体验也会被拖垮。
K3的定价已经体现了“能力定价”逻辑:输出价格每百万Token 15美元,与GPT-5.6 Terra相当。缓存命中输入仅为未命中的十分之一,Mooncake架构使编码工作负载缓存命中率超90%。系统级优化降低了实际调用成本,但前提是——得有足够的算力来跑这套系统。
四、K3冲击波:从华尔街到硅谷
K3引发的震荡不止于国内。
K3发布首个交易日,英伟达单日市值蒸发约1111亿美元。费城半导体指数本周下跌12.5%,创15个月最差单周表现。摩根大通称之为“DeepSeek 2.0”。
美国前AI事务负责人、现任总统科技顾问委员会联席主席大卫·塞克斯发文称,这是中国模型第一次在前端编程赛道拿下第一,“照此以往,美国将输掉AI竞赛”。加州大学伯克利分校教授伊翁·斯托伊卡说:“开源模型与最先进模型的差距,大概只有两到三个月了。”
中国工程院院士郑纬民在WAIC上表示:算力规模快速扩张不等于高效Token产能。智能体时代真正稀缺的不只是芯片,而是稳定、低成本、高等级地产出Token的系统能力。
K3的限流,恰好印证了这句话。
五、一个更紧迫的考题
月之暗面已在全速推进算力扩容,K3完整模型权重计划于7月27日前向全球开发者开放。Kimi正寻求香港上市批准,最快6个月IPO,估值或超300亿美元。
但眼前的问题是:当一个2.8万亿参数的巨兽撞上用户的真实热情,算力扩容的速度第一次成了比模型参数更紧迫的考题。
K3用三天时间证明了中国模型能跻身全球第一梯队,也暴露了从“发布PPT”到“真实生产环境”之间最尖锐的矛盾。模型强不强,看榜单;系统稳不稳,看流量冲进来的时候能不能扛住。
K3的刹车,踩给所有大模型公司看。

