大模型圈从不缺少热闹,但把热闹直接干到“售罄”的,Kimi还是头一个。

7月16日,月之暗面发布了新一代旗舰模型Kimi K3——2.8万亿参数、原生视觉理解、100万Token上下文窗口,发布仅数小时便登顶AI代码工具评测榜单Arena。四档会员套餐从468元到6708元/年,齐刷刷挂着“已售罄”的标签。

7月19日深夜,月之暗面发布《致Kimi用户:关于算力紧缺与会员暂停开放的说明》:过去48小时用户请求量大幅超出预估,逼近现有集群承载极限,即日起暂停C端新用户订阅,已有算力全部用于保障已订阅用户权益。

一款大模型上线三天就主动关闭新用户入口——这件事本身,比任何跑分都更能说明问题。

一、2.8万亿参数的“算力黑洞”

K3采用MoE架构,896个专家,每次推理仅激活16个。稀疏激活降低了单次计算量,但模型权重体积近3TB。官方建议采用64张以上加速卡组成的超节点部署。

这意味着什么?每次推理虽然只激活一小部分专家,但为了让896个专家随时待命,整个系统必须拉满。100万Token的超长上下文产生的KV缓存,对显存的吞噬是毁灭性的。

美国高端芯片禁售背景下,国内AI公司的算力底座多为存量A800/H800或国产替代卡。K3的“核动力航母”下水了,但手里的卡不够烧。

二、48小时,从登顶榜首到主动熔断

7月17日,WAIC开幕当天,K3正式上线。在Artificial Analysis综合智能评测中,K3以57分位列全球第三,仅次于Claude Fable 5和GPT-5.6 Sol。在Arena前端代码榜以1679分登顶,成为中国模型首次在该榜单拿下第一。

WAIC展台前始终围满人群,社交媒体讨论刷屏,Kimi展台成为人气最高的区域之一。

与此同时,后台数据急速攀升——48小时内,用户请求量大幅超出预估,逼近集群承载极限。7月19日深夜,Kimi按下了“暂停键”。

三、算力告急不等于需求“证伪”

有观点认为,Kimi此举是“算力泡沫破裂”的信号。恰恰相反——K3因算力不足被迫熔断,反而证明AI需求的真实性和紧迫性。

消息传出后,高盛此前关于“算力扩张时代或已终结”的判断遭到直接质疑。腾辉智算创始人董春辉指出,Kimi暂停新订阅是一种主动调配资源策略,优先保障现有付费及高净值用户体验,属于合理的短期应变措施。

真正的问题在于:算力供给的扩张速度,天然慢于优质模型带来的需求爆发。新数据中心的规划建设以月甚至以年计算,而模型需求可能在几天内暴涨。

四、从单模型到系统竞争

月之暗面正在全速推进算力扩容,但未公布恢复时间。后续新订阅将拆分Kimi主权益与Kimi Code权益,独立核算、精准匹配算力。

K3完整模型权重计划于7月27日前向全球开发者开放。云厂商和第三方推理服务商有望参与部署分流压力。但64卡超节点的配置要求意味着承接门槛不低。

结语

K3的技术突破证明了中国大模型能跻身全球第一梯队。而“暂停拉新”提醒行业:模型能力不天然等于产品能力,更不天然等于商业能力。国产大模型的竞争,正从榜单跑分进入算力、成本与体验的工程较量。海量用户同时涌入时,产品可用性和成本可控性,才是下一张大模型榜单的关键。