7月16日晚,月之暗面正式发布Kimi K3。2.8万亿参数、MoE架构、896个专家、100万Token上下文窗口——参数表拉出来足够唬人。但参数大不等于好用,价格涨了也不等于值。我们把它从头到尾拆了一遍。

一、参数与架构:2.8万亿怎么撑起来的?

K3总参数2.8万亿,是目前全球参数最大的开源模型,也是首个超2万亿级别的模型。MoE架构下896个专家,每次推理仅激活16个——模型“知道”的东西极多,但单次调用的计算量被严格控制。

20260717141221148.jpg

架构上有两项自研创新:

Kimi Delta Attention(KDA) :混合线性注意力机制。传统Transformer处理超长文本时计算成本呈平方增长,KDA用线性注意力替代大部分计算,同时保留少量全注意力层处理需要精确检索的场景。KV缓存使用量减少75%,在100万Token上下文下解码吞吐量提升最高6倍。

Attention Residuals(AttnRes) :让模型能有选择地跨层检索信息。模型变深之后,底层学到的东西不容易被顶层“忘掉”。

两项技术合在一起,K3相比上一代K2的整体训练效率提升了约2.5倍。完整权重计划7月27日前开源,届时将是全球最大的开源权重模型。

二、榜单表现:前端编程全球第一,综合第三

这是K3最硬核的成绩单。

Frontend Code Arena:1679分,全球第一,压过Claude Fable 5的1631分和GPT-5.6 Sol的1618分。这是开源模型第一次在代码领域反超顶级闭源模型。七个前端细分领域,K3拿下六个第一。

Artificial Analysis Intelligence Index:综合智能评分57分,全球第三,仅次于Claude Fable 5和GPT-5.6 Sol,领先Claude Opus 4.8和GPT-5.5。

AutomationBench-AA:53%得分居首,这是一个Agentic SaaS工作流评估。

AA-Briefcase(Agentic知识工作):Elo 1547,仅次于Claude Fable 5。

20260717143823697.png

SWE Marathon:42.0分,当前所有模型最高。

Program Bench:77.8分,略超Fable 5的76.8。

连马斯克都在Artificial Analysis的推文下留了句“Impressive”。Vercel的CEO Guillermo Rauch做了综合Web工程评测,结论很直接:K3领先Fable,开放模型第一次领先全部专有模型。

三、实测体验:强得意外,慢得着急

榜单好看,但真实用起来怎么样?

亮点一:3D和视觉生成能力突出。 有用户要求它制作一款类似《我的世界》的小游戏,负责地图和光影,最终生成结果不仅包含基础玩法,还加入了多种游戏机制以及音效。另一个案例中,K3从零生成一个叫《轨道危机》的浏览器策略游戏,10条硬性要求中主要功能均已实现并验证。

亮点二:Vision in the loop工作流。 K3生成代码后可以直接查看实时运行截图,识别布局、色彩和层级问题,再修改代码、再截图,反复迭代。在“死星战壕突袭”测试中,K3完成了生成、运行、观察结果、调整参数和重新验证的完整闭环。

亮点三:长程自主任务能力。 官方展示了一个芯片设计案例——K3连续自主运行48小时,用开源EDA工具在Nangate 45nm工艺库上完成芯片设计、优化与验证,4平方毫米内塞进146万标准单元。更离谱的是,K3从零写出了一套叫MiniTriton的GPU编译器,性能达到甚至超越Triton和torch.compile。

20260717143541347.png

短板同样明显。 综合各方测试来看,开发者的评价大多集中在:3D和视觉生成能力最突出、前端UI设计水准接近Fable 5、编码能力强但还没有超过最强闭源模型、速度是最大的短板。一个复杂前端任务耗时20分钟到一个小时,比Fable 5慢。有开发者指出,K3“投入较多思考,偶尔越界加戏”,会自行扩展任务范围,而不是严格停在用户划定的边界里。

月之暗面官方博客也坦诚写了三个局限:K3对历史思考内容敏感,中途切换模型可能导致输出质量明显下降;训练偏向长程高难任务,面对简单日常问题时容易替代用户做决定;与Fable 5和GPT-5.6 Sol相比,在用户体验上仍有差距。

四、价格:涨得最狠的开源模型

K3的API定价是输入20元/百万Token、输出100元/百万Token。对比自家上一代K2.6(输出27元/百万Token),输出价格涨了超3.5倍。

不过“贵”是相对的。海外旗舰更贵——GPT-5.6 Sol输出30美元/百万Token,Fable 5输出50美元/百万Token。按Artificial Analysis的“每任务成本”计算,K3约0.94美元,接近GPT-5.6 Sol的1.04美元,约为Opus 4.8(1.80美元)的一半。

官方声称借助Mooncake分离式推理架构,编程场景缓存率超90%,实际输入价格仅为标准价格的1/4。一个好消息是:输出Token效率提升了,K3在智能指数评测中比K2.6少用了21%的输出Token。

五、值不值?看你在什么场景用

如果你是前端开发者,K3可能是目前能拿到的最强前端编程工具。Frontend Code Arena第一,七项六冠,这个能力是实打实的。时间换金钱——慢一点,但比Fable 5便宜70%。

如果你是做长程Agent或复杂软件工程的,K3的48小时自主芯片设计、从零写编译器这些能力意味着它能处理真正复杂的长周期任务。DeepSWE 67.5分、SWE Marathon第一,不是靠刷榜刷出来的。

如果你只是日常使用或简单对话,K3可能有点“大材小用”,而且它自己都承认面对简单日常问题时容易“替代用户做决定”。

如果你对价格敏感,K3确实贵。但贵有贵的道理——它是目前开源模型里唯一能和Fable 5、GPT-5.6 Sol正面掰手腕的选手。

K3发布后仅三天,因用户请求量逼近算力极限,Kimi紧急暂停了C端新用户订阅。市场用脚投票的速度,比任何测评都诚实。