当全球开发者还在讨论Kimi K3开源带来的冲击波时,国产算力阵营已经用行动给出了回应——不仅是跑通,而且是Day0同步适配。
7月27日,月之暗面正式开源Kimi K3。同一时间,海光信息宣布已完成Kimi K3在海光DCU平台的全栈适配与性能验证。这是国产GPU首次在模型发布当天完成对万亿级开源模型的适配部署。
一、Kimi K3:2.8万亿参数的“巨兽”
Kimi K3总参数达2.8万亿,激活参数1040亿,支持100万Token上下文窗口,是全球首个开源的3万亿级别模型。模型基于混合专家(MoE)架构,拥有896个路由专家、每次仅激活16个。
架构上搭载了KDA混合线性注意力机制与注意力残差技术,原生支持视觉理解。在Artificial Analysis智能指数上综合得分57分,全球第三;Frontend Code Arena以1679分登顶全球第一。
二、海光DCU的Day0适配:从算子到引擎的全栈调优
海光DCU团队依托自研DAS/DTK软件栈,完成了从底层算子、训练推理框架到推理引擎的全栈适配。
零改造部署:模型代码与业务逻辑无需任何调整即可运行,迁移成本几乎为零,开发者拿到算力即可上线。
算子级定制优化:针对KDA混合线性注意力机制与896专家MoE架构,海光完成了算子级定制优化。
实测性能折损控制在12%以内:官方实测显示,国产卡性能折损控制在12%以内,已达到商用部署标准。
三、896专家并行,百万上下文不卡顿
Kimi K3的896个专家MoE架构,对并行推理能力提出了极高要求。海光DCU通过底层硬件与软件栈的协同优化,在曙光8000集群上实现了长文本推理的稳定运行。
月之暗面在发布K3前,已联合海光、中科曙光完成了完整的兼容性调优。曙光基于海光DCU硬件栈,打通了Kimi MoE架构的分布式训练与多卡并行推理链路。
即便896个专家同时并行工作,在百万级上下文的重载场景下,推理依然高效、稳定、低延迟。
四、国产算力跑通前沿场景
满血落地的Kimi K3,把一批过去只存在于演示中的前沿智能场景带到了国产算力之上:
长程智能体工程:K3可在极少人工监督下持续完成长时间工程任务,从GPU内核优化到从零构建类Triton编译器,在海光DCU上自主闭环。
视觉闭环创作:原生视觉理解打通“代码—截图—优化”回路,3D交互世界、游戏开发、前端与CAD设计即时可见、即刻优化。
自主芯片设计:基于开源EDA工具链,K3可连续数十小时自主完成芯片的构建、优化与验证。
五、不止海光:国产算力生态正在加速闭合
海光DCU并非孤例。阿里云于7月27日晚间完成适配工作,旗下灵骏真武M890超节点实例可承载2.8万亿参数的Kimi K3,首Token延迟下降35%。
华为昇腾CANN在K3开源当天完成推理适配。从芯片到模型,国产AI技术栈的闭环正在加速成型。
截至2025年末,海光DCU已覆盖20多个关键行业、300余个应用场景,与365款主流大模型完成全面适配。
结语
国产GPU第一次把万亿参数级的模型稳稳托住了。当Kimi K3在海光DCU上跑通的那一刻,意味着万亿级顶尖开源模型不再局限于海外算力平台。
从“可用”到“好用”,国产算力正在跨越那道最难的坎。而这道坎一旦跨过去,智能时代的算力版图,正在悄悄挪动。



