7月28日,月之暗面正式开源Kimi K3完整模型权重与技术报告。同一天,摩尔线程基于AI训推一体智算卡MTT S5000及MUSA软件栈,宣布完成Kimi K3的Day-0适配与稳定拉起。
Kimi K3是全球首个开源的3万亿级别模型,总参数达2.8万亿。在这个量级上,模型不再是“能不能跑”的问题——而是“谁能跑、多久能跑起来”的问题。
摩尔线程给出的答案是:Day-0。
一、为什么Day-0适配很难?
Kimi K3不是传统Transformer。它由69层KDA混合线性注意力与24层Gated MLA构成混合注意力主干,Stable Latent MoE以896个专家、每个token激活16个专家的方式运作。
这意味着它的计算模式和内存访问模式与传统模型完全不同。AI芯片要跑Kimi K3,不能只靠堆算力——软件栈必须从头适配这套新架构。
模型开源后,摩尔线程团队在极短时间内完成了模型结构解析、权重加载、核心算子实现、缓存管理优化以及分布式推理链路构建。针对KDA核心创新,团队分别完成了Prefill与Decode阶段的关键路径适配,以Triton MUSA正确性实现作为稳定基线。SGLang-MUSA同步适配了Hybrid State Pool,用于管理KDA递归状态与卷积状态,覆盖Prefix Cache、分块Prefill及PD分离场景所需的状态生命周期。
针对896专家、TopK 16激活的规模,摩尔线程快速完成DeepEP适配,打通token dispatch、combine与跨卡All-to-All通信链路。MUSA软件栈进一步完成模型路由、专家映射和分布式执行链路适配,通过MCCL、DeepEP与MTSHMEM协同承载张量并行、专家并行和低时延通信。面对Kimi K3官方MXFP4 checkpoint,团队设计了加载期在线逐层量化方案,无需离线转换即可快速拉起推理。
从模型开源到跑通,摩尔线程打通了从SGLang-MUSA推理框架到MATE高性能算子库、Triton MUSA编译器、TileLang MUSA语言层的完整技术路径。
二、撑起这一切的硬件底座:MTT S5000
MTT S5000是摩尔线程基于第四代“平湖”芯片架构打造的AI训推一体智算卡。单卡AI稠密算力最高可达1000TFLOPS,配备80GB显存,显存带宽达1.6TB/s,卡间互联带宽784GB/s,完整支持从FP8到FP64的全精度计算。
这些数字的意义在于:它不是一张只适配某类模型的专用卡,而是一张能同时扛训练和推理、能跑大模型也能做图形渲染的全功能GPU。用它来部署Kimi K3,企业不需要专门改造硬件架构。
三、MUSA生态:被低估的软件护城河
硬件决定上限,软件决定下限。摩尔线程自研的MUSA架构在单芯片上同时支持AI计算加速、3D图形渲染、物理仿真、科学计算和超高清视频编解码四大引擎。
更重要的是MUSA对主流AI框架的原生适配。摩尔线程已在推理框架SGLang主线代码中获得官方原生支持,并开源了vLLM-MUSA。MUSA开发平台原生适配PyTorch、vLLM、SGLang等主流框架,开发者社区已覆盖超过45万人,涉及200多所高校。
这次Kimi K3的极速适配,本质上是对MUSA生态对前沿大模型敏捷响应能力的一次集中检验。如果在模型开源当天就能跑通,说明这套软件栈已经具备了和主流生态同台竞技的成熟度。
四、国产算力版图正在改写
这不是摩尔线程第一次快速适配头部大模型。此前,摩尔线程已全面适配DeepSeek、GLM、MiniMax、Kimi、Qwen等国内头部大模型。
真正值得关注的是发生速度。Kimi K3开源当晚,华为昇腾同时宣布0day适配。阿里云灵骏真武M890超节点实例也同步宣布支持Kimi K3。Kimi K3开源首夜至少18家美国企业火速部署——国产GPU和海外GPU在同一个夜晚,用着同一个模型,跑着同一套任务。
当一家国产GPU厂商能在模型开源当天完成适配并稳定拉起2.8万亿参数的开源巨模型,这件事的意义已经超越了单一的技术指标。万亿参数的门槛正在被一家家国产芯片逐一踩过。大模型算力的版图正在悄悄改写——不再只有英伟达这一个选项。


