7月28日,月之暗面正式开源2.8万亿参数模型Kimi K3并发布模型权重与技术报告。同日,摩尔线程基于AI训推一体智算卡MTT S5000及MUSA软件栈,宣布完成Kimi K3的Day-0适配与稳定拉起。
一、Kimi K3:全球首个开源的3万亿级别模型
Kimi K3总参数达2.8万亿,是全球首个开源的3万亿级别模型,也是迄今为止参数规模最大的开源模型。
架构层面,K3与传统Transformer模型完全不同。它由69层KDA混合线性注意力与24层Gated MLA构成混合注意力主干,Stable Latent MoE以896个专家、每个token激活16个专家的方式运作。原生支持视觉理解,并拥有100万token上下文窗口。
这意味着它的计算模式、内存访问模式和通信模式,都与传统模型有本质区别。AI芯片要跑Kimi K3,软件栈必须从头适配这套新架构。
二、Day-0适配:摩尔线程怎么做到的?
K3开源后,摩尔线程在第一时间完成了模型结构解析、权重加载、核心算子实现、缓存管理优化以及分布式推理链路构建。
针对KDA核心创新,团队分别完成了Prefill与Decode阶段的关键路径适配,以Triton MUSA正确性实现作为稳定基线。SGLang-MUSA同步适配了Hybrid State Pool,用于管理KDA递归状态与卷积状态,覆盖Prefix Cache、分块Prefill及PD分离场景所需的状态生命周期。
针对Stable Latent MoE的896专家、TopK 16激活规模,摩尔线程快速完成DeepEP适配,打通token dispatch、combine与跨卡All-to-All通信链路。MUSA软件栈完成模型路由、专家映射和分布式执行链路适配,通过MCCL、DeepEP与MTSHMEM协同承载张量并行、专家并行和低时延通信。
面对Kimi K3官方MXFP4 checkpoint,团队设计了加载期在线逐层量化方案,无需离线转换即可快速拉起推理。
最终,摩尔线程打通了从SGLang-MUSA推理框架到MATE高性能算子库、Triton MUSA编译器、TileLang MUSA语言层的完整技术路径。MTCC编译器和MUSA运行时高效支持SGLang JIT及DSL算子在MTT S5000上快速部署运行。
三、硬件底座:MTT S5000
MTT S5000是摩尔线程基于第四代“平湖”芯片架构打造的AI训推一体智算卡。单卡AI稠密算力最高可达1000TFLOPS,配备80GB显存,显存带宽达1.6TB/s,卡间互联带宽784GB/s,完整支持从FP8到FP64的全精度计算。
它不是一张只适配某类模型的专用卡,而是一张能同时扛训练和推理、能跑大模型也能做图形渲染的全功能GPU。
四、行业意义:从“能不能跑”到“多久能跑起来”
在2.8万亿参数这个量级上,模型适配的问题不再是“能不能跑”,而是“谁能跑、多久能跑起来”。
摩尔线程在模型开源当天完成适配并稳定拉起,验证了国产全功能GPU支撑万亿级大模型研发与工程落地的硬核实力。
这不是摩尔线程第一次快速适配头部大模型。此前,摩尔线程已全面适配DeepSeek、GLM、MiniMax、Kimi、Qwen等国内头部大模型。但Kimi K3适配的特殊之处在于:它面对的是一个架构完全非标准的模型,KDA混合注意力和896专家MoE对软件栈提出了系统性挑战。在这种挑战下实现Day-0适配,意味着MUSA生态已经具备了和主流生态同台竞技的成熟度。
更重要的是——Kimi K3开源当晚,华为昇腾同时宣布0day适配,阿里云真武M890超节点也同步宣布支持。国产GPU和海外GPU在同一个夜晚,用着同一个模型,跑着同一套任务。
从“能不能跑”到“多久能跑起来”,国产算力正在用Day-0适配的速度,回答那个曾经只有英伟达才能回答的问题。万亿参数的门槛正在被一家家国产芯片逐一踩过。大模型算力的版图,正在被重新绘制。


