8月3日,MiniMax正式开源多模态生成模型MiniMax H3。同一天,摩尔线程基于AI训推一体智算卡MTT S5000及MUSA软件栈,宣布完成H3的极速适配与高效运行。从模型开源到适配完成,中间只隔了3个小时。
对行业来说,这条消息有两个值得关注的点。
一、H3不是普通的模型
H3是MiniMax首款开源多模态生成模型,能统一理解文本、图像、视频和音频构成的多模态上下文,直出2K分辨率、最长15秒、带原生立体声音频的视频。在Artificial Analysis视频编辑能力榜单上,H3拿了全球第一。按官方定价,2K分辨率视频生成仅0.8元/秒,约为同类旗舰的三分之一。
但真正让适配有难度的是它的架构。H3系统由三个核心模块组成——H3-Context-IR负责理解多模态指令,H3-Base生成768p音视频,H3-Regenerate-2K将画质提升至2K分辨率。H3-Base采用330亿参数的H3-Omni-Transformer架构,通过不同模态编码器将文本、图像、视频和音频统一编码为多模态序列后联合预测。
多模态上下文的引入,让H3的序列长度方差扩大了3倍,理解与生成阶段的计算负载显著提升。这不是传统文本模型那种“堆层数”就能搞定的架构——文本、图像、视频、音频四种模态混在一起,对底层硬件的算力规格与吞吐提出了完全不同的要求。
二、3小时跑通,靠的不是运气
摩尔线程能当天适配,底层有两层支撑。
第一层是硬件。 MTT S5000基于第四代“平湖”芯片架构,单卡AI稠密算力最高1000TFLOPS(FP8),配备80GB显存,显存带宽1.6TB/s,卡间互联784GB/s,完整支持FP8到FP64全精度计算。硬件级原生FP8支持,对H3这类多模态大模型的推理效率是刚需。
第二层是软件栈。 摩尔线程团队在H3开源当日迅速完成模型架构拆解、核心技术分析及典型算子梳理,仅用3小时打通了从SGLang-MUSA推理框架到MATE、muDNN高性能算子库的完整适配路径。
这一速度的关键在于SGLang-MUSA这条链路已经提前铺好。今年4月,摩尔线程MUSA后端正式合入SGLang主线,成为该框架官方原生支持的后端之一。开发者可以原生调用摩尔线程GPU,无需额外适配。自研开源算子优化引擎MATE负责能力检测、算子选择与后端调度,为Attention、GEMM等核心算子提供高效实现。
这两层叠在一起,才让3小时跑通成为可能——不是临时抱佛脚,而是生态积累的自然结果。
三、一个更大的信号:Day-0正在变成“标配”
这次适配还有一个背景值得留意:壁仞科技、海光信息也在同日宣布完成H3的Day-0适配。三家国产算力厂商同一天适配同一个模型,这不是巧合。
过去一年,国产大模型与国产GPU的协同关系发生了显著变化。摩尔线程AI计算产品线负责人高林丽在WAIC 2026上说过一段话:“去年一个大模型发布之后,可能还需要几个月时间大家才会宣布适配,当时框架层、算子层还有很多工作要做。”
现在的情况是:MiniMax H3开源当天,三家国产GPU厂商同时完成适配。从“几个月”到“当天”,差距不是一星半点。
更关键的是,摩尔线程已实现对DeepSeek、MiniMax、GLM、Kimi、Qwen等主流大模型的“发布即适配”。Day-0从“偶尔做到”变成了“稳定输出”。当一个硬件厂商能把“模型发布当天跑通”做成常规动作,说明它的软件栈已经具备了和主流生态同台竞争的系统性能力。
四、这件事的意义,不只是“跑通了一个模型”
多模态大模型对算力的消耗远超纯文本模型。H3的序列长度方差扩大了3倍,意味着推理时内存访问模式更不规则、计算负载更不均匀。能跑通H3,说明国产GPU在多模态场景下已经具备承接真实生产负载的能力。
更值得注意的是,H3的开源协议允许企业本地部署和自有数据定制。模型开源了,但企业要在本地跑起来,需要算力底座的支持。摩尔线程的Day-0适配,意味着国内开发者可以跳过“等适配”的环节,在国产GPU上直接部署H3。开源模型+国产算力的组合,第一次在“发布当天”就完整闭环。
如果把时间轴拉长一点看,这其实是国产算力生态从“能用”走向“好用”的一个切片。三年前,国产GPU跑大模型还需要大量手写算子;两年前,跑通一个模型可能需要几个月;一年前,Day-0适配还是“新闻”。到了2026年8月,三家国产GPU厂商同一天适配同一个多模态模型——这件事本身,比任何单一的技术指标都更能说明问题。



