8月3日,MiniMax正式宣布开源新一代通用视频模型MiniMax H3。这是一个通用型全模态生成系统——能够统一理解由文本、图像、视频和音频构成的多模态上下文,并可生成最高2K分辨率、最长15秒、带有原生立体声音频的视频。开源首日,华为昇腾、摩尔线程、AMD、Intel等十六家头部芯片厂商及开发社区便完成了适配支持。

一、从“特化”到“通用”:打破任务与模态的边界

此前多模态生成领域长期存在一个结构性问题:图像生成被拆分成文生图、编辑、主体参考、动作参考等多个独立专家模型;音频生成中语音、音效、音乐被割裂研究;视频生成进一步碎片化为文生视频、图生视频、首尾帧生成等数十种任务。这种碎片化不仅限制了创作者的自由,也制约了模型的泛化能力。

H3的设计哲学正是打破这种边界。它通过Contextual Omni Representation(上下文全模态表示)技术,让自然语言成为连接各类模态的通用桥梁。用户只需用语言描述复杂关系——比如“参考某段视频的希区柯克式镜头运动,让指定图片中的人物唱出某段音频的歌声”——模型即可自动完成全链路理解与生成。

二、三模块架构:从768p到2K的“再生”路径

完整的H3系统由三个核心模块组成:

H3-Context-IR(上下文中间表示) :将复杂的多模态指令深度解析并转化为模型易于理解的结构,是保障高品质输出的关键环节。

H3-Base:根据中间表示生成音频和视频,输出768p分辨率的基础结果。

H3-Regenerate-2K:将768p的生成结果连同原始上下文一并回传,以2K分辨率重新生成输出。这套“先出底稿、再精修”的机制既发挥了基础模型的生成能力,又充分利用了原始上下文中的丰富信息。

输出规格上,H3支持4到15秒时长、24 FPS帧率、32 kHz立体声,以及21:9、16:9、4:3、1:1等多种宽高比。多语言交互方面稳定支持11种主流语言。

三、两种输入模式:灵活适配不同创作场景

H3提供了两种输入模式:

H3-Base-FL2VA首尾帧模式:支持输入0到2张图像,可灵活应对文生视频、首帧生视频、尾帧生视频以及首尾帧协同生成四种任务。

H3-Base-Ref2VA全模态参考模式:支持最多9张图像、3段视频和3段音频的混合输入,文件总数最高可达12个。这为需要精细控制多源参考信息的专业创作者提供了前所未有的自由度。

四、开源生态:从“闭源垄断”到“全模态普惠”

闭源模型长期主导视频生成领域,迭代速度慢、生态不够开放。H3的开源标志着这一格局正在被打破。开源首日即获得从芯片到框架的广泛生态支持。

H3借鉴了文本模型发展中被验证的方法——复杂问题拆解、推理扩展(Reasoning)、上下文缩放(Scaling Context)和Muon优化器等——并将其应用到多模态理解、数据构建和模型训练中。围绕不同任务的理解和指令遵循,MiniMax对数据体系进行了多轮迭代,提升模型面对开放输入和复杂指令时的泛化能力。

在权威视频模型榜单Artificial Analysis中,H3的视频编辑能力排名全球第一,文生视频和图生视频能力分别位居第二、第三。

五、商用落地:效果、成本与生态的综合竞争

H3在发布前已完成前期邀测验证,具备商用级多场景内容生成能力。在指令遵循、文字与品牌信息呈现、V2V Motion Transfer(视频到视频动作迁移)等方面表现出色,可广泛适用于广告、品牌、电商、产品设计、UI/UX、游戏等商业场景。

价格方面,2K分辨率视频生成价格为0.8元/秒,仅为同类旗舰模型的三分之一。成本优势来自系统级优化——高压缩Tokenizer减少视频生成所需Token数量,异构训练和负载均衡提升GPU利用效率。

H3的开源将多模态模型的竞争从单一效果比拼,推向效果、成本、开放性与生态协同的综合维度。当视频生成的门槛从“闭源调用”降到“本地部署”,内容创作的下一波效率革命,可能正从这次开源开始。