MiniMax H3全模态生成模型于7月31日正式发布,支持文本、图像、视频、音频的统一理解与生成,最高可生成15秒2K分辨率的原生双声道音视频。这是MiniMax从“特化任务模型”迈向“通用多模态智能”的重要探索——不再以图片、视频、声音的生成、编辑等单一任务为边界,而是在多模态上下文中统一理解创作意图,完成更自然、连贯的生成与表达。

H3在2K视频输出上走了一条不一样的路。常规做法是生成低分辨率画面再靠超分模块“猜”出细节,H3直接用自己的基础模型对低分辨率结果进行in-context重新生成。传统超分只能靠算法补全像素,H3的基模能复用已经具备的生成能力,还原传统方案无法靠“猜”还原的信息。配合自研的H3-VAE与In-context Regeneration技术以及Contextual Omni Representation技术——让自然语言成为连接各类模态的通用桥梁,用户只需用语言描述复杂关系,模型即可自动完成全链路理解与生成。

商用能力已在前期邀测中得到验证。H3在指令遵循、文字与品牌信息呈现、V2V Motion Transfer(视频到视频动作迁移)等方面表现出色,可精准、可控地实现多模态内容编辑与生成,广泛适用于广告、品牌、电商、产品设计、UI/UX、游戏等商业场景。在Artificial Analysis视频模型榜单中,H3的视频编辑能力排名全球第一。

价格和开源是H3最值得关注的两个变量。2K分辨率视频生成定价0.8元/秒,仅为同类旗舰模型的三分之一;768P分辨率下不到主流模型的一半。成本优势来自系统级优化——高压缩Tokenizer减少视频生成所需Token数量,异构训练、负载均衡及GPU利用效率等方面的系统优化在提升效果的同时控制成本。MiniMax宣布将在未来几天内开源H3模型权重,这是国产视频生成大模型首次面向社区开放权重。H3在设计初期就考虑了多款国产芯片的兼容性,开源后企业可在本地灵活部署,芯片厂商和开发者也能共同参与适配和优化。业内分析认为,H3的发布与开源或将改变闭源模型长期主导视频生成领域的格局。