近日,MiniMax 正式推出新一代通用全模态生成模型 H3,标志着其从专项任务模型向通用多模态智能方案完成关键迭代。该模型打破图像、音频、视频任务相互割裂的行业现状,可统一理解多模态上下文信息,连贯完成内容生成与编辑工作,同时落地 15 秒 2K 原生音视频生成能力,推理成本显著低于市面上主流同类模型。
不同于分开处理图文、音频、视频的传统方案,H3 作为原生通用全模态模型,兼容文本、图片、音频、视频多种输入素材。使用者能够混合多类参考素材下达指令,模型统一解析画面风格、人物动作、镜头语言、音频旋律等信息,一次性输出自带双声道音频的完整 2K 视频内容,最长生成时长可达 15 秒。
在画面方案上,H3 没有采用行业常见的后置超分方式提升分辨率,依托基础模型在上下文内自主重构高清画面,能够还原更多细节信息,减少普通超分带来的画面失真、物体畸变问题。实测场景下,模型在指令跟随、品牌文字渲染、视频动作迁移(V2V)等维度表现稳定,满足商用内容生产基础要求,适配电商短视频、品牌宣传物料、游戏素材、产品演示、UI 动态素材等多元场景。
成本控制是本次 H3 一大核心亮点。2K 分辨率视频生成单价仅为业内主流旗舰视频模型三分之一。成本优化来源于底层技术调整,项目组采用高压缩 Tokenizer 方案,大幅降低视频生成所需 Token 消耗量;同时针对多模态推理负载差异,优化异构训练调度、硬件负载均衡,提升 GPU 资源利用率,在保障生成质量的前提下压缩推理开销,降低中小创作者与企业批量制作 AI 视频的门槛。
第三方评测榜单显示,MiniMax H3 视频编辑能力位居全球前列。对比市面上很多只能完成单一文生视频、图生视频的模型,H3 支持一体化多模态创作与交互式修改。用户生成初稿后,可通过自然语言持续调整画面动作、镜头、音效,在修改过程中维持人物形象、整体风格统一,减少重复生成素材的工作量。
官方同步披露,MiniMax H3 计划近期开放权重,面向开发者提供更多自主部署选择。长期来看,高昂的调用成本一直限制 AI 视频规模化商用,很多企业难以高频批量产出 AI 短视频。H3 的落地,进一步拉低高清音视频生成的使用成本,推动 AI 视频从试验性创作转向常态化生产力工具。
行业视角来看,当前多模态模型赛道正在分化,一部分厂商持续深耕单一视频生成任务,另一部分厂商推进通用全模态路线。通用模型的优势在于一套模型承接理解、素材参考、视频生成、后期微调多项需求,降低企业对接多个 AI 接口的运维成本。后续 H3 的开源进度、实际落地稳定性,以及持续迭代后的画面连贯性、人物一致性表现,将成为市场重点观察方向。
随着全模态技术持续成熟,低成本高清 AI 音视频方案,有望进一步渗透本地商家短视频、直播素材、数字人配套视频等场景,重塑内容制作链路。
