视频生成模型不稀奇,能同时生成视频和音频的模型才是稀罕物。7月23日,德国AI初创公司黑森林实验室正式发布多模态基础模型Flux3,一次性输出最长20秒的音视频同步片段。这是首个支持原生音频生成的多模态模型。

一、统一架构:把“看得见”和“听得见”捏进同一套底座

Flux3基于Self-Flow(自监督流匹配)学习框架扩展而来,在FLUX.1和FLUX.2系列基础上,同步训练视频、图像和音频。模型配备了专用的图像、视频、音频及动作编解码器,把对物理世界与数字环境的统一理解与生成揽到了一起。

黑森林实验室CEO Robin Rombach对此有一段精确的表述:“图像传达结构,图像和视频教会空间关系,视频教会动态,动作揭示因果关系。但视觉不是全部。真正的智能意味着感知世界、预测变化、采取行动并从结果中学习。在一个统一架构中联合训练,才能抵达那里——因为每种训练模态都会强化其他模态。音频传达视觉无法捕捉的时序、韵律和物理事件,语言传达像素难以表达的目标、抽象和指令。”

“声音必须匹配撞击,运动必须遵循质量,未来必须从过去中演化而来”——模态之间不再彼此孤立,而是关于同一个底层现实的证据。Flux3正是基于这一原则构建的第一款模型。

二、核心能力:20秒音视频同步,覆盖九大生成场景

Flux3 Video目前以Early Access方式上线,单次生成即可输出最长20秒的720p视频并附带原生同步音频。官方列出的核心能力包括:

  • 文生视频:从纯文本提示生成带声音的视频
  • 图生视频:从起始帧延续(“动画化”)或作为视觉参考
  • 视频生视频:从参考片段出发,将源视频的核心元素(如同一个人物)带入新场景
  • 视频与音频续写:基于输入的视频和音频继续生成
  • 关键帧转视频:在定义的时间节点之间进行受控转场
  • 多语言对话:支持多语种语音生成
  • 多镜头串联:通过智能体链式调用将单个片段组合成更长的多镜头序列
  • 广泛风格与宽高比:从纪实风格到动画、电影质感均可覆盖
  • 强文字生成与动态设计

一句话概括:输入一张图、一段视频或一段文字,Flux3就能输出一段“能看又能听”的完整片段。

三、实测表现:把主流对手按在榜单上

在早期头对头偏好测试中(10秒、720p文生视频片段,带音频),Flux3的表现相当能打:

对比模型

胜率

Luma Ray 3.2

93%

Runway Gen-4.5

77%

Grok Imagine Video

69%

Seedance 2.0

52%

Gemini Omni Flash

52%

面对Seedance 2.0和Gemini Omni Flash这类顶尖模型,Flux3仍守住了微弱上风。

四、从屏幕走进现实:Flux-mimic已在奥迪工厂跑测试

Flux3不止停留在内容生成层面。黑森林实验室联合Mimic Robotics开发了面向机器人领域的视频-动作模型Flux-mimic,利用Flux3的视频骨干网络预测机器人动作。

据官方介绍,视频预测消耗了Flux3训练总计算量的95%以上。要生成逼真的视频,模型别无选择——必须学会接触、运动、重量、因果关系,任何一个搞错了都会显得不自然。而动作与音频、视频帧一样,都是同一个底层物理现实的局部表征。

目前Flux-mimic已在奥迪工厂的生产线上跑起了测试。从生成视频到控制机器人,Flux3正在把多模态能力从屏幕里搬到产线上。

五、发布节奏与开源承诺

Flux3采用分阶段发布策略:

  • Flux3 Video:已上线Early Access,用户可申请
  • Flux3 Image:未来几周内推出
  • Flux3 Action:已同步进入Early Access
  • Flux3 Dev:开源权重版本,计划今年晚些时候放出

黑森林实验室尚未公布定价和生产级服务水平承诺。早期评测数据也标注为“初步结果”,完整基准和方法论将在更广泛公测时发布。

Flux3是首个原生生成音频的多模态模型。它把文本、图像、视频、音频和动作预测塞进了同一个架构。当视频生成模型开始“听得见”声音、并且把这种能力延伸到机器人控制时,AI对物理世界的理解正在从一个理论问题变成生产线上的现实。

20秒的音画同步只是一个开始。Flux3更大的想象空间,在于它正在尝试理解这个世界的运行方式。