视频生成模型不稀奇,能同时生成视频和音频的模型才是稀罕物。7月23日,德国AI初创公司黑森林实验室正式发布多模态基础模型Flux3,一次性输出最长20秒的音视频同步片段。这是首个支持原生音频生成的多模态模型。
一、统一架构:把“看得见”和“听得见”捏进同一套底座
Flux3基于Self-Flow(自监督流匹配)学习框架扩展而来,在FLUX.1和FLUX.2系列基础上,同步训练视频、图像和音频。模型配备了专用的图像、视频、音频及动作编解码器,把对物理世界与数字环境的统一理解与生成揽到了一起。
黑森林实验室CEO Robin Rombach对此有一段精确的表述:“图像传达结构,图像和视频教会空间关系,视频教会动态,动作揭示因果关系。但视觉不是全部。真正的智能意味着感知世界、预测变化、采取行动并从结果中学习。在一个统一架构中联合训练,才能抵达那里——因为每种训练模态都会强化其他模态。音频传达视觉无法捕捉的时序、韵律和物理事件,语言传达像素难以表达的目标、抽象和指令。”
“声音必须匹配撞击,运动必须遵循质量,未来必须从过去中演化而来”——模态之间不再彼此孤立,而是关于同一个底层现实的证据。Flux3正是基于这一原则构建的第一款模型。
二、核心能力:20秒音视频同步,覆盖九大生成场景
Flux3 Video目前以Early Access方式上线,单次生成即可输出最长20秒的720p视频并附带原生同步音频。官方列出的核心能力包括:
- 文生视频:从纯文本提示生成带声音的视频
- 图生视频:从起始帧延续(“动画化”)或作为视觉参考
- 视频生视频:从参考片段出发,将源视频的核心元素(如同一个人物)带入新场景
- 视频与音频续写:基于输入的视频和音频继续生成
- 关键帧转视频:在定义的时间节点之间进行受控转场
- 多语言对话:支持多语种语音生成
- 多镜头串联:通过智能体链式调用将单个片段组合成更长的多镜头序列
- 广泛风格与宽高比:从纪实风格到动画、电影质感均可覆盖
- 强文字生成与动态设计
一句话概括:输入一张图、一段视频或一段文字,Flux3就能输出一段“能看又能听”的完整片段。
三、实测表现:把主流对手按在榜单上
在早期头对头偏好测试中(10秒、720p文生视频片段,带音频),Flux3的表现相当能打:
对比模型 | 胜率 |
Luma Ray 3.2 | 93% |
Runway Gen-4.5 | 77% |
Grok Imagine Video | 69% |
Seedance 2.0 | 52% |
Gemini Omni Flash | 52% |
面对Seedance 2.0和Gemini Omni Flash这类顶尖模型,Flux3仍守住了微弱上风。
四、从屏幕走进现实:Flux-mimic已在奥迪工厂跑测试
Flux3不止停留在内容生成层面。黑森林实验室联合Mimic Robotics开发了面向机器人领域的视频-动作模型Flux-mimic,利用Flux3的视频骨干网络预测机器人动作。
据官方介绍,视频预测消耗了Flux3训练总计算量的95%以上。要生成逼真的视频,模型别无选择——必须学会接触、运动、重量、因果关系,任何一个搞错了都会显得不自然。而动作与音频、视频帧一样,都是同一个底层物理现实的局部表征。
目前Flux-mimic已在奥迪工厂的生产线上跑起了测试。从生成视频到控制机器人,Flux3正在把多模态能力从屏幕里搬到产线上。
五、发布节奏与开源承诺
Flux3采用分阶段发布策略:
- Flux3 Video:已上线Early Access,用户可申请
- Flux3 Image:未来几周内推出
- Flux3 Action:已同步进入Early Access
- Flux3 Dev:开源权重版本,计划今年晚些时候放出
黑森林实验室尚未公布定价和生产级服务水平承诺。早期评测数据也标注为“初步结果”,完整基准和方法论将在更广泛公测时发布。
Flux3是首个原生生成音频的多模态模型。它把文本、图像、视频、音频和动作预测塞进了同一个架构。当视频生成模型开始“听得见”声音、并且把这种能力延伸到机器人控制时,AI对物理世界的理解正在从一个理论问题变成生产线上的现实。
20秒的音画同步只是一个开始。Flux3更大的想象空间,在于它正在尝试理解这个世界的运行方式。

