德国AI初创公司黑森林实验室(Black Forest Labs)正式发布多模态基础模型Flux3。这是该公司首次从静态图像生成迈入动态视频领域。最核心的突破在于:Flux3是首个支持原生音频生成的多模态模型,单次生成即可输出最长20秒且音画同步的720p视频。
一、统一架构:一个模型同时学图像、视频和音频
Flux3并非在通用接口后面拼接独立的图像、视频和音频模型,而是从一开始就采用统一的架构同时学习三种模态。黑森林实验室认为,单一模态无法提供对世界的完整描述——图像捕捉特定时刻的空间结构,视频恢复时间维度与物理规律,音频则揭示视觉无法直接探测的因果关系。三种模态互相约束、互相印证,才能让模型真正理解世界如何运作。
在训练层面,Flux3基于黑森林实验室于2026年3月发布的Self-Flow(自监督流匹配) 学习框架,在FLUX.1和FLUX.2系列的基础上,将能力从图像生成扩展至多模态生成与理解。公司大幅扩展了算力与数据资源,同步训练视频、图像和音频。视频预测占据了总训练计算成本的95%以上——要生成逼真的视频,模型别无选择,必须学会接触、运动、重量和因果关系。音频则相对简单,在720p视频中占比不足0.5%的token。
二、能力矩阵:从文生视频到多语言对话
Flux3 Video现已开放早期体验。其核心能力包括:文本生成视频、图像生成视频(从起始帧延续或作为视觉参考)、视频参考生成(将源视频的核心元素带入新场景)、输入视频与音频的生成式续写、关键帧转视频、多语言对话,以及通过智能体链式拼接生成更长的多镜头序列。输出覆盖从实拍风格到动画、电影级等多种视觉风格。
图像能力同步提升。Flux3在图像合成与编辑方面也有显著进步,覆盖多种风格、宽高比和分辨率。公司对Flux 3的定位已超越单纯的内容生成工具。
三、评测表现:人眼更偏好Flux3
在带声音的10秒、720p文生视频人工偏好测试中,Flux3的表现如下:
对比模型 | Flux3胜率 |
Luma Ray 3.2 | 93% |
Runway Gen-4.5 | 77% |
Grok Imagine Video | 69% |
Seedance 2.0 | 52% |
Gemini Omni Flash | 52% |
在早期测试中,人类评审员在77%的一对一比较中更偏好Flux3而非Runway Gen-4.5,在93%的比较中优于Luma Ray 3.2。面对Seedance 2.0与Gemini Omni Flash等顶尖模型,Flux3仍守住了微弱上风。
四、从屏幕走进现实:Flux-mimic与奥迪工厂
Flux3的多模态能力不止停留在数字世界。黑森林实验室联合瑞士机器人公司mimic robotics,基于Flux3的视频骨干网络开发了视频动作模型Flux-mimic——将模型对物理世界的理解转化为实际的机器人动作。
Flux-mimic已在奥迪工厂的生产线上开展测试,用于执行复杂的软体操作任务,例如为柔性门封条进行安装。这类工作传统自动化方案一直难以处理。奥迪方面表示,这些机器人现在能够解决“传统机器人根本无法完成的复杂软体操作任务”。整个系统的反应时间约为101毫秒,接近人类视觉反射的水平。
Flux-mimic的训练效率同样惊人——机器人学习新任务仅需约30分钟。
五、分阶段发布:视频先行,图像与开源随后
Flux3采取分阶段推出策略:
- Flux 3 Video:已开放早期体验(需申请审批)
- Flux 3 Image:将在未来几周内推出
- Flux 3 Dev:计划开源权重版本,覆盖视频、音频、图像生成与动作预测
目前Flux3尚未提供可下载的权重文件或开源许可。黑森林实验室承诺速度更快且开放权重的版本将于今年晚些时候推出。
从图像生成到音视频同步生成,再到机器人动作预测——Flux3用一套统一架构走完了同行需要三套模型才能走完的路。当模型同时学会看、听和行动,它就不再只是内容创作工具,而是开始逼近“世界模型”的本质定义。


