7月23日,德国AI实验室黑森林实验室(Black Forest Labs)正式发布多模态基础模型FLUX 3,采用Early Access方式上线推出。这是黑森林实验室首次推出视频生成模型。FLUX 3采用统一架构联合学习图像、视频和音频,能够单次生成最长20秒且带有原生同步音频的720p视频。

原生音频同步:音画一次成型

FLUX 3是首个支持原生音频生成的多模态模型。此前的视频生成模型大多只能单独生成画面,音频需要后期另行合成。FLUX 3在生成视频画面的同时,同步输出对话、音效和环境音,音画天然对齐。能力覆盖文生视频、图生视频、视频生视频、输入视频与音频续写、关键帧转视频、多语言对话以及多镜头串联等多种创作模式。

这种“听得见”和“看得见”捏在同一套底座里的设计,意味着模型不再只是图像或视频的单科选手。黑森林实验室联合创始人兼CEO Robin Rombach表示:“一个只学习图像的模型只能生成图像。”公司的判断是,学习预测视频也意味着学习底层的物理规律——重量、接触、时序——而这正是机器在物理世界中移动所需的能力。

性能评测:胜率全面领先

在早期人工对比评测中,FLUX 3表现出了明显的竞争力。在带声音的10秒、720p视频生成任务中,FLUX 3对比Grok Imagine Video的胜率达到69%,对比Seedance 2.0和Gemini Omni Flash的胜率均为52%。

与更多主流模型的对比同样亮眼:FLUX 3在用户对比中胜过了Runway Gen-4.5达77%的场次,胜过Luma Ray 3.2达93%。此外还击败了Kling v3 Pro(60%胜率)以及Happy Horse等模型。

需要指出的是,这些评测属于偏好测试——评测者观看两段视频片段后选择更令人信服的那一个。黑森林实验室表示,完整的基准测试结果和方法论将在后续更广泛的公开可用阶段发布。

从屏幕走进产线:进军机器人领域

FLUX 3的布局不止于内容生成。黑森林实验室联合苏黎世的Mimic Robotics开发了面向机器人领域的动作模型FLUX-mimic。它利用FLUX 3的视频预测骨干网络,加上一个轻量级“解码器”,将模型对物体运动方式的内部理解转化为实际的机器人动作。

汽车制造商奥迪已经在生产线上测试这套系统,用于安装柔性车门密封条等任务——这类工作传统自动化设备一直难以处理。奥迪方面表示,机器人现在能够“解决复杂的软体操控工作”,这是旧机器无法触及的领域。整个系统的响应时间约为101毫秒,接近人类视觉反射的速度。

这意味着FLUX 3的多模态能力正在从屏幕里的生成工具,走向真实产线上的物理操作。

分阶段发布:视频先行,图像与开源随后

发布节奏上,黑森林实验室采取分阶段推进策略。FLUX 3 Video已率先进入Early Access,用户可申请体验。FLUX 3 Image将在未来几周内推出。带开源权重的FLUX 3 Dev计划于2026年下半年发布。

目前FLUX 3尚未公布定价、生产级服务承诺或完整评估方法论。企业用户暂时还无法通过API或合作伙伴渠道公开访问。对于习惯了在重大模型发布时同步获得可本地部署版本(FLUX Dev)的开发者来说,这次需要等待。

黑森林实验室由曾参与构建Stable Diffusion的资深研究员于2024年8月创立。此前的FLUX系列已在图像生成领域建立了口碑,FLUX 1.1 Pro曾登顶Artificial Analysis图像竞技场。FLUX 3是该公司首次从静态图像向视频、音频和动作方向的大跨度延伸。

当一家以开源图像模型闻名的实验室,开始用统一架构同时学习图像、视频、音频和动作,并让奥迪工厂的机器人学会安装车门密封条——多模态AI的边界,正在被重新定义。