摘要:Lightricks拆分的LTX公司发布LTX-2.5开放权重视频模型,10秒720p视频生成仅需6.8秒,原生集成ComfyUI,支持4K HDR与原生多镜头。本文解析技术细节与行业影响。

8月11日,LTX发布了LTX-2.5。

一个数据就够了:10秒、720p、图生视频,跑在两块NVIDIA GB200上,生成耗时6.8秒。视频还没放完,机器已经生成完了——速度快过实时播放。

这组数字来自LTX自己的测试环境。通过API跑同样的任务,1080p分辨率下是23.7秒。自托管和API之间差了将近三倍,硬件配置决定一切。

LTX-2.5不是凭空冒出来的。它是LTX视频模型线的第五代:LTXV(2024年11月)→ LTX-2(2025年10月)→ LTX-2.3(2026年3月)→ LTX-2.5(2026年8月11日)。LTX是从Lightricks拆分出来的独立公司。前代LTX-2.3已经支持原生4K和同步音视频,2.5在此基础上几乎重写了整个生成管线。

核心变化有三个。

第一个是渲染方式。 LTX管它叫Diffusion Fidelity Rendering。以前的视频模型算力平均分配,场景复杂和场景简单用的计算一样多。LTX-2.5的做法是:先在8倍时间压缩的隐空间里生成运动、构图和镜头结构,同时生成一组高保真关键帧。复杂场景多给关键帧,简单场景少给,算力动态分配。结构搭好之后,再用专门的像素扩散阶段把细节渲染进每一帧。结果是纹理、材质、人脸这些细节能做到像素级精度——不会出现那种“远看还行、一放大就糊”的情况。

第二个是原生多镜头。 这是LTX-2.5最实用的改进之一。以前的视频模型生成多个镜头基本靠拼——单独生成几段,再手动匹配角色、场景、光影,拼出来经常穿帮。LTX-2.5一次生成就能输出多个连接式镜头,角色、环境、灯光、声音在剪辑切换之间保持一致。电影公司可以用它生成包含多个镜头的序列,不用后期一张张拼。Robotics实验室也能用它生成连续动作序列用于训练。

第三个是文本编码器。 LTX-2.5搭载了定制版的Gemma 4 12B文本编码器。长提示词、多主体、复杂动作——这些以前模型容易“丢词”的场景,Gemma 4能完整保留。再加上一个轻量级的提示词增强器,能把短提示自动扩展成详细的电影级指令。自动时长功能会根据提示词描述的动作,在扩散开始前自动预测视频该多长。

蒸馏版也做了改进。LTX-2.5的蒸馏模型在画质、提示词遵循度和运动表现上都比前代蒸馏版本强——本地跑不动完整版的人,用蒸馏版能省不少显存。经NVIDIA优化后,LTX-2.5可以在RTX GPU上本地运行。最低显存要求16GB。

LTX-2.5这次和ComfyUI达成了首发合作。ComfyUI原生内置了三个工作流:文生视频、图生视频、首尾帧插值(FLF2V)。在ComfyUI里提供两种形态:一种是开放权重自己跑,一种是通过Partner Nodes调用托管模型。托管版分两档——Fast版支持2到20秒、720p到4K;Pro版支持2到10秒、720p或1080p。

模型权重已经上架Hugging Face。商用许可分两档:年收入低于1000万美元的组织免费使用;超过1000万美元的需要协商商业授权。API价格从720p的0.09美元/秒到4K的0.37美元/秒。LTX宣称其模型家族累计下载量已超过3300万次——这个数字是LTX自己公布的,还没有第三方验证。

LTX CEO Zeev Farbman的说法很直白:“开放权重不是一次性的慈善行为,这就是我们的战略。”他认为视频和世界模型的使用场景比LLM更广,开发者需要拿到权重本身,而不只是一个窄接口API。

ComfyUI CEO Yoland Yan说得更直接:“有了LTX-2.5在ComfyUI里原生运行,开发者一个下午就能从想法走到可工作的世界模型管线,企业可以直接把同一条管线部署到自己的硬件上投入生产。”

LTX-2.5瞄准的不只是做AI短视频的人。官方明确指向三个方向:电影和动画工作室、机器人实验室、ComfyUI开源社区。电影工业需要ACES工作流和RAW输出;机器人需要物理AI和实时推理;ComfyUI社区需要节点式工作流和开放权重。

一个模型同时服务三个截然不同的群体——这在AI视频模型里不多见。

3300万次下载是历史成绩。LTX-2.5能不能接住,得看社区接下来几周跑出来的实际效果。6.8秒生成10秒视频这个数字很漂亮,但真实场景下的稳定性和一致性,才是决定它能不能从“玩具”变成“工具”的关键。