8月3日,xAI为视频生成模型Grok Imagine Video 1.5推出重大升级,新增图像参考、语音参考、纯文本生成视频以及原生1080p输出能力。从“图生视频”到“文生视频+图生视频+声生视频”,AI视频生成正在从单一模态走向多模态可控创作。
文本转视频:无需参考图,一句话生成视频
此前Grok Imagine Video 1.5本质上是一款图生视频工具——用户必须提供一张参考帧并描述期望的运动。此次升级后,用户只需通过文字描述场景,即可直接生成视频,无需初始图像。具体实现路径是:模型先从文本提示词中合成一个起始帧,再通过图生视频引擎将其动画化。这一功能已在Grok Imagine网页版、iOS和Android端全面上线。
原生1080p:从720p到1080p,画质质变
1080p升级是此次更新中技术意义最大的部分。Grok Imagine Video 1.5基于Aurora自回归架构——逐帧顺序生成,每一帧都依赖所有先前帧。从720p扩展到1080p,每一帧需要承载的像素Token数增加了约2.25倍。xAI没有公开具体的架构优化方案,但定价已经给出了清晰的信号:
480p视频:$0.08/秒
720p视频:$0.14/秒
1080p视频:$0.25/秒
从720p到1080p约1.8倍的溢价,恰好反映了自回归架构处理高分辨率时真实算力成本的陡增。
图像与语音参考:锁定角色身份和声音
此次升级中,图像与语音参考功能被视为最具专业价值的新增能力。
图像参考支持单次生成最多七个视觉参考元素,用于分别固定人物面部、产品特征或环境元素。在多重参考模式下,创作者可以保留角色身份并替换背景、保持场景不变更换角色,或仅调整动作而维持整体视觉设定。
语音参考功能进一步解决了AI视频制作中长期存在的角色连续性问题——同一角色在多个片段中保持稳定的面部特征和声音表现。开发者可通过API传入提示词、参考图像URL、视频时长、宽高比和分辨率等参数完成视频生成,语音参考功能需通过请求方式单独接入。
目前,文本转视频和1080p生成功能已全平台开放;图像与语音参考功能率先向美国地区SuperGrok Heavy和SuperGrok Plus用户开放,并计划后续覆盖更多用户。
竞争格局:从“能生成”到“能控制”
Grok Imagine Video 1.5自今年5月31日发布以来,在图生视频领域一直保持领先。该模型在Image-to-Video Arena排行榜上以1473的Elo评分登顶,超过Google Veo等竞品。其同步音频生成能力、运动真实感和生成速度已成为创意工作者的常用工具。
此次升级后,xAI正在将竞争优势从“生成速度”和“画质”扩展到“可控性”和“一致性”——角色、场景、声音、动作都可以分别锁定和调整。在AI视频生成赛道竞争日益激烈的当下,xAI的战略差异化已经清晰:比Google Veo更早开放原生1080p,比OpenAI Sora更早落地多参考控制。当同行还在卷“能不能生成视频”时,xAI已经把战场推进到了“能不能按你的方式生成视频”。



