7月31日,字节跳动正式发布新一代视频生成模型 Seedance 2.5。相比年初的 2.0 版本,这次升级最直观的变化是单次生成时长从 15 秒翻倍到了 30 秒。但真正值得关注的不是数字翻倍,而是 AI 视频终于从“能生成片段”进化到了“能讲完一段故事”。
从 15 秒到 30 秒,补齐的是一块叙事短板
此前的视频生成模型,10 秒、15 秒是主流天花板。这个时长能呈现一个画面、一个动作,但撑不起一个完整的情节。Seedance 2.5 把单段生成拉到了 30 秒,并且不是简单延长时间,而是在 30 秒内排布多个有逻辑关联的镜头,让故事按照“铺垫—推进—转折—收尾”的结构完整展开。
官方展示的示例很能说明问题:一段歌手一镜到底登台演出的片段,镜头从红色幕布缝隙推进到后台化妆间,女歌手整理耳机、工作人员提醒登台,她穿过后台通道与舞伴互动、接过麦克风,最终登上舞台——镜头拉远,体育馆全景、观众、灯牌、荧光棒尽收眼底。这不是一个画面的延续,而是一个完整的叙事链条。
多轮延长能力同样关键。模型可以在已有视频基础上继续生成 30 秒,并保持人物、场景、画面风格乃至声音的一致性。官方示例中,小男孩抱足球跑出地铁车厢、男主追赶并最终抓住他的连续动作一气呵成,没有跳脱感。这意味着用户可以通过多次延长,产出数分钟视听风格统一的连贯视频。
多模态参考:30 张图、10 段视频一起“投喂”
生成时长只是 Seedance 2.5 的一个维度。多模态参考能力的升级同样值得注意。模型支持用户单次输入最多 30 张图片、10 段视频、10 段音频作为参考素材。上一代 2.0 版本的上限是 12 个素材,2.5 版本把这个数字拉到了 50 个。
模型可以综合理解不同素材中的构图、场景、风格、人物、道具等元素,并按指令用于视频生成。在多人同框的群像叙事场景中,它能同时还原多个人物形象与声音,并保持主体特征稳定。官方展示的 30 秒音乐会片段,参考素材覆盖了场景图、钢琴家、大提琴、小提琴、主唱、管弦乐队、合唱团和观众席——十几个参考对象同时出现在一段生成视频里,人物形象和声音没有混淆。
编辑能力方面,Seedance 2.5 支持精准的时间戳控制,可定向编辑特定时段的内容。绿幕编辑、视角编辑、参考编辑等专业功能也得到强化。同时原生支持 10 余种语言,适配多语言、多版本的工业化生产需求。
从“创意工具”到“产业生产力”
Seedance 2.5 已经上线豆包、即梦、扣子、小云雀等字节旗下产品,API 服务也将于近期通过火山引擎面向企业用户开放。
发布当日,徐工集团、小鹏汽车、智元机器人、灵初智能、微分智飞、穹彻智能等多家企业已确认合作。徐工集团将其应用于工业操作培训与工序 SOP 视频生成,大幅降低传统实拍与 3D 动画的制作成本。小鹏汽车将 Seedance 能力集成至内部 AI 设计平台,辅助产品设计环节的可视化创作。穹彻智能则借助视频生成扩充具身智能大模型的训练数据,无需依赖实体机器人逐一采集。
香港科技大学副教授王帅评价称,视频生成模型正在经历关键转变——从“生成内容”走向“理解世界”,从“辅助创意”走向“提升生产力”。随着模型对物理规律理解能力的增强,它有望成为具身智能、机器人仿真、自动驾驶、工业设计验证等领域的重要基础能力。
当然,Seedance 2.5 并非没有短板。官方坦诚指出,在复杂运动的物理合理性、极多主体交互场景的稳定性上,模型仍有提升空间。但 30 秒单段原生生成、多模态参考与精准编辑能力的组合,已经让 AI 视频从“特效玩具”朝着真正的创作工具迈出了一大步。



