近日,阿里巴巴集团旗下高德正式宣布,其自研的通用交互式世界模型ABot-World-0完成新一轮技术升级,在单张消费级GPU上实现连续24小时超长时稳定推理。画质、物理一致性与交互响应在长达一天的推理过程中均无明显衰减,刷新了交互式世界模型的时长极限,这也是全球首个将推理时长从“分钟级”提升至“天级”的世界模型。
从1分钟到24小时:突破长期困扰行业的“误差累积”难题
过去,业界主流世界模型的单次连续生成时长普遍停留在30秒至1分钟量级。一旦推理时间拉长,模型便会出现画面崩坏、物体形变漂移、物理规则失真、交互指令响应错位等典型问题。这一现象背后是自回归式视频生成中的误差累积问题:画面对上一帧的依赖,使微小的预测偏差在长序列中被指数级放大。如何让世界模型“跑得久、跑得稳、跑得住”,成为整个行业必须跨过的一道门槛。
ABot-World-0的突破,正是跨过了这道门槛。
LongForcing长程训练范式:让模型在训练阶段就直面超长时序推演
高德自研的全新LongForcing长程训练范式,是这次技术升级的核心。该范式将“长时间尺度上的稳定性”与“场景与动态的开放性”统一纳入模型学习目标,让模型在训练阶段就直面超长时序推演。
LongForcing的核心,并不是让模型机械地“记住”更早的画面,而是引入具备更长时域建模能力的教师模型,将训练目标从短片段内的局部生成质量,拓展到多轮自回归之后的长程生成分布。在训练中,LongForcing可持续用模型自身的生成结果作为后续输入,同时约束其停留在合理、稳定的世界分布之内,由此缓解误差累积与分布漂移,使画面质量、场景结构和动态演化在超长时间推理中保持稳定。
正因如此,LongForcing可以在无需调整Prompt的情况下,持续拓展场景与动态。这意味着世界不会被一段固定文本限制,用户的每一次移动、交互,都可以自然地引出新的空间、新的物体与新的事件,生成内容从“被动播放的像素流”变成了“主动演化的世界状态”。
开源+消费级显卡部署:让世界模型从“实验室”走向“桌面”
ABot-World-0已经正式开源,支持在单张消费级显卡上进行本地部署。个人开发者、独立工作室和研究机构都能直接使用这项技术,无需昂贵的云端算力集群。
该成果发布后在全球社区快速发酵,ABot-World-0超长推理相关论文在Hugging Face上线后,迅速登顶平台论文“日榜”和“周榜”第一。
ABot-World-0的技术能力已融入高德此前推出的通用世界模型工坊ABot-World Studio。用户只需输入一段文字或一张图片,即可生成一个可实时交互、任意分享的AI世界,亲身体验“无限时长交互生成”的沉浸感,并将成果以视频与3DGS文件形式一键导出保存。
世界模型的“长跑”能力,打开了哪些新场景?
长时序稳定性的突破,有望进一步拓展世界模型的应用边界。在持续交互场景中,ABot-World-0能够支撑长时间、不间断的沉浸式体验,不再受限于分钟级的生成窗口。在仿真模拟领域,24小时的稳定推理意味着可以连续模拟复杂环境的变化过程,为工业仿真、城市推演等场景提供更真实、更持久的数字孪生能力。在机器人训练方面,世界模型可以为具身智能提供持续演化的训练环境,降低对昂贵真机数据采集的依赖。
当行业主流仍停留在1分钟的生成上限时,高德用24小时连续稳定推理重新划定了世界模型的性能标尺。而开源与消费级显卡部署的组合,则让这项技术真正走出了论文和实验室。世界模型的长跑时代,或许才刚刚开始。



