计算机视觉领域长期深陷“单打独斗”的碎片化困局——分割用一个模型,深度估计用另一个模型,姿态估计再换一套架构。Google DeepMind近日发布的新模型GenCeption,正在以“降维打击”之势打破这一僵局。

一、“生成即理解”:视频生成模型凭什么能看懂世界?

自然语言处理之所以能走向通用大模型,关键在于找到了一个统一且可规模化的训练目标:预测序列中的下一个词元。计算机视觉一直在寻找类似的“终极预训练任务”。

DeepMind团队认为,大规模文本到视频生成恰好同时满足三个条件:能够学习时间演化、三维结构和物理规律;能够与语言天然对齐;能够随着数据、参数量和算力持续扩展。为了生成一段连续、可信的视频,模型必须理解场景的空间几何、物体的运动规律乃至基础物理——这些能力恰恰是通用视觉理解的核心。

基于这一洞察,研究团队提出了GenCeption(Generation + Perception,生成即感知)。论文作者阵容堪称豪华:来自Google DeepMind、多伦多大学、伦敦大学学院、牛津大学、MIT等多所顶尖机构,其中还包括何恺明、谢赛宁等知名学者。

二、技术拆解:如何把视频生成器改造成视觉理解模型

GenCeption选择了一个出人意料的底座——阿里巴巴开源的Wan2.1文生视频模型。

传统扩散模型从随机噪声出发,经过多轮迭代去噪生成视频。但深度估计、分割和姿态估计需要的是稳定、确定的结果,而非带有随机性的样本。研究团队的核心改造思路是:将原本需要多步去噪的生成过程,简化为一次前向传播。通过将干净的视频潜在表示作为输入,并将扩散条件时间步固定为零,原本迭代式的扩散模型被重构为高效的前馈感知模型。

模型将所有视觉任务的输出统一表示为标准的三通道RGB图像——无论是深度图、表面法线图还是分割掩码。用户只需通过文本指令告诉模型“要做什么”,模型便从同一段视频中输出对应的结果。对于3D关键点预测等无法用图像表示的任务,则通过添加可训练模块来支持。

三、五大突破:小数据、大能力

突破一:训练数据仅为传统模型的零头。 GenCeption的后训练数据仅包含7500个合成视频——由800个人体模型和200组动作序列在Blender中渲染生成。而它在深度估计、3D姿态识别等任务上的表现,数据需求量仅为现有模型的七分之一至五百分之一。

突破二:多项基准测试达到SOTA或接近水平。 模型在深度估计(媲美DepthAnything 3)、表面法线预测、分割、3D姿态估计等任务中均取得优异表现。

突破三:极强的泛化能力。 尽管训练数据主要来自合成人体视频,GenCeption能够处理真实世界中的多人场景、动物以及人形机器人等未见类别。

突破四:推理速度可用。 1.3B参数版本处理81帧视频(480×832分辨率)仅需5.92秒(13.6 FPS),14B版本需10.03秒(8.0 FPS)。

突破五:统一架构处理多种任务。 一个模型、一套架构、一个损失函数,覆盖深度、法线、分割、姿态、关键点等多样任务。

四、意义与局限

GenCeption的发布释放了一个明确信号:视频生成模型正在从“内容创作者”蜕变为通用的“视觉理解大脑”。研究团队认为,这一成果支持了一个具有争议的观点——视频生成器可以作为通用世界模型的基础。

但模型并非完美。研究团队坦言,联合训练多个任务可能影响部分复杂任务的性能;推理速度虽然可用,仍有优化空间;如何让生成式模型获得更可靠的物理理解和现实反馈能力,仍是AI研究的下一道难关。

GenCeption入选了ECCV 2026(欧洲计算机视觉会议)。论文标题为《Video Generation Models are General-Purpose Vision Learners》,已在arXiv公开。