2026年7月19日,WAIC“智启具身论坛”现场,一张圆桌把当前具身智能领域最有话语权的六个人聚在了一起。

智元合伙人姚卯青、Physical Intelligence研究科学家任至意、Sunday Robotics CEO赵子豪、佐治亚理工学院助理教授徐丹飞、Dyna Robotics联合创始人马也骋、腾讯Robotics X实验室主任张正友——全行业最懂“怎么采数据、怎么用数据”的人,坐到了同一张桌子上。

差了一万倍,不是修辞,是实数

圆桌刚开场,姚卯青就甩出了一个数字:语言模型用100万亿Token训出了ChatGPT,而今天具身智能可用的真实交互数据,比这个规模差了一万倍以上。

这不是夸张。具身数据规模与语言模型预训练语料确实存在万倍以上的差距。要实现对通用物理规律、开放式指令理解与任务规划能力的隐式掌握,至少需要亿小时级别的数据积累。而目前全行业能拿出来的真实交互数据,远远不够。有数据显示,机器人操控在仿真环境中成功率可达89.4%,但进入真实家庭场景后骤降至12%。

一条数据鸿沟,六种填法

面对同一道题,六个人给出了六套解法。

赵子豪(Sunday Robotics) 押注短期最高效的方案——UMI(无本体采集数据) 。他认为,短期内没有环境鸿沟的UMI是提升智能最高效的方式,让机器人先“见过世面”比纠结本体更重要。Sunday刚发布了新一代模型ACT-2,在未知家庭环境中叠衣服成功率达到了99.1%。其核心突破在于针对内部“操作记忆片段”进行快速训练迭代。赵子豪认为,长期最值钱的还是部署端的数据,短期多样化部署最有用。

徐丹飞(佐治亚理工) 把视角拉得更长。他借用计算机视觉ImageNet的发展史指出,当前具身数据极度缺乏类似分类树状结构的科学规范。没有标准,数据就是散的,堆再多也白搭。

马也骋(Dyna Robotics) 的表述最为体系化。他把数据提炼为一座“金字塔” ——顶层是最金贵的部署闭环数据,底层是海量仿真与互联网视频。不同层级的数据解决不同问题,不能拿底层的廉价数据去要求顶层的效果。

张正友(腾讯) 更看重真实交互与失败数据。他强调具身智能本质是与物理世界交互,闭环后的真实反馈才是核心。失败数据比成功数据更有价值——因为它告诉模型“这条路走不通”。

任至意(Physical Intelligence) 的视角偏向模型端。他认为现阶段应依托低维护成本的基础硬件,将精力全盘倾注于基座模型的能力涌现。PI做出了目前行业公认最顶尖的具身模型之一。他的逻辑是:模型先到位,数据自然会被更高效地利用。

姚卯青(智元) 的立场最为务实。作为觅蜂科技董事长兼CEO,他认为智元只有自己下场摸清最严苛的量产与测试标准,才能打破制约模型的硬件底层瓶颈。智元和觅蜂已经开源了行业首个百万真机数据集AGIBOT WORLD,目前累计下载超120万次。觅蜂计划2026年实现千万小时级数据产能,2030年达到百亿小时级。

共识比分歧更重要

尽管路径不同,但圆桌上有一个清晰的共识:数据是具身智能的唯一瓶颈,没有之一。

围绕这个共识,行业正在分头突围。智元打通了“数据-模型-本体-场景”四轮驱动的具身智能飞轮体系;Sunday通过“数据飞轮”破解高质量数据获取的瓶颈;跨维智能开源了全球首个贯通人类到仿真到真机的时空动作对齐大规模数据集;BrainCo发布了灵巧操作数采矩阵。

缺口有多大,机会就有多大

姚卯青在采访中透露,实际客户接触下来,“普遍都是你有多少我就买多少,你什么时候有我马上要的状态,非常供不应求”。这是一条完全卖方的赛道。

数据采集技术也在快速进化。2025年之前,多数公司依赖“10%-20%真机数据+80%-90%仿真合成数据”;到了2026年,人类数据的浓度和认可度明显提升。UMI数据采集工厂正在成为行业标配,全球超过三分之二的团队正在使用相关方案。

这场圆桌没有给出标准答案。6位嘉宾有共同的目标,却有不同的技术路径。但在对话的结尾,这群最靠近技术前沿的操盘手们在机器人AGI时刻何时降临上,给出了几乎一致的判断:2到5年内。

差的一万倍数据怎么补?六个人给了六套方案。但所有人都同意一件事:谁先填上这条数据鸿沟,谁就能先拿到通往具身智能“ChatGPT时刻”的门票。