摘要:理想发布世界动作触觉模型 ME-Dex-1.0,把触觉与视频共同作为待预测的未来世界状态,联合去噪视频、触觉与动作序列;RoboTwin 成功率领先最强基线 7.6 个百分点,ManiFeel 插头插入成功率由 58% 升至 88%。

大模型的叙事主线,正在从"预测下一个词"转向"预测下一个物理状态"。理想 Foundation Model 团队今天发布了 ME-Dex-1.0,一个把触觉纳入预测目标的世界动作触觉模型。它的核心设计与主流做法有个关键区别:不是让模型"看图生视频",而是把触觉信号和视频一起当作"需要被预测的未来世界状态",然后联合去噪视频、触觉与动作序列——也就是说,模型在想象"手接下来会摸到什么感觉"的同时,反向约束自己该做出什么动作。

12-理想ME-Dex世界模型预测触摸.jpg

工程细节上,这套方案做了三件事让触觉可学习。第一,把异构的触觉硬件数据统一映射到双手 34 个区域的模板,解决不同传感器输出格式不一致的问题;第二,采用视觉、触觉、动作三专家架构,并用 H-Bridge 共享注意力在专家之间传递信息,让"看到什么"和"摸到什么"在同一个表征空间里对齐;第三,用一个自主式触觉数据引擎主动扩充仿真数据,绕开真实触觉数据稀缺的瓶颈。成绩单也给出了:RoboTwin 成功率领先最强基线 7.6 个百分点,DexJoCo 的 11 项任务里 7 项第一,ManiFeel 的电源插头插入任务成功率从 58% 提升到 88%。

为什么"触觉"值得单开一条技术路线?因为在精细操作里,视觉是远远不够的。插插头、拧瓶盖、把柔软物体塞进袋子——这些任务的关键反馈来自力与滑移,而这些信息视觉拍不到。此前主流的 VLA(视觉-语言-动作)模型只靠视觉输入,模型看不到接触发生的瞬间的力变化,于是只能靠"猜"来完成闭环,鲁棒性很差;以像素为中心的视频生成模型又停留在"画面好看",学不到物理因果。把触觉作为一等公民纳入世界模型,等于给机器人补上了缺失的那一路感官。

把 ME-Dex-1.0 放回"世界模型"这一年的竞赛里看,它的特殊之处才更清楚。Google DeepMind 的 Genie 与 NVIDIA 的 Cosmos 都在做"可交互世界模拟",但它们的输入主要仍是像素或点云;理想选择把"触觉"作为一等公民,等于押注了一个少有人占的赛道。这背后是具身智能的现实约束:机器人真正要落地的场景——工厂装配、家庭服务、仓储分拣——大量反馈来自接触力而非视觉。谁先把"触觉世界模型"跑通并能在真机迁移,谁就可能拿到比单纯视频生成更靠近落地的那张门票。

我的判断:ME-Dex-1.0 最值得记住的不是那 7.6 个百分点,而是"双手 34 区域触觉模板"这个提法——它在尝试建立一个跨硬件的触觉表征标准。世界模型这一年的竞争,本质上是在争夺"世界应该被表示成什么"的话语权:视频派说像素,3D 派说点云,JEPA 派说表征,而理想选择了"触觉 + 视频 + 动作"的三元组。谁的表征能同时支撑仿真与真机迁移,谁就拿到了具身智能的入场券。对工程师的实用启示是:如果你在做机器人学习,别再把触觉当辅助信号,它可能是当前性价比最高的一路输入。