具身智能这场仗,过去基本是巨头和实验室的专属游戏——模型太大、门槛太高,普通开发者连真实机器人都摸不着。

7月19日,面壁智能(OpenBMB)在WAIC 2026现场正式把这扇门踹开了。它开源了首个具身AI模型系列MiniCPM-Robot,把1.5B参数的视觉-语言-动作模型完整放出,让个人开发者也能在真实机器人上跑操作与目标跟踪。这种开放程度在具身领域相当罕见。

一、两个模型,一套框架

面壁这次端出来的是一套逐渐成形的具身智能组合。

MiniCPM-RobotManip:一个1.5B参数的通用视觉-语言-动作(VLA)模型,专门负责机器人操作。基于面壁智能最新多模态端侧模型MiniCPM-V 4.6训练完成,延续了小尺寸、高性能与视觉Token极致压缩的技术优势。目前可完成做三明治等长程复杂任务。

MiniCPM-RobotTrack:一个面向现实世界目标跟踪的紧凑型模型,由面壁智能和南京大学合作研发。仅用0.9B参数规模,是业内首个支持真实本地断网部署的跟踪模型。原生适配宇树Go2 Edu,仅依靠原装摄像头和本地算力即可完成单目标、动态多目标及模糊目标跟踪,稳定达到5+Hz,端到端响应时延约180毫秒。

两者之外,面壁还一并发布了高性能推理框架PhyAI,专为具身模型构建。三者合力,把高效、实用且开放的具身智能,从论文和演示一步步推向现实世界的机器人。

二、真正把差距拉开的,是“记忆”

很多VLA模型在执行动作时,主要根据当前这一帧画面做判断。让机器人点击画面里的第二个按钮5次——如果它看不到前面的画面,也记不住自己已经按过几次,就很容易按一下便停,或者一直按下去。

为什么不给机器人加上“上下文历史记忆”?答案是,算力根本扛不住。如果要让模型记住历史画面,计算量会呈指数级爆炸。

面壁的解法是“视觉Token的极致压缩”。MiniCPM-RobotManip会把历史观测和此前执行过的动作一起纳入判断。它知道任务已经进行到哪一步,也知道什么时候应该停下来。

在专门考察上下文记忆的RMBench中,美国知名VLA模型π0.5的成绩约为10分,接近随机水平,而MiniCPM-RobotManip则达到53.5分。在LIBERO等传统主流榜单上,MiniCPM-RobotManip同样跻身第一梯队,性能比肩行业顶尖。

除了记得住,机器人还得反应快。面壁给出的单帧推理对比中,在H100显卡、bf16精度下,MiniCPM-RobotManip单次决策延迟约为120毫秒,π0.5约为234毫秒,前者接近后者的一半。

三、断网也能跑,这才是真“端侧”

MiniCPM-RobotTrack的真正杀手锏,是断网也能跑。

在真机测试中,一只宇树机器狗收到“跟随前面的人”这条指令后,开始一路跟在目标身后。从室外走进办公楼,再进入电梯、地下停车场,机器狗始终没有跟丢。就算周围不断有人经过,环境和光线也在变化,它还是能认准一开始指定的那个人。

更关键的是,这套能力直接跑在机器狗本地。电梯和地下停车场往往是网络信号比较差的地方。即使进入弱网甚至无网环境,机器狗依然能继续识别目标、规划动作,保持跟随。

在三项任务的追踪率(TR)上,该模型分别达到89.8、73.4和80.4,均取得开源方案中最优结果。

四、开发者伸手就能拿到

对开发者而言,最实在的是伸手就能拿到。

模型权重与代码已托管在GitHub仓库github.com/OpenBMB/MiniCPM-Robot,MiniCPM-RobotManip与MiniCPM-RobotTrack各自的权重也分别在Hugging Face开放下载。

做机器人的人,现在可以clone下来直接跑。截至2026年6月30日,面壁旗下的MiniCPM开源模型家族累计下载量已经冲到3800万次。

面壁智能CEO李大海在WAIC现场直言:“2026年是端侧AI规模化落地的元年,我们的策略是——做普惠的基座,技术把底座做深,产业把场景做实,生态把朋友圈做大。”