点击下方卡片,关注【Xbotics具身智能实验室】公众号
你想要的这里都有~~
随着机器人任务从单步操作走向更长程的任务操作,「金鱼记忆」成了被集中攻克的对象。但在“记不记得住”之外,还有一个更底层的问题——记忆的效率。
真机上,VLA 模型每次要同时处理多路相机画面。想带着历史决策,上下文就会越来越长,推理越慢,动作越卡。问题不只是机器人能不能记住,而是记住之后,还跑不跑得动。
另一个问题同样现实:当机器人进入弱网、无网或对隐私要求较高的环境,能否摆脱云端依赖,继续理解指令、自主行动?
在今年的WAIC上,面壁智能在其 7 月 19 日上午主办的「智在终端 惠及干行」分论坛上官宣发布并开源了首个具身智能技术成果 MiniCPM-Robot,包括 1.5B 的通用 VLA 模型 MiniCPM-RobotManip 和 0.9B 的跟踪导航模型 MiniCPM-RobotTrack,分别回答了这两个问题。
MiniCPM-RobotManip 基于面壁智能最新多模态端侧大模型 MiniCPM-V 4.6 训练,参数量仅为1.5B,性能可与部分3—4B模型相当。独家视觉 Token 压缩,模型将流式实时推理的计算开销降低一半,并可保留长达1分钟的具身原生记忆,在连续操作中持续判断任务进度。
MiniCPM-RobotTrack 基于 MiniCPM4-0.5B 训练,将视觉观测、语言指令与运动控制统一起来。模型原生适配宇树 Go2 Edu,仅依靠原装摄像头与本地算力,即可在无网络环境下识别并持续追踪目标。
一款让流式上下文与实时操作同时成立,一款让机器人摆脱云端完成自主追踪。两款开源模型也延续了面壁“小而强、高效率、可本地运行”的技术取向,意味着这家长期深耕端侧与多模态的大模型公司,开始将能力从手机、汽车等智能终端延伸至机器人。
开源链接——
GitHub 链接:https://github.com/OpenBMB/MiniCPM-Robot
Hugging Face 链接:
https://huggingface.co/openbmb/MiniCPM-RobotManip
https://huggingface.co/openbmb/MiniCPM-RobotTrack
一、MiniCPM-RobotManip:推理效率与上下文记忆如何兼得?
虽然是面壁智能首次进入具身智能领域,但从官方公布的结果来看,参数量仅为 1.5B 的 MiniCPM-RobotManip,在模型性能、上下文记忆与推理效率之间取得了较好的平衡,并在真实机器人任务中展现出良好的操作能力。
首先在一众主流VLA性能榜单上直接跻身第一梯队,整体性能与 Qwen-VLA、π0.5 等模型相近。

它更突出的优势体现在上下文记忆上。在考察机器人记忆能力的 RMBench 中,MiniCPM-RobotManip 达到53分,而主流的π0.5只有10分,接近随机的水平。模型还支持长达1分钟的具身原生记忆,能够结合历史观测与动作记录判断任务进度。例如在方块测试中,模型可以先盖住不同颜色的方块,再按照红、绿、蓝的顺序将其揭开,体现出单帧反应式 VLA 所不具备的上下文能力。
MiniCPM-RobotManip 之所以能够高效处理流式上下文,关键在于其继承了 MiniCPM-V 4.6 的独家视觉 Token 极致压缩技术。这个多模态大模型开源不到 2 个月的下载量就突破了 200w。这一能力尤其适合机器人场景。真机运行时,VLA 模型每秒需要推理数次,并同步处理两个腕部相机、一个主视角相机的三路画面。若再加入历史观测与动作记录,输入序列会随任务推进不断增长。
MiniCPM-RobotManip 采取“先压缩、后复用”的策略,通过压缩每帧画面的Token数量及序列长度,释放计算空间,从而能够以流式计算低成本复用过往观测与动作信息。这样,历史数据既能参与当前决策,又无需在每个决策步重新计算全部上下文。
根据官方数据,该方法将流式实时推理的计算成本降低了50%,显著提升了推理速度。具体到机器人上肢操作中,则意味着动作响应更快、任务耗时更短,执行过程也更加流畅。
官方测试显示,在包含60帧历史观测时,传统重新计算方式每个决策步需要125 TFLOPs,采用流式推理后仅需3.3 TFLOPs,甚至低于π0.5在不输入历史帧时的5.0 TFLOPs。在H100、BF16精度下,MiniCPM-RobotManip的单决策步推理时延为120ms,相比π0.5的234ms降低近一半。


目前,不少具身智能团队遵循“从点到面”的路线:先在特定场景中训练专用技能,再逐步扩展能力边界。面壁选择的则是从通用模型出发,将视觉理解、语言指令、状态判断和动作输出放进统一框架,再落到具体任务。
MiniCPM-RobotManip 并未针对下游评测任务分别训练独立模型,而是通过多任务统一训练,让能力能够在不同任务间迁移、组合和复用。仿真评测显示,其在多类任务上的表现已达到专用专家模型水平。
MiniCPM-RobotTrack 延续了相似思路,将传统追踪方案中相对分散的视觉观测、指令理解与控制决策统一起来,直接把文本指令映射为运动行为。
一款面向操作,一款面向追踪,两者是面壁通用模型路线在不同机器人场景中的落点:先形成视觉、语言和决策能力,再将其转化为连续操作与自主移动;端侧效率则让这套能力能够真正运行在机器人上。
二、MiniCPM-RobotTrack:纯视觉、纯本地的轻量级端到端追踪
跟着一个人走,看上去并不复杂。但对机器人来说,这段过程包含动态目标干扰、短时遮挡、多人交叉和场景切换。它不仅要看见人,还要理解自然语言指令指向谁,并在环境持续变化时始终锁定同一个目标。
MiniCPM-RobotTrack 仅有0.9B,它基于 MiniCPM4-0.5B 训练,将视觉观测、语言指令与运动控制统一起来,实现从文本指令到运动行为的端到端映射。模型原生适配宇树 Go2 Edu,支持完全本地运行,即使拔掉网卡,也能继续理解指令、自主行动。据官方介绍,这是业内首个支持真实本地、纯无网部署的 Tracking 模型。
图注:搭载 MiniCPM-RobotTrack 的机器狗可以在开放环境下零样本指令跟随,并且抗各类人物穿梭干扰,同时可以在无网/弱网环境(电梯/停车场)下流畅跟随
在未进行下游强化学习优化的情况下,MiniCPM-RobotTrack在三类真实场景评测中追踪率分别达到89.8、73.4和80.4,均取得开源方案中的最优结果。相比 OmTrackVLA,三项成绩分别提升7.0、14.6和6.5个百分点。
在相同的单视角、纯 SFT(监督微调训练)设定下,与其他闭源模型 TrackVLA++ 相比,MiniCPM-RobotTrack 在单目标跟踪和模糊目标跟踪任务上的追踪率分别提升 8.8 和 17.0 个百分点,模糊目标跟踪任务的成功率达到 58.0%。

一个0.9B轻量模型为何能够轻松应对复杂追踪?答案藏在数据训练方式里。面壁自研了一套自进化数据管线。团队在清洗异常轨迹、错误动作等低质量数据的基础上,提出业内首个面向具身追踪的 DAgger(Dataset Aggregation)策略:让模型在仿真与真机交互中暴露快速转向、短时遮挡、多人交叉等薄弱场景,再定向补充和纠偏数据,用于下一轮训练。模型在哪里容易跟丢,训练数据就重点补强哪里。
把模型真正跑上机器狗,还需要打通视觉采集、模型推理、动作生成与本体执行的完整链路。经过全链路优化,MiniCPM-RobotTrack 在 Go2 原生算力上可稳定达到 5+ Hz,端到端响应时延约180毫秒。
此次开源的不只是模型权重和推理代码,还包括面向 Go2 Edu 的完整部署流程、控制接口与一键启动脚本。 因此MiniCPM-RobotTrack 不只是一个追踪模型,也是一套从训练到真机部署完整打通的开源方案。
三、PhyAI:端云一体、全栈优化具身推理框架
在模型自身的效率优化之外,MiniCPM-Robot 两款模型此次呈现出的推理速度,也有来自推理框架的支撑。其真机运行采用了面向 Physical AI 的开源推理框架 PhyAI。
这款面向 Physical AI 的开源推理框架,专为端侧极速推理与云端 RL 大规模 Rollout 场景设计。
通过简洁的 API,PhyAI 在发布首日即完成了对 MiniCPMRobot 的适配支持,并使用 CUDA Graph 进行加速,推理帧率从 10.12 Hz 提升至 33.28 Hz,同时还采取了算子融合的方法,使用triton编写了RMSNorm+SiLU gate、conv1d+SiLU+QKV split等为 MiniCPMRobot 定制的融合算子,减少中间变量的搬运次数,将其在 NVIDIA H20 上的推理帧率进一步提升至 36.77 Hz。
与模型官方仓库相比,PhyAI 在 NVIDIA GeForce RTX 5090 上运行 π0、π0.5 和 GR00T 时,分别实现了约 2.85 倍、1.82 倍和 2.28 倍加速;GR00T 在 NVIDIA Thor 和 A40 上也分别实现约 1.40 倍和 4.31 倍加速。
面对 VLA、WAM 等模型结构快速演进、架构差异显著的现状,PhyAI 将易用性与灵活性置于首位,致力于降低模型从研究原型走向高效推理的适配成本。
目前,PhyAI 已面向社区开源。
四、从端侧出发,让 AGI 走进真实世界
随着语言大模型逐渐成熟,将数字世界中的理解与推理能力延伸至物理世界,正成为行业探索 AGI 的下一步。MiniCPM-Robot 首次将 MiniCPM 系列能力延伸至机器人领域,也是面壁沿端侧智能走向 AGI 的自然选择。
过去两年半,面壁自研多模态大模型 MiniCPM-V/O 系列持续迭代,开源总下载量超过2500万,在视觉理解、语言交互和流式多模态处理等方面的积累,也为其进入具身智能埋下伏笔。
面壁联合创始人兼首席科学家刘知远曾公开判断,物理世界要实现 AGI,一定需要通过端侧智能。随着机器人进入家庭、办公室和工厂,仅依靠云端难以同时满足实时响应、可靠运行和隐私保护;将感知、决策与执行部署在本地,既能保障及时响应,也能降低隐私风险。
在模型发布之外,面壁也在加快具身能力落地。面向展厅和园区,面壁与乐聚机器人推出展厅导览 Agent 和园区巡检 Agent 解决方案:前者可在无网条件下完成离线讲解、自由问答、环境理解和路线规划,后者能识别车辆违停、路面及公共设施异常,并在本地处理敏感画面。
在工业场景中,面壁还与吉利汽车围绕 VLA 模型和机器人应用展开合作,并通过 RoboHarness 整合多模态大模型、VLA、机器人本体与导航系统,探索生产仓储中的长程任务规划与执行。面壁的具身布局已从模型榜单逐步延伸至真机部署和行业应用。
这也是面壁智能“智周万物”愿景的一次具体落地:让更强的模型以更小的体量、更低的成本运行在终端,进入持续变化的真实环境,服务于具体的人与行业。
-END-
Ask Me Anything|提问箱
❝对文章有疑惑,或想聊更深?欢迎把你的问题丢给我们:技术方案、实操踩坑、课程与资料、项目合作、职业发展,都可以问。
怎么问:在评论区留言,或私信公众号
我们会做什么:每周集中整理高质量问题并公开回复,重点问题邀请作者或嘉宾深度解答;典型问题会加入知识库并持续更新。
提问小提示:尽量说明「你的目标—当前做法—期望产出」,附上必要信息(硬件/软件版本、数据规模等),能更快获得有用答案。
一起把问题变成知识,推动社区进步 🚀