国产最大端侧模型独角兽官宣进军具身智能,一口气发布并开源两款具身模型

Xbot具身知识库 2026-07-19 14:03

点击下方卡片,关注【Xbotics具身智能实验室】公众号

你想要的这里都有~~



随着机器人任务从单步操作走向更长程的任务操作,「金鱼记忆」成了被集中攻克的对象。但在“记不记得住”之外,还有一个更底层的问题——记忆的效率。

真机上,VLA 模型每次要同时处理多路相机画面。想带着历史决策,上下文就会越来越长,推理越慢,动作越卡。问题不只是机器人能不能记住,而是记住之后,还跑不跑得动。

另一个问题同样现实:当机器人进入弱网、无网或对隐私要求较高的环境,能否摆脱云端依赖,继续理解指令、自主行动?

在今年的WAIC上,面壁智能在其 7 月 19 日上午主办的「智在终端 惠及干行」分论坛上官宣发布并开源了首个具身智能技术成果 MiniCPM-Robot,包括 1.5B 的通用 VLA 模型 MiniCPM-RobotManip 和 0.9B 的跟踪导航模型 MiniCPM-RobotTrack,分别回答了这两个问题。

MiniCPM-RobotManip 基于面壁智能最新多模态端侧大模型 MiniCPM-V 4.6 训练,参数量仅为1.5B,性能可与部分3—4B模型相当。独家视觉 Token 压缩,模型将流式实时推理的计算开销降低一半,并可保留长达1分钟的具身原生记忆,在连续操作中持续判断任务进度。

图注:MiniCPM-RobotManip 在真机上完成三明治制作(5倍速)


MiniCPM-RobotTrack 基于 MiniCPM4-0.5B 训练,将视觉观测、语言指令与运动控制统一起来。模型原生适配宇树 Go2 Edu,仅依靠原装摄像头与本地算力,即可在无网络环境下识别并持续追踪目标。

一款让流式上下文与实时操作同时成立,一款让机器人摆脱云端完成自主追踪。两款开源模型也延续了面壁“小而强、高效率、可本地运行”的技术取向,意味着这家长期深耕端侧与多模态的大模型公司,开始将能力从手机、汽车等智能终端延伸至机器人。



开源链接——

GitHub 链接:https://github.com/OpenBMB/MiniCPM-Robot

Hugging Face 链接:

https://huggingface.co/openbmb/MiniCPM-RobotManip

https://huggingface.co/openbmb/MiniCPM-RobotTrack


一、MiniCPM-RobotManip:推理效率与上下文记忆如何兼得?

虽然是面壁智能首次进入具身智能领域,但从官方公布的结果来看,参数量仅为 1.5B 的 MiniCPM-RobotManip,在模型性能、上下文记忆与推理效率之间取得了较好的平衡,并在真实机器人任务中展现出良好的操作能力。

首先在一众主流VLA性能榜单上直接跻身第一梯队,整体性能与 Qwen-VLA、π0.5 等模型相近。


国产最大端侧模型独角兽官宣进军具身智能,一口气发布并开源两款具身模型图1

它更突出的优势体现在上下文记忆上。在考察机器人记忆能力的 RMBench 中,MiniCPM-RobotManip 达到53分,而主流的π0.5只有10分,接近随机的水平。模型还支持长达1分钟的具身原生记忆,能够结合历史观测与动作记录判断任务进度。例如在方块测试中,模型可以先盖住不同颜色的方块,再按照红、绿、蓝的顺序将其揭开,体现出单帧反应式 VLA 所不具备的上下文能力。


图注:MiniCPM-RobotManip 具有原生记忆能力 (8倍速)

MiniCPM-RobotManip 之所以能够高效处理流式上下文,关键在于其继承了 MiniCPM-V 4.6 的独家视觉 Token 极致压缩技术。这个多模态大模型开源不到 2 个月的下载量就突破了 200w。这一能力尤其适合机器人场景。真机运行时,VLA 模型每秒需要推理数次,并同步处理两个腕部相机、一个主视角相机的三路画面。若再加入历史观测与动作记录,输入序列会随任务推进不断增长。

MiniCPM-RobotManip 采取“先压缩、后复用”的策略,通过压缩每帧画面的Token数量及序列长度,释放计算空间,从而能够以流式计算低成本复用过往观测与动作信息。这样,历史数据既能参与当前决策,又无需在每个决策步重新计算全部上下文。

根据官方数据,该方法将流式实时推理的计算成本降低了50%,显著提升了推理速度。具体到机器人上肢操作中,则意味着动作响应更快、任务耗时更短,执行过程也更加流畅。

官方测试显示,在包含60帧历史观测时,传统重新计算方式每个决策步需要125 TFLOPs,采用流式推理后仅需3.3 TFLOPs,甚至低于π0.5在不输入历史帧时的5.0 TFLOPs。在H100、BF16精度下,MiniCPM-RobotManip的单决策步推理时延为120ms,相比π0.5的234ms降低近一半。


国产最大端侧模型独角兽官宣进军具身智能,一口气发布并开源两款具身模型图2

国产最大端侧模型独角兽官宣进军具身智能,一口气发布并开源两款具身模型图3

目前,不少具身智能团队遵循“从点到面”的路线:先在特定场景中训练专用技能,再逐步扩展能力边界。面壁选择的则是从通用模型出发,将视觉理解、语言指令、状态判断和动作输出放进统一框架,再落到具体任务。

MiniCPM-RobotManip 并未针对下游评测任务分别训练独立模型,而是通过多任务统一训练,让能力能够在不同任务间迁移、组合和复用。仿真评测显示,其在多类任务上的表现已达到专用专家模型水平。

MiniCPM-RobotTrack 延续了相似思路,将传统追踪方案中相对分散的视觉观测、指令理解与控制决策统一起来,直接把文本指令映射为运动行为。

一款面向操作,一款面向追踪,两者是面壁通用模型路线在不同机器人场景中的落点:先形成视觉、语言和决策能力,再将其转化为连续操作与自主移动;端侧效率则让这套能力能够真正运行在机器人上。

二、MiniCPM-RobotTrack:纯视觉、纯本地的轻量级端到端追踪

跟着一个人走,看上去并不复杂。但对机器人来说,这段过程包含动态目标干扰、短时遮挡、多人交叉和场景切换。它不仅要看见人,还要理解自然语言指令指向谁,并在环境持续变化时始终锁定同一个目标。

MiniCPM-RobotTrack 仅有0.9B,它基于 MiniCPM4-0.5B 训练,将视觉观测、语言指令与运动控制统一起来,实现从文本指令到运动行为的端到端映射。模型原生适配宇树 Go2 Edu,支持完全本地运行,即使拔掉网卡,也能继续理解指令、自主行动。据官方介绍,这是业内首个支持真实本地、纯无网部署的 Tracking 模型。


图注:搭载 MiniCPM-RobotTrack 的机器狗可以在开放环境下零样本指令跟随,并且抗各类人物穿梭干扰,同时可以在无网/弱网环境(电梯/停车场)下流畅跟随


在未进行下游强化学习优化的情况下,MiniCPM-RobotTrack在三类真实场景评测中追踪率分别达到89.8、73.4和80.4,均取得开源方案中的最优结果。相比 OmTrackVLA,三项成绩分别提升7.0、14.6和6.5个百分点。

在相同的单视角、纯 SFT(监督微调训练)设定下,与其他闭源模型 TrackVLA++ 相比,MiniCPM-RobotTrack 在单目标跟踪和模糊目标跟踪任务上的追踪率分别提升 8.8 和 17.0 个百分点,模糊目标跟踪任务的成功率达到 58.0%。


国产最大端侧模型独角兽官宣进军具身智能,一口气发布并开源两款具身模型图4

一个0.9B轻量模型为何能够轻松应对复杂追踪?答案藏在数据训练方式里。面壁自研了一套自进化数据管线。团队在清洗异常轨迹、错误动作等低质量数据的基础上,提出业内首个面向具身追踪的 DAgger(Dataset Aggregation)策略:让模型在仿真与真机交互中暴露快速转向、短时遮挡、多人交叉等薄弱场景,再定向补充和纠偏数据,用于下一轮训练。模型在哪里容易跟丢,训练数据就重点补强哪里。

把模型真正跑上机器狗,还需要打通视觉采集、模型推理、动作生成与本体执行的完整链路。经过全链路优化,MiniCPM-RobotTrack 在 Go2 原生算力上可稳定达到 5+ Hz,端到端响应时延约180毫秒

此次开源的不只是模型权重和推理代码,还包括面向 Go2 Edu 的完整部署流程、控制接口与一键启动脚本。 因此MiniCPM-RobotTrack 不只是一个追踪模型,也是一套从训练到真机部署完整打通的开源方案。

三、PhyAI:端云一体、全栈优化具身推理框架

在模型自身的效率优化之外,MiniCPM-Robot 两款模型此次呈现出的推理速度,也有来自推理框架的支撑。其真机运行采用了面向 Physical AI 的开源推理框架 PhyAI。

这款面向 Physical AI 的开源推理框架,专为端侧极速推理与云端 RL 大规模 Rollout 场景设计。

通过简洁的 API,PhyAI 在发布首日即完成了对 MiniCPMRobot 的适配支持,并使用 CUDA Graph 进行加速,推理帧率从 10.12 Hz 提升至 33.28 Hz,同时还采取了算子融合的方法,使用triton编写了RMSNorm+SiLU gate、conv1d+SiLU+QKV split等为 MiniCPMRobot 定制的融合算子,减少中间变量的搬运次数,将其在 NVIDIA H20 上的推理帧率进一步提升至 36.77 Hz。

与模型官方仓库相比,PhyAI 在 NVIDIA GeForce RTX 5090 上运行 π0、π0.5 和 GR00T 时,分别实现了约 2.85 倍、1.82 倍和 2.28 倍加速;GR00T 在 NVIDIA Thor 和 A40 上也分别实现约 1.40 倍和 4.31 倍加速。

面对 VLA、WAM 等模型结构快速演进、架构差异显著的现状,PhyAI 将易用性与灵活性置于首位,致力于降低模型从研究原型走向高效推理的适配成本。

目前,PhyAI 已面向社区开源。

四、从端侧出发,让 AGI 走进真实世界

随着语言大模型逐渐成熟,将数字世界中的理解与推理能力延伸至物理世界,正成为行业探索 AGI 的下一步。MiniCPM-Robot 首次将 MiniCPM 系列能力延伸至机器人领域,也是面壁沿端侧智能走向 AGI 的自然选择。

过去两年半,面壁自研多模态大模型 MiniCPM-V/O 系列持续迭代,开源总下载量超过2500万,在视觉理解、语言交互和流式多模态处理等方面的积累,也为其进入具身智能埋下伏笔。

面壁联合创始人兼首席科学家刘知远曾公开判断,物理世界要实现 AGI,一定需要通过端侧智能。随着机器人进入家庭、办公室和工厂,仅依靠云端难以同时满足实时响应、可靠运行和隐私保护;将感知、决策与执行部署在本地,既能保障及时响应,也能降低隐私风险。

在模型发布之外,面壁也在加快具身能力落地。面向展厅和园区,面壁与乐聚机器人推出展厅导览 Agent 和园区巡检 Agent 解决方案:前者可在无网条件下完成离线讲解、自由问答、环境理解和路线规划,后者能识别车辆违停、路面及公共设施异常,并在本地处理敏感画面。

在工业场景中,面壁还与吉利汽车围绕 VLA 模型和机器人应用展开合作,并通过 RoboHarness 整合多模态大模型、VLA、机器人本体与导航系统,探索生产仓储中的长程任务规划与执行。面壁的具身布局已从模型榜单逐步延伸至真机部署和行业应用。

这也是面壁智能“智周万物”愿景的一次具体落地:让更强的模型以更小的体量、更低的成本运行在终端,进入持续变化的真实环境,服务于具体的人与行业。


-END-

Ask Me Anything|提问箱

对文章有疑惑,或想聊更深?欢迎把你的问题丢给我们:技术方案、实操踩坑、课程与资料、项目合作、职业发展,都可以问。

怎么问:在评论区留言,或私信公众号

我们会做什么:每周集中整理高质量问题并公开回复,重点问题邀请作者或嘉宾深度解答;典型问题会加入知识库并持续更新。

提问小提示:尽量说明「你的目标—当前做法—期望产出」,附上必要信息(硬件/软件版本、数据规模等),能更快获得有用答案。

一起把问题变成知识,推动社区进步 🚀


声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。 
开源
more
横扫多项全球第一!大晓开源ACE-Brain-0.5,机器人AI迈入统一具身新时代
腾讯混元Hy3发布并开源!接入元宝,Agent能力全免费
国产开源新突破!5万小时真机数据,撕开行业最大痛点
Kimi K3,全球开源第一!
在WAIC,十大开源社区「挤」进了一个GPU展台
20种机器人本体通吃!蚂蚁新一代VLA具身大脑刚刚开源了
不用人工标注,GUI Agent跑起「数据飞轮」:快手、浙大开源MobileForge
AnyTouch视触觉感知的一统!人大、北邮等团队解视触觉感知统一难题,模型代码数据集全开源
ECCV'26开源 | TUM革新ICP配准算法,打造3D一致性的世界重建
ICML 2026|全球首个「信息瓶颈适配器」VLA鲁棒性架构开源,星尘智能StableVLA让机器人再不怕「眼花」
Copyright © 2025 成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号