WRC交卷⎜机器人长程任务总断片?墨奇用Agentic-Native重构具身大脑

机器之心 2026-08-21 11:18
WRC交卷⎜机器人长程任务总断片?墨奇用Agentic-Native重构具身大脑图1
编辑|杜伟

2026 年的世界机器人大会,最难的演示可能一点都不炫。


这几天,北京亦庄一下子挤进 300 多家机器人企业。


翻跟头、跳舞、打拳 ……,这些都算不上新鲜事了。相反,让一台机器人犯难的,可能是人类每天随手就能完成的一些小事,比如收拾房间。


在成立仅半年多的通用具身智能机器人公司墨奇智能(MORPHI)的展台上,其首次公开亮相的轮式机器人 MORPHI KINO,面对的就是这样一场长约 15 分钟的家务实战:


它要穿过多个区域,将茶几上的物品收纳到指定的盘子里:


WRC交卷⎜机器人长程任务总断片?墨奇用Agentic-Native重构具身大脑图2


WRC交卷⎜机器人长程任务总断片?墨奇用Agentic-Native重构具身大脑图3


移动到冰箱前,发现缺货后打开冰箱门,将一瓶矿泉水放进去,再关上冰箱门:


WRC交卷⎜机器人长程任务总断片?墨奇用Agentic-Native重构具身大脑图4

WRC交卷⎜机器人长程任务总断片?墨奇用Agentic-Native重构具身大脑图5

WRC交卷⎜机器人长程任务总断片?墨奇用Agentic-Native重构具身大脑图6


随后进入洗衣区域,将湿衣物取出,放入烘干机处理,再将已经烘好的衣物折叠好:


WRC交卷⎜机器人长程任务总断片?墨奇用Agentic-Native重构具身大脑图7

WRC交卷⎜机器人长程任务总断片?墨奇用Agentic-Native重构具身大脑图8

WRC交卷⎜机器人长程任务总断片?墨奇用Agentic-Native重构具身大脑图9


单独拆开来看,抓取、打开冰箱、放矿泉水、开关洗烘设备、叠衣服,每一项都是机器人行业反复展示过的能力。真正难的地方是,这些动作现在被串进了同一个长程任务中


这就要求机器人十几分钟内始终记得自己的任务目标,清楚哪些事情完成了、哪些还没有。另外,它还要应对位置变化、执行偏差和环境干扰,在出现意外之后继续干活。


这也让「任务连续性」成为今年世界机器人大会上一个值得关注的技术信号。


一边是继续卷抓取、折叠、开门等单一动作,另一边是把机器人放进一个足够长、足够复杂的任务中,看它是否有能力一路执行到底。墨奇智能选择了后者


机器人碰到长任务,

为什么容易接不上?


当前较为常见的一类具身 Agent 采用「一个想,一个干」的分层双系统架构。


高层认知模型通常由语言模型或视觉语言模型承担,负责理解需求、拆分任务、调度技能、判断并处理异常情况,这一层被称为 System 2;底层具身策略模型结合视觉和机器人本体状态,把高层给出的任务指令变成连续的动作,即 System 1。


这套分工解决了很多问题,让机器人有能力处理复杂的多步骤任务。但一旦拉长执行时间,短板开始暴露。


以上文展示的「收拾房间」为例,高层模型可以很快规划出一条完整的流程:清垃圾、整理桌面、检查冰箱、补货、处理衣物 …… 但负责执行动作的底层模型知道自己这一刻该做什么(比如走到桌边抓起水瓶),却未必清楚为什么要做这些动作、整个房间收拾到哪一步了,后边还有哪些事等着做。


此外,一旦环境发生变化或者某一步执行出现偏差,底层模型也无法准确判断任务如何继续,这时需要高层模型重新确认状态、调整规划并把新的子任务交代下来。任务周期越长,这种来回调度就越容易打断整个执行过程。


对于一个要连续干十几分钟甚至更久的机器人,如果每遇到一点变化都要等「大脑」重新规划,任务很难连贯起来。


墨奇智能的解法,是让负责执行的具身策略模型更多地承担「自己把任务持续做下去」的能力。围绕这一思路,该公司提出了 Agentic-Native 技术路线,并推出 MoRA 具身模型架构(以下简称 MoRA)


让执行模型,自己把任务接下去


Agentic-Native 的关键在于:重新调整了具身 Agent 架构中 System 1 和 System 2 之间的能力分工


过去主要由 System 2 负责的目标维护、任务记忆和进度追踪,被进一步下沉到直接控制机器人行动的 System 1 中,使得它们在持续输出动作的同时也能一直记住目标、保留上下文、判断当前任务进度。同时在超出能力范畴时,主动请求高层模型介入。


MoRA,承载的正是这套 Agentic-Native 思路


它的全称为「MORPHI Reasoning & Autonomy」,名字本身就点出了它的两个核心方向:Reasoning 负责对环境、任务和行为的推理、规划和预测,Autonomy 负责让机器人基于感知和推理结果做出决策并执行。


WRC交卷⎜机器人长程任务总断片?墨奇用Agentic-Native重构具身大脑图10


把两者放在一起看,MoRA 要让机器人在行动过程中理解任务、判断当前状态,并据此自主决定接下来做什么,直至目标完成。要实现这样的长程执行,模型至少要具备以下三项核心能力。


始终盯着最终目标


第一个下沉的是对任务目标的持续维护。传统动作执行更容易围绕局部子任务展开,比如上文展示的拿起矿泉水、移动到冰箱前以及把矿泉水放进去。这些指令单独看都很明确,但它们只是整个冰箱补货任务中的局部动作。


在 MoRA 的设计中,System 1 直接接收由文本、图像共同定义的结构化任务目标,并在连续执行过程中以这个 Goal 作为条件。这就是 Goal-Conditioned Execution


由此带来的变化很直接,机器人不会因为「拿起矿泉水」这个当前动作完成,就将整项任务判定为结束,它始终记得最终的目标。


干活全程不断片


目标明确之后,第二个问题紧接着出现:怎么避免机器人「干着干着就忘了」?这对应了下沉的第二项能力 —— 保留执行记忆


从时间尺度来看,长程任务中的「记忆」并不只有一种。尤其当任务持续数分钟甚至十几分钟时,机器人要一一清楚总任务是什么、当前做到哪一步了、哪些工作还没有完成。


MoRA 在 System 1 内部引入长、中、短三种不同粒度的执行记忆(Multi-Granularity Memory),其中长期记忆保留整项任务的目标与进度、中期记忆维护步骤级执行状态、短期记忆负责控制层面的连续性。


更关键的是,这些任务上下文被纳入模型表征本身,而非仅交给外部状态机维护。这就像人收拾房间一样,不会每做完一步就重新查看任务清单,长程工作的机器人也需要类似的连续记忆。


对任务进度了如指掌


目标告诉机器人最终要做什么,记忆保存一路执行下来的上下文。最后还缺一个关键环节:它得知道自己现在做到哪了,距离目标还差什么。


第三项下沉的能力是任务进度判断,它对应了 MoRA 的 Progress-Aware Closed Loop


传统动作模型最核心的职责是输出动作,但在 MoRA 的设计中,System 1 有能力同时维护任务状态和当前进度。MoRA 内部形成了一个持续运行的「动作 →状态→进度→调整」闭环,中间出现偏差时及时调整,并根据任务状态判断当前目标是否完成。


三项能力结合起来,抬高了传统 System 1 的能力上限,让基于 Agentic-Native 的 MoRA 能够更好地支撑长程任务。


长程任务,重估数据价值


MoRA 在架构层面重新回答了「能力怎么组织」的问题,接下来还要回答这些能力「靠什么学出来」


对于长程任务,机器人面对的环境变化更多,任务跨度也更长,训练数据是否来自真实场景,以及是否包含完整的执行过程,都会直接影响模型最终能学到的能力。


当前行业很喜欢「百万小时」具身数据这样的叙事,但小时数够大并不等于质量高。一段只记录「标准成功动作的数据」与一段包含「环境变化、执行偏差、纠错乃至完成过程的任务轨迹」,模型从中学到的信息并不一样。


长程任务需要学习任务执行过程中的连续因果关系和状态变化,为此墨奇智能构建了一套「Human-to-Robot Embodiment Transfer」的数据与训练方法。


拆分来看,它以人类第一视角真实作业数据作为重要来源,再通过统一具身动作空间对齐人类行为和机器人动作,把其中相对独立于具体本体的任务知识迁移到机器人。


相比高度标准化的采集环境,真实作业数据包含更多实际场景中的物体状态、操作过程和环境变化,也更接近未来机器人要面对的任务分布。


为了获取真实世界数据,墨奇智能自研了 MORPHI Sense Kit 数据采集系统,将采集设备带进酒店、商务公寓等真实商业场所,由一线作业人员直接产生作业数据。


并且采集回来的数据经过质检、场景重建和挖掘标注,再进入模型训练与评测;机器人在真机运行中产生的新数据又持续回流,进入下一轮训练和优化,由此形成了一套持续迭代的数据飞轮。


目前,墨奇智能已经积累约 3 万小时真实场景数据,并计划在今年年底提升至 15 万 —20 万小时


更强大脑之外,

还得有一副能干活的身体


再强的具身模型,也要通过机器人本体作用于真实世界。WRC 现场执行任务的 MORPHI KINO,正是墨奇智能为 MoRA 配上的本体


作为一款面向家庭服务场景的轮式机器人,它没有强调某一项参数,更看重移动、躯干、双臂、视觉与触觉能力之间的协同


这种协同在家庭服务场景中尤为重要。收拾一个房间,机器人需要同时调动移动、操作、感知等多种能力:在茶几、冰箱、洗衣机之间穿行,根据不同操作高度调整姿态,识别物体位置和接触状态,完成开门、抓取、搬运、放置等动作。


MORPHI KINO 采用四舵轮全向底盘,可以原地转向,底盘尺寸也能通过标准客房门和电梯。双臂各有 7 个自由度,单臂额定负载 5kg。鱼眼相机、深度相机、激光雷达和指尖触觉传感器共同负责环境与接触状态感知。


另外,长程任务对机器人本体还有一个很实际的要求:不能干到一半就没电了。MORPHI KINO 配备了两块 540Wh 电池,支持热插拔,实际可用续航不低于 4 小时。同时支持 WiFi 6 和 5G 双链路连接,方便状态回传和 OTA 更新。


在现场,我们还看到了 MORPHI KINO 的更多 Demo,比如观众选中盲盒之后,它会识别并抓取对应盲盒,装袋后递给观众:


WRC交卷⎜机器人长程任务总断片?墨奇用Agentic-Native重构具身大脑图11


放置物品后,它同样识别、抓取,并放入指定收纳区:


WRC交卷⎜机器人长程任务总断片?墨奇用Agentic-Native重构具身大脑图12


写在最后


回过头看,墨奇智能这次围绕 Agentic-Native 和 MoRA 做的探索,触碰到了具身模型的一个基础问题:智能应该放在哪一层。


当负责实际执行的 System 1 更能把控任务目标、记忆和进度,机器人可以在行动过程中持续推进任务;System 2 则主要负责任务意图理解、全局规划和异常情况处理。


执行时间越长,越能凸显这种分工的价值。很多局部变化直接在执行层处理,任务也更容易推进下去。


另外,当机器人从「完成一个动作」扩展到「承担一项连续的工作」,具身智能的 Scaling 除了看模型大小、数据规模与场景覆盖,可能还需要多看一个维度:任务时长。对一个准备干「长」活的机器人来说,能够把能力维持多久,未来会越来越重要。


© THE END

转载请联系本公众号获得授权

投稿或寻求报道:liyazhou@jiqizhixin.com

关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。
IC 机器人
more
ChatGPT发布后超三成网页现AI痕迹,互联网正陷入“机器人互读”怪圈
机器人如何进入落地时代?瑞为在WRC给出答案
机器人走下舞台,京东上场
WRC上最不该被忽视的展商,是给机器人「找教材」的厘清智能
宇树市值蒸发超1600亿:人形机器人IPO,是泡沫吗?
2026年中国人形机器人市场规模有望达150亿元
全球首个人形机器人自主乒乓球完整对局亮相2026世界机器人大会,超维动力KAI全栈具身智能硬核登场
2026世界机器人大会开幕:宇树回顾十年历程,黄仁勋之女现身考察
深圳一上市公司宣布,终止机器人谐波减速器技术开发合同,转让股权!
Physical Token经济学:下一项能力更便宜,机器人才能真正规模化
Copyright © 2025-成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号