
编辑:吕鑫燚
出品:具身研习社
具身智能落地能力的衡量标尺,已经从简单的“能做”进化到“长程任务”。
这并不是某几家企业选择的展示窗口,而是全行业默契的共识。但纵观行业内的长程任务演示,有一个微妙的差别,即有多少时间花在了把事情做成上?
部分长程任务演示中,虽然成功完成了任务,但也包括了机器人每次伸手前的停顿,抓空后的重复,和重头来过的反复。在演示中这些额外的时间不影响最终任务结果,但现场却可能早已错过节拍。那些颤颤巍巍的动作和反复重来的流程,只是将任务时间拉长。
长程任务从来不是时长竞赛。更长的任务链可以体现更复杂的编排、更持久的记忆,等待和返工却不会增加有效产出。
因此,商业化要追问的,是机器人面对关联步骤与突发变化,能否既把活干完,也把时间用好。

长程任务的难处,在于前一步的结果往往就是后一步的执行条件。杯子没放稳,倒水就得等;物品没装进去,封箱便不能开始;已经摆好的东西被人拿走,确认过的进度又要重新校验。任务依赖、动作条件、执行进度和环境变化,必须放在一起管理。
今年外滩大会期间,蚂蚁灵波CEO朱兴坦言:“相对客观地说,现阶段想做一定规模的落地,环境不能太开放,任务不能太长程。任务太长,异常就多。”这份谨慎说出了现实,每多接手几个环节,机器人就多一份处理异常、维持流程的责任。
单步成功率再漂亮,也不能直接当作整项任务的成绩。假设各步骤独立、每步成功率均为99%,且出错后无法补救,十步全部成功的概率便降至约90.4%。现实存在步骤依赖和重试,这道乘法只是提醒,错误会累积,纠错不可少。
但补救本身也有成本。抓取条件没变,反复伸手往往只是重复失败;局部出了问题,整段重启又会把前面的成果一起作废。单步动作慢、步骤间停顿多,最后即便做成了,也可能难以匹配作业节拍。
因此,评价长程能力,要把完成质量与时间代价放在一起。遇到变化能否调整,失败后能否局部恢复,恢复又花了多久,都关系到任务最终能否交付。效率衡量的是整个过程产生有效结果的能力,机器重复空转,或者只是把手臂挥快一点都远远不够。

客厅、洗衣区、餐饮柜台、仓储工位,看似日常的空间,在今天正在成为不同的长程能力观察窗口,各家具身智能厂商均有解法。
千寻智能Moz1整理客厅时,桌上被临时丢来一个纸团。它调整安排,把纸团扔掉,随后继续收纳玩偶。插进来一件事,没有让原来的工作断片。

千寻强调突破的“金鱼记忆”瓶颈,在这里体现为持续保留目标、已完成步骤和待办事项。扔掉纸团之后,还记得那堆玩偶,长程记忆才有实际用处。
墨奇智能约15分钟的家务演示,则跨越桌面整理、冰箱补货、洗烘设备操作与叠衣。地点和工具接连变化,机器人需要跟住整项工作的进度。

其MoRA架构将目标、记忆与进度判断下沉到执行模型,让局部调整不必等“上层指挥”逐步交代。超出能力范围时仍请求高层介入,这种分工为连续作业减少了来回调度。
Sharpa在DQ门店制作冰淇淋,要完成取杯、接料、加配料、搅拌及倒杯展示等55个步骤。沿用门店原有设备与流程,意味着机器人得适应人类的工作条件。

纸杯不能捏瘪,操作需要触觉与力反馈;三勺奥利奥碎,每加一勺画面都很相似,模型还得记住进度。餐饮柜台把精细接触控制与执行记忆放进了同一份订单。
极智嘉的早餐演示,特意加入了多次干扰,面包机被挪动、杯子被移走,放好的面包又被拿出来。已经成立的操作条件,随时可能失效。

它呈现的重点是状态校验与异常恢复:重新定位、局部重试,或回到受影响的阶段补做。一次异常究竟只增加一次调整,还是拖累整段流程,正在成为观察重点。
各家的步骤划分与演示条件不同,呈现出不同的技术切口。真正值得去深究的是一些共性技术要素,如记忆、操作和应变怎样共同支撑完整交付。进一步的问题是,这些能力能否在业务时间预算内稳定产生有效结果。极智嘉选择仓储作为第一个落地场景,其早餐任务演示也提供了一个观察“泛化能力如何转化为作业效率”的具体样本。

“泛化与效率同时成立,才是真干活”,这二者要在同一段工作里兑现。泛化使机器人在目标和条件变化时仍能推进任务;效率要求它减少等待、无效动作与返工。能应付变化,却迟迟交不出结果,现场依然得围着机器人调节拍。
早餐并非极智嘉要交付的业务场景。但透过这段演示我们很容易提炼可迁移的能力:任务编排、精细操作、灵活应变、自主纠错。仓储里的打包、搬运、复核等多步骤作业,同样需要这些能力处理现场变化,控制时间成本。
任务编排首先要管好步骤之间的关系:这一环完成没有,下一环的条件是否满足,遇到变化是否需要改顺序。机器人不能每做完一个动作,就重新琢磨整件工作。

Gravity的MoT双脑架构对此安排了不同分工:AR Transformer理解指令与场景、编排子任务;Diffusion Transformer负责未来状态预测、子目标评估和连续动作生成。长短期记忆保留目标、阶段与近期变化,Stage/Progress输出帮助判断进度。这些设计指向的,是减少重复判断,让动作衔接更连贯。
精细操作则要少走返工的弯路。面包片进入狭窄槽口前,Gravity先调整相对位姿,对准后再插入;两片面包挨得太近,没有稳定夹取空间,它先拨动、调整,再完成抓取。前者减少插入偏差,后者先创造操作条件,避免在不好抓的位置反复伸手。

定位、抓取、插装、倾倒等操作,被组织成可组合的Robot Skill,并结合示范、工艺规范、完成标准和安全边界等专家先验。面向仓储,这意味着既要适应货物姿态,也要遵守工位要求。准备时多花一点工夫,有机会省下后面更费时的返工。
灵活应变要求机器人持续检查环境,而非沿着已经失效的计划往下做。演示中,面包架、面包机或餐盘移动后,Gravity重新定位,调整夹取与放置轨迹。杯子被遮挡时,它进入安全等待;杯子被移走,则中止倾倒。必要的暂停有助于保住成果,效率不能靠冒进换取。

支撑这些调整的Gravity 4D,将RGB、Pointmap与 Scene Flow结合,表征外观、空间结构和运动变化。世界动作模型WAM依据观测与任务上下文推演未来状态,逆动力学模型IDM据此生成动作片段,为在线重规划提供支持。系统需要及时知道,刚才作出决定时的条件,现在是否还成立。
自主纠错还要区分“动作结束”与“事情做成”。手臂完成插入,面包未必已经入槽;已经插好的面包被取走,原来的完成记录也得更新。只沿着动作清单推进,偏差会悄悄混进后续流程。
面包未能正确插入时,Gravity重新估计位置关系,局部重规划后重试,属于动作级纠错;面包插好后又被拿走,系统回溯到受影响的阶段,重新夹取和插入,属于任务级恢复。以实际结果校验进度,才能保留仍然有效的成果,避免一次局部失误拖着整段流程重来。
这些机制的商业价值,最终体现在恢复成本里。失败后总要人来接管,企业就得额外安排人盯守;能够自行修复且及时接续工作,才有机会减少人工负担。极智嘉还提出通过Evaluation Model与强化学习,将成功、失败和接管轨迹用于反馈、评估与再训练,让现场异常成为后续改进的依据。
到了仓储,交付还包括业务状态同步。货物到位,订单、库存与下一道工序也要收到正确结果。与WMS、WES、RMS等管理和调度系统协同,关系到机器人能否接入整座仓库:实物没到位却报完成,会造成错配;做完没有回传,后续人员和设备又可能白等。
因此,早餐演示展现的能力能否迁移到现场,要由完整任务完成率、作业周期、重试次数和人工接管率共同验证。成功率需要说明时间限制与恢复条件,效率也要以质量和安全为前提。最终要交付的,是在变化中持续完成工作、在异常后及时恢复的作业能力。
写在最后
具身智能接手的流程越来越长,评价标准也需要从“最终是否完成”进一步走向“以什么成本完成”。少一次试抓、少一段空等、少一次从头再来,才能把模型能力变成稳定产出。
商业化的进步,就藏在这些细节里:同样一份工作,更少依赖人工、更少打乱节拍,客户才敢继续交出下一份。长程任务真正要积累的,是这种交付的把握。


