RSS26|中山大学等闭环多智能体框架让多机器人协同操作无惧现实干扰

机智流 2026-08-19 23:00

RSS26|中山大学等闭环多智能体框架让多机器人协同操作无惧现实干扰图1

RSS26|中山大学等闭环多智能体框架让多机器人协同操作无惧现实干扰图2

在工业流水线分拣、家庭服务置物、智慧仓储搬运等场景里,多机器人系统一直被视作提升作业效率的核心方案,但长期以来,多机器人的协同操作始终面临落地难题:要么单机器人操作鲁棒性足够却缺乏跨空间协作的协调机制,要么多机规划只停留在理想的任务分配层面,一遇到抓取打滑、物体移位、工作空间不足这类现实干扰就容易出现连锁错误,最终导致整个任务失败。

近期来自中山大学、帝国理工学院、清华大学深圳国际研究生院的联合团队提出了一套基于大语言模型的闭环多智能体框架,为解决上述问题提供了新的可行路径。

RSS26|中山大学等闭环多智能体框架让多机器人协同操作无惧现实干扰图3

论文标题:A Closed-Loop Multi-Agent Framework for Robust Multi-Robot Manipulation

论文链接:https://arxiv.org/pdf/2607.06990

研究背景

多机器人系统凭借并行执行能力和冗余配置,天然适合完成长周期的复杂任务,而大语言模型的语义理解和逻辑推理能力,也为将抽象任务目标拆解为可执行计划提供了技术支撑。但如何把高层的语义推理落地到真实的多机器人物理执行,仍然是行业尚未完全解决的问题。

现有的大语言模型驱动的机器人方案主要分为两类,一类聚焦单机器人操作,能够实现鲁棒的接触式操作,但缺乏多机器人协同所需的任务分配、时空协调机制,无法支撑跨多个工作空间的任务需求。另一类面向多机器人系统的方案则大多只关注高层的任务规划,往往把操作过程视作理想的原子动作,没有考虑真实世界里抓取失败、接触状态变化、外部干扰、工作空间不可达等执行层面的不确定性,最终规划和执行脱节,难以落地。

为了让多机器人系统在真实场景下具备鲁棒性和自我修正能力,该团队提出了基于智能体工作流的闭环框架,核心思路是把传统的静态执行流水线升级为迭代的智能体交互流程,内置分层的错误恢复机制。不同于过往方案只在执行前做一次验证、之后依赖理想动作执行的设计,这套智能体工作流能够让系统主动推理、执行、反思执行效果,通过整合语义规划、物理落地、结果验证三个环节,让机器人可以感知环境反馈,自适应地从错误中恢复,最终实现可靠的多机器人操作。

框架核心设计

RSS26|中山大学等闭环多智能体框架让多机器人协同操作无惧现实干扰图4
图1:闭环多智能体多机器人操作框架整体示意图,系统由三类专属智能体驱动:规划智能体将指令分解为具备依赖感知的子任务,操作智能体通过自适应工具调用将子任务落地为物理操作,验证智能体识别执行错误以触发分层重规划

整套框架由三个专属智能体构成,形成“推理-执行-反思”的闭环循环,既可以优化高层的协作决策,也可以修正底层的执行细节,适配异构机器人的能力差异和真实环境的动态变化。

规划智能体 是整个框架的语义推理核心,负责解读用户指令,生成高层的任务图,在抽象语义目标和机器人具体能力之间搭建桥梁。它首先会做依赖感知的任务分解,根据自然语言指令和粗粒度的场景描述,把全局目标拆解为有向无环图结构的逻辑子任务,识别哪些子任务必须串行执行、哪些可以并行处理,输出附带并行标记的子任务调度方案,让异构机器人可以并行执行操作,提升整体效率。之后它会做基于能力的任务分配和交互式优化,把子任务匹配给能力最适配的机器人,比如把需要跨空间移动的任务分配给带移动底盘的机器人,把高精度操作任务分配给固定的高精度机械臂。如果遇到指令模糊或者场景信息不足的情况,比如用户只给出“整理桌面”的模糊指令,或者需要操作的物体信息不明确,规划智能体还会向对应的操作智能体发送感知请求,获取更细粒度的观测信息,再基于更新的语义上下文优化任务图。

操作智能体 是框架的具身执行者,收到规划智能体下发的逻辑子任务后,需要把语义指令转化为可以直接控制机器人的动作原语。它没有采用固定的执行流水线,而是采用自适应工具调用的灵活机制,动态调用视觉语言模型分解、视觉提示工具等各类专用模块,针对具体的物理场景拆解子操作、感知目标、获取动作参数。为了适配操作后可能出现的环境变化,比如打开抽屉后的场景变化,操作智能体还会在子操作之间重新感知环境。

具体执行中,操作智能体首先会做角色导向的操作拆解,通过视觉语言模型的推理把子任务拆分为可执行的细粒度动作,区分主动和被动操作对象,识别物体的语义部件描述(比如“把手”“表面”),同时评估对象属性判断是否需要双臂操作,保障后续的工具调用可以聚焦到正确的实体上。之后它会通过工具增强的视觉感知模块,调用视觉语言模型检测器获取目标的边界框,再用Segment Anything Model生成精准的像素级掩码,之后通过视觉提示工具定位最优的交互关键点,比如杯子把手的上半部分,再把2D关键点投影到3D空间,形成操作所需的空间锚点。最后操作智能体会从动作原语库中匹配对应的操作,自适应调用专用工具获取物理落地所需的参数,比如调用抓取生成模型获取最优的6自由度抓取位姿,调用旋转感知工具判断操作所需的旋转轴、方向和角度,完成动作原语的生成。

为了提升操作效率、减少子任务描述的歧义,操作智能体还配备了双层内存机制,短期内存会记录之前操作步骤的交互历史,用于拆解子任务时消解歧义,比如收到“倒水”指令时,可以通过历史记录判断是否已经完成了抓取动作,只需要执行倒水操作即可。长期内存是一个经验池,会记录已经成功执行的子任务拆解结果和对应的动作原语,下次遇到完全匹配的子任务时可以直接调用验证过的方案,减少视觉语言模型的API调用次数,加快执行速度,同时也能避免生成结果的波动,提升执行的一致性。

验证智能体 是框架的反思组件,负责保障系统的可靠性,它把线性的执行流程变成了鲁棒的闭环系统,每个操作智能体都配备对应的验证智能体,会监测执行状态,根据错误类型触发不同的恢复策略:如果是执行层面的失败,就触发局部自我修正;如果遇到可行性错误,比如目标超出机器人工作空间,就和规划智能体交互触发全局重规划。

每次子操作完成后,验证智能体会调用视觉反馈工具,对比操作前后的图像和指令要求,做离散的语义评估,输出是否成功的判断结果。如果检测到失败,验证智能体首先会诊断错误类型,如果是任务仍然可行的执行失败,比如抓取打滑、对齐偏差,就会启动局部恢复循环,参考交互历史和视觉状态生成修正序列,直接发给操作智能体执行,不需要干扰全局规划,形成快速自我修正的内循环。如果判断动作本身物理不可行,比如工作空间受限、物体缺失,验证智能体就会把包含具体错误上下文和状态的反馈提交给规划智能体,触发全局恢复循环,规划智能体会根据错误原因和机器人当前状态生成新的任务图,比如当固定基座的机械臂无法抓取工作空间外的物体时,规划智能体就会调度移动机器人去完成这个任务,避免单机器人的失败中断整个多机器人工作流。

RSS26|中山大学等闭环多智能体框架让多机器人协同操作无惧现实干扰图5
图2:闭环多智能体框架详细架构,(a)规划智能体处理语言指令和粗粒度工作空间观测,结合机器人能力生成依赖感知的任务图,为不同机器人分配子任务;(b)操作智能体调用视觉感知工具和历史上下文,将抽象子任务转化为可执行的动作原语;(c)验证智能体监测物理状态保障鲁棒性,执行分层恢复策略,通过局部修正处理执行失败,通过全局修正处理能力超限问题,保障真实环境下的稳定协作

实验验证与效果

团队在真实世界中设计了6类不同复杂度的任务验证框架效果,覆盖从单机器人操作到异构多机器人协同的场景,硬件上采用了三类异构机器人:带移动底盘的Agilex Cobot Magic双机械臂、Agilex Piper单臂桌面机器人、高精度ABB-YuMi双臂桌面机器人。其中桌面双臂任务包含积木堆叠、桌面整理、物品收纳三类,多机器人协同任务包含篮子上架、协同倒水、食物准备三类。

RSS26|中山大学等闭环多智能体框架让多机器人协同操作无惧现实干扰图6
图3:6类真实世界实验的执行过程,框架在(1-3)双臂操作任务和(4-6)多机器人协同场景下均完成验证,证明其在不同复杂度、不同机器人配置下的通用性

在桌面任务的对比实验中,团队选择了三类主流方案作为基线:基于学习的端到端策略OpenVLA-OFT和π₀,以及基于大语言模型优化关系关键点约束的无学习方法ReKep。实验结果显示,这套框架在三类任务上的表现都显著优于所有基线,积木堆叠任务的成功率达到14/20,平均完成度85%,桌面整理任务成功率11/20,平均完成度76%,物品收纳任务成功率14/20,平均完成度78%。学习类基线在接触密集的任务中表现偏差,微小的末端执行器位姿误差就容易导致和积木、抽屉的碰撞,长周期任务中出现执行错误后也无法识别修正,会继续执行后续轨迹导致最终失败。无学习方法ReKep在物品收纳任务中完全失败,因为其无法定义操作抽屉时的末端关键点,积木堆叠任务中优化器也经常返回次优解,无法严格规避碰撞。

RSS26|中山大学等闭环多智能体框架让多机器人协同操作无惧现实干扰图7

为了验证框架对真实环境不确定性的鲁棒性,团队还设计了三类不同层级的干扰,在桌面和多机任务执行过程中随机触发:操作层面人工移走或者移位目标物体,模拟环境变化或者交互失败;子任务层面在子任务完成后重置环境状态,测试系统执行多步恢复序列的能力;全局层面在多机任务中把目标放在固定基座机器人的工作空间外,测试系统调用其他机器人协作的能力。实验结果显示,学习类基线在干扰下的平均成功率仅为7%和20%,因为缺乏闭环反馈机制,环境变化后仍然继续执行原有轨迹,无法应对需要多步推理的复杂干扰。而这套框架的平均成功率仍然达到63%,相比无干扰条件下只有小幅下降,验证了闭环验证模块的必要性。

进一步的验证智能体分析显示,验证智能体的错误识别率在所有任务中都达到90%-100%,能够有效区分成功结果和不同类型的错误,重规划成功率稳定在100%,只有在出现积木坍塌这类不可逆状态时才会最终失败,物品收纳这类可逆状态的任务最终成功率可以达到80%。多机任务的全局恢复能力验证中,系统可以100%识别出工作空间超限的错误,触发全局重规划调度其他机器人完成任务。

团队还通过消融实验验证了各个模块的贡献,替换掉专用的关键点感知工具后,系统性能出现灾难性下降,证明精准的关键点选择是连接高层规划和真实环境的核心基础,不是可有可无的辅助步骤。移除验证智能体后,桌面整理、食物准备这类长周期任务的成功率下降明显,因为单个操作的错误会不断累积,最终导致整个任务失败,证明每次执行后做错误检测和恢复的闭环机制是复杂多机器人任务成功的必要条件。移除短期内存后,序列操作任务的成功率下降,因为缺少历史交互记录会导致子任务指令出现歧义,比如“放置”指令无法判断是否需要先执行抓取动作。移除长期内存后系统性能只有轻微下降,说明框架本身不依赖记忆,经验池主要起到提升效率、减少视觉语言模型调用波动的作用。

RSS26|中山大学等闭环多智能体框架让多机器人协同操作无惧现实干扰图8
图4:模块消融的失败贡献分析,可视化移除特定组件对任务失败的影响,x/y表示消融模块直接导致的失败数x占该任务总失败数y的比例

系统错误分析显示,目前的主要瓶颈是关键点选择模块,视觉语言模型有时无法定位到完全符合语义约束的关键点,导致推理结果和真实环境不匹配,其次是动作原语生成失败,偶尔会出现找不到运动学解或者视觉语言模型推理关键点关系错误的情况,验证智能体错误、抓取失败等其他原因占比很低,还有少量不可恢复的失败来自机械臂碰撞、深度相机噪声、导航漂移等物理约束。

RSS26|中山大学等闭环多智能体框架让多机器人协同操作无惧现实干扰图9
图5:系统部署的错误分布,分析全模型实验中所有48个失败案例的成因,其中关键点选择是主要的瓶颈模块

总结与展望

这套闭环多智能体框架通过三类专属智能体的协同,打通了高层语义推理和底层物理执行的壁垒,实验结果证明其具备高通用性,可以执行从高精度抓取放置到关节物体交互的各类技能,具备强鲁棒性,通过分层恢复机制可以在干扰下维持多机器人工作流的连续运行,同时具备良好的适配性,可以无缝从桌面单机器人场景扩展到跨工作空间的异构多机器人协同场景。

目前这套框架仍然存在一定的局限性,比如依赖预定义的动作原语库,限制了其处理更复杂操作任务的能力,同时当前工作流只有依赖检查机制,缺乏动态调度机制优化全局效率,异构机器人的执行速度差异也可能导致资源闲置。团队表示,未来会探索集成基于学习的原语发现方法,同时研究并发任务分配方案,减少机器人的闲置时间,进一步提升多机器人协作的效率。


> 本文由 Intern-S2 等 AI 生成,机智流编辑部校对


-- 完 --


加入机智流 Pro,1 天一块钱,AI 能力指数级增长时代,不掉队。机智流 AI 团队将燃烧远超人类的智能的 AI Tokens 驱动 AI Agents 军团带来「与你有关」「对你有用」的高质量资讯/研报。


机智流推荐阅读

1. 

2. 

3. 

4. 

关注机智流并加入 AI 技术交流群,不仅能和来自大厂名校的 AI 开发者、爱好者一起进行技术交流,同时还有等。
在「机智流」公众号后台回复下方标红内容即可加入对应群聊:
  • cc | 大模型技术交流群
  • hf | HuggingFace 高赞论文分享群
  • lc|LangChain 技术交流群
  • code | AI Coding 交流群
  • 具身 | 具身智能交流群
  • 硬件 | AI 硬件交流群
  • 推理 | AI 推理框架交流群
  • 智能体 | Agent 技术交流群

关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。
机器人
more
不拍大片、不表演,这家公司把行业级四足机器人的实用性做到极致
WRC洞察:当深耕8年的机器人力控技术开始走向C端
宇树主导的四足机器人市场,它悄悄拿到了6%
机器人顶刊 IJRR 2026 重磅开源|Gaussian-LIC2:实时激光-惯性-视觉 3DGS-SLAM,地图反哺里程计抗退化,兼顾外观与几何精度!
机器人搬行李!瑞为WRC亮绝活,以后安检不用费劲搬箱子了?
2026年中国人形机器人市场有望达150亿元
迟来十六年,《机器人总动员》首登内地大银幕,口碑依旧封神
Physical Token经济学:下一项能力更便宜,机器人才能真正规模化
这款“四川造”的“超强大脑”,让机器人摆脱“遥控”自主干活
大晓机器人亮相WRC!拣货、巡检样样在行,会干的活儿比我还多
Copyright © 2025-成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号