点击下方卡片,关注【Xbotics具身智能实验室】公众号
你想要的这里都有~~
VLA、Diffusion Policy、World Model、任务规划、MPC、强化学习、模仿学习、Agent……过去几年,机器人操作领域的新模型和技术路线快速涌现,一个越来越现实的问题也随之出现:
这些方法在机器人系统里分别解决什么问题,又应该如何连接起来?
例如,VLA 应该如何理解?Diffusion Policy 和模仿学习是否属于同一层级的分类?世界模型又可能在规划、策略学习和数据生成中分别承担什么角色?
对于刚进入这一领域的研究者而言,这些概念很容易混在一起;即使已经在从事机器人操作研究,不同论文使用的分类方式和系统边界也并不完全一致。
围绕这一问题,来自西安交通大学、香港科技大学(广州)、中国科学院自动化研究所、西湖大学、浙江大学、悉尼大学、北京智源人工智能研究院、北京大学等八家机构的研究者,对机器人操作领域进行了系统梳理,并发布综述:

论文标题:Towards a Unified Understanding of Robot Manipulation: A Comprehensive Survey arxiv.2510.10903
最新 v2.0 版本在此前 v1.0 收录 1200+ 篇论文的基础上,将文献覆盖扩充至 1400+ 篇相关工作。相比单纯增加约 200 篇论文,这次更新更重要的变化来自分类体系和整体结构的重新梳理:
重新明确高层规划(High-Level Planning)、低层动作建模(Low-Level Action Modeling)和执行层控制(Actuation-Level Control)的边界与接口,完善机器人操作的整体方法框架; 数据与评测体系由原来的五类扩展为六类,新增人类视频数据集与视频世界模型基准; 操作任务新增空中操作(Aerial Manipulation)和水下操作(Underwater Manipulation),任务版图扩展到更加多样的机器人本体与工作空间; 关键挑战部分新增并强化 Agent 与人机交互协作,将讨论延伸到长期自主、系统适应和真实部署; Figure 1、Figure 2、Figure 12 以及多张数据集和评测表格同步更新,并对部分数据统计、方法描述、引用和文献元数据进行了系统校正。
v2.0 在文献规模扩展到 1400+ 篇的基础上,对机器人操作领域的分类体系、方法边界与整体知识结构进行了更系统的梳理。
论文概览
这篇综述围绕机器人操作的完整研究版图展开,主要涵盖:
机器人硬件与动作建模基础 仿真器、评测基准与数据集 不同类型的机器人操作任务 高层规划 低层学习式动作建模 关键瓶颈及其解决方法 真实世界应用与未来研究方向

除了覆盖足够广的研究范围,一个更核心的问题是:面对如此庞杂的机器人操作方法,能否建立一套统一的系统视角来理解它们?
一、从“论文集合”到“统一理解框架”
机器人操作研究既覆盖抓取、灵巧操作、移动操作、人形操作等不同任务,也包含强化学习、模仿学习、Diffusion Policy、VLA、World Model 等多种技术路线。随着基础模型快速进入机器人系统,仅按任务或模型名称分类,越来越难说明不同方法在完整系统中的具体作用,以及它们与上下游模块之间的关系。
围绕这一问题,综述以研究最充分的基础操作(Basic Manipulation)为主要语境,从系统功能和接口关系出发,将核心方法放在高层规划、低层动作建模和执行层控制三个层次中理解。高层规划根据语言、视觉等信息生成任务计划、程序、几何约束、Affordance、3D 场景表示或未来视频等结构化结果,这些结果可以转化为目标位姿或约束条件,连接运动规划、轨迹优化和 MPC 等经典方法,也可以作为输入或隐变量进入学习式动作模型。
此外,视觉、语言等多模态信息也可以直接进入学习式低层动作建模,由 VLA 等模型生成动作、轨迹或动作序列,最终再通过执行层控制转化为关节位置、速度、力矩或交互控制信号并作用于机器人。借助这一框架,任务规划、MPC、VLA、Diffusion Policy、World Model 等方法都可以根据其在机器人系统中承担的角色重新定位。

二、从硬件、数据到任务:机器人操作的全景基础
在进入高层规划和低层动作建模的方法体系之前,综述先从硬件平台、训练与评测资源以及任务类型三个角度,给出了机器人操作领域的整体版图。
从硬件到动作生成:机器人操作的基础脉络
机器人操作平台覆盖了从末端执行器到复杂移动本体的多种形态,包括平行夹爪、灵巧手、软体手、单臂/双臂机械臂、移动机器人、四足机器人以及人形机器人。
随着机器人本体复杂度不断提高,操作问题也从固定工作空间中的抓取与拾放,扩展到需要导航、平衡、全身协调以及复杂物理接触的任务。

从动作生成方式来看,可以首先区分两类基础范式:
经典非学习方法(Classical Non-Learning):包括 RRT、PRM 等采样式运动规划,以及轨迹优化、MPC 等方法; 学习式方法(Learning-Based):主要通过强化学习(RL)与模仿学习(IL),从环境交互或专家示范中学习动作策略。
经典方法依赖显式建模、搜索与优化,学习式方法则利用数据建立复杂的感知到动作映射。二者共同构成低层动作建模的基础。
仿真器、基准与数据集:机器人学习的基础设施
机器人形态和学习范式不断扩展,与之配套的数据与评测体系也在快速演进。

现有资源被整理为六类:
抓取数据集(Grasping Datasets):覆盖从 2D 抓取表示、6-DoF 抓取到灵巧抓取等不同形式; 单本体仿真器与基准(Single-Embodiment Simulators and Benchmarks):围绕特定机器人平台评测基础操作、灵巧操作、可变形物体操作、移动操作、四足和人形操作等能力; 跨本体仿真器与基准(Cross-Embodiment Simulators and Benchmarks):覆盖具有不同形态、自由度和控制接口的机器人,用于研究模型跨机器人迁移与泛化; 轨迹数据集(Trajectory Datasets):记录视觉、机器人状态、动作以及其他多模态交互序列,为强化学习、模仿学习和 VLA 等方法提供训练基础; 具身问答与 Affordance 数据集(Embodied QA and Affordance Datasets):重点评估视觉感知、空间推理以及功能与常识理解; 人类视频数据集与视频世界模型基准(Human Video Datasets and Video-World-Model Benchmarks):利用大规模人类交互视频扩展机器人学习的数据来源,并评估视频世界模型在物理一致性、长期预测以及支持机器人操作等方面的能力。

整体来看,机器人操作的数据与评测体系正在从单一任务、单一本体和纯机器人轨迹,逐渐扩展到跨本体、多模态、人类视频以及世界模型评测等更加丰富的研究设置。
操作任务:从桌面抓取到全身、空中与水下操作
数据与评测基准回答了机器人“在哪里训练、如何评测”,而任务分类进一步回答机器人究竟需要完成哪些类型的操作。
按照任务特征与机器人本体,代表性操作问题可以划分为十类:
其中,基础操作是目前研究最充分的一类,也是后续方法分类重点展开的对象。
任务版图确定之后,接下来进入这篇综述的方法主线:机器人如何形成任务级指导,又如何将这些信息转化为具体动作。
三、高层规划:机器人如何形成任务级指导?
高层规划(High-Level Planning)负责确定机器人要做什么、按照什么顺序做,以及当前环境中的哪些信息与任务相关,并形成能够指导后续动作生成的结构化结果。
高层规划方法被归纳为七类:基于 LLM 的任务规划(LLM-Based Task Planning)、基于 MLLM 的任务规划(MLLM-Based Task Planning)、程序化规划(Programmatic Planning)、几何约束规划(Geometric Constraint-Based Planning)、Affordance 规划(Affordance-Based Planning)、基于 3D 表示的规划(3D Representation-Based Planning)和基于视频的规划(Video-Based Planning)。

LLM、MLLM 与程序化规划主要负责把任务意图转化为更明确的任务级指导。LLM 可以完成任务分解、技能排序,并结合环境反馈不断调整计划;MLLM 在此基础上加入视觉信息,使机器人能够进行空间定位、进度判断和失败分析。程序化规划则把这些推理结果转化为可执行代码,连接机器人技能与控制接口。
几何约束、Affordance 和 3D 表示更关注如何把语义任务落到物理空间。例如,将任务转化为关键点、目标位姿和空间约束,判断物体哪里适合交互、应该以什么方式交互,或者利用点云、3D Gaussian Splatting 等场景表示为后续动作生成提供空间信息。
视频规划则引入对未来的预测。一类方法直接生成未来操作过程,一类利用世界模型预测不同动作可能带来的结果,还有一些方法利用想象出的未来轨迹训练或优化规划器。综述将其概括为生成式视频规划、预测式世界模型规划和世界模型指导的规划器学习。
整体来看,高层规划的输出已经从传统任务序列扩展到程序、几何约束、Affordance、3D 场景表示和未来视频,为后续动作生成提供不同形式的结构化指导。

四、低层学习式动作建模:机器人如何生成可执行动作?
高层规划能够提供任务目标、结构化约束或其他指导信息,而机器人最终还需要将这些信息转化为可执行动作。低层学习式动作建模(Low-Level Learning-Based Action Modeling)关注这一过程:它既可以接收高层规划的输出,也可以直接利用视觉、语言和机器人状态等多模态观测,生成动作、轨迹或动作序列。围绕这一问题,综述从学习策略(Learning Strategy)、输入建模(Input Modeling)、隐空间学习(Latent Learning)和策略学习(Policy Learning)四个角度展开,其中后三者构成学习式动作模型的主要组成部分。
学习策略关注“模型怎么学”。核心路线包括强化学习(RL)和模仿学习(IL):前者通过环境交互和奖励优化行为,覆盖 model-free、model-based 以及面向 VLA 的强化学习后训练;后者从专家示范或人类视频等数据中学习机器人行为。两类方法也可以结合,例如先进行模仿学习预训练,再利用强化学习优化。世界模型、未来图像或视频预测、目标提取、对比学习和重建等辅助任务,也被用于提升表示能力、数据效率和泛化性能。
输入建模关注“机器人接收什么信息”。从视觉动作模型到 VLA,输入已经由 2D/3D 视觉和机器人状态,扩展到视觉、语言以及更加丰富的物理感知信息。触觉、力/力矩、声音、红外和雷达等模态逐渐进入机器人动作模型,使系统能够感知仅靠视觉难以判断的接触、滑动、柔顺性和物体属性。

隐空间学习关注“模型内部如何表示动作与交互”。一类方法利用通用图像、人类第一视角视频或机器人轨迹预训练可迁移的内部表示;另一类方法直接学习与动作相关的隐空间,将复杂行为编码为离散 token、连续向量或层级技能。这样的隐空间可以连接感知、预测和动作生成,并为跨任务和跨本体迁移提供更加紧凑的表示基础。

策略学习回答“最终如何生成动作”。机器人策略已经从 MLP、Transformer 和 ACT 等架构,扩展到近年来广泛使用的 Diffusion Policy 和 Flow Matching Policy,同时也出现了 SSM/Mamba、SNN、频域策略、动作 Token 化以及结构化动作表示等路线。这里关注的核心是动作如何表示、时间依赖如何建模,以及复杂、多模态机器人行为如何被稳定、高效地生成。

整体来看,这套分类可以概括为两个层面:
学习策略:模型怎么学
输入建模:输入什么 → 隐空间学习:如何表示 → 策略学习:如何生成动作
这样的划分也能帮助我们更清楚地理解一些经常被放在一起讨论的概念:RL 和 IL 描述学习方式,VLA 主要对应多模态输入与动作建模,Diffusion Policy 和 Flow Matching Policy 则对应具体的动作生成机制。
五、从学习瓶颈到系统级挑战:数据、泛化、Agent 与人机协作
机器人操作走向开放环境,首先受到两个基础问题限制:数据是否足够,以及学到的能力能否泛化。在此基础上,长期自主运行还需要更强的 Agent 能力,而真正进入家庭、服务和工业场景,也要求机器人能够与人自然、安全地协作。
数据同时涉及“怎么采”和“怎么用”。数据采集正在从传统遥操作扩展到人机协同采集、自动生成、仿真和众包等方式;数据利用则关注筛选、检索、增强和重加权,希望在有限采集成本下获得更高质量、更有效的训练数据。

泛化决定机器人能否离开训练分布继续工作,主要包括环境泛化、任务泛化和跨本体泛化。其中既涉及 Sim2Real、视角和场景变化,也包括长时序任务、少样本学习,以及在人与机器人、不同机器人平台之间迁移已有能力。

Agent 与人机协作则对应更加系统层面的能力。Agent 可以组织规划、工具调用、记忆、执行监控和失败恢复,让机器人具备更长期的自主性;人机协作要求机器人理解人的意图、偏好和反馈,在必要时主动求助,并与人或其他机器人协调行动。
这四个方向共同决定了机器人操作能否从实验室中的单任务模型,走向可扩展、可泛化并能够长期运行的真实机器人系统。
六、真实世界应用:机器人操作正在走向哪些场景?
机器人操作的价值最终体现在真实场景中。目前相关研究已经覆盖家庭辅助、农业、工业、AI4Science、艺术和体育等多个方向,任务也从传统抓取与装配,扩展到照护、烹饪、采摘、科学实验以及高速动态交互。
在家庭、农业和工业场景中,机器人需要面对更复杂的物体、环境和安全要求。家庭机器人开始承担穿衣、烹饪、喂食、收纳和工具使用等任务;农业机器人被用于水果采摘和复杂植被环境中的操作;工业机器人则持续向更灵活的装配、物流和物料处理发展。与此同时,真实部署仍然高度依赖稳定性、安全性和可重复性,这也是学习式方法落地时必须面对的问题。
机器人操作的应用边界也在快速扩展。AI4Science 已经出现手术辅助、自动化生物实验、机器人化学家和航天操作等方向;在艺术与体育中,机器人也开始挑战钢琴、书法、绘画、羽毛球和乒乓球等高精度、高动态任务。

这些应用展示了机器人操作从结构化自动化走向开放、动态和交互式真实环境的趋势,也为后续研究提出了更高的泛化、安全和自主运行要求。
七、未来:从机器人模型走向自主具身智能
面向开放、动态的真实环境,未来机器人需要在跨本体迁移、持续学习、未来预测、物理交互和安全自主运行等方面持续提升。综述将这些问题归纳为五个彼此关联的方向。
通用且可自我进化的机器人“大脑”。未来机器人需要在不同任务和不同本体之间复用知识,并具备规划、记忆、持续学习和自我改进能力,使系统能够在部署后继续从成功与失败中积累经验。
突破机器人数据规模限制。机器人学习需要充分利用人类第一视角视频、互联网视频、仿真与合成数据等更广泛的数据来源,同时建立数据飞轮,让模型能够发现能力缺口、筛选高价值经验,并反过来指导下一轮数据采集和训练。
预测式世界模型。机器人需要具备预测动作后果的能力,在真正执行前判断不同动作可能带来的未来状态。未来的世界模型还需要更好地理解接触、受力、形变和因果关系,使预测结果真正服务于规划和策略优化。
多模态与深度物理交互。仅依靠视觉很难判断插入是否到位、物体是否滑动或接触力是否合适。视觉、触觉、力觉、本体感知和声音等多模态信息将共同支撑更加复杂的装配、工具使用、柔性物体操作和接触密集型任务。
安全、恢复与协同自治。机器人进入真实环境后,需要具备安全约束、异常检测、失败诊断和自主恢复能力,并能够根据不确定性主动寻求人类帮助,与人或其他机器人协同完成任务。
总体来看,这五个方向共同指向一个目标:让机器人从面向特定任务的模型,逐步走向能够持续学习、预测未来、理解物理世界并可靠自主运行的具身智能系统。
总结
《Towards a Unified Understanding of Robot Manipulation: A Comprehensive Survey》系统梳理了 1400+ 篇相关工作,覆盖硬件、数据、任务、高层规划、低层动作建模、泛化、Agent、人机协作和真实应用,并通过统一框架重新梳理不同方法在机器人系统中的位置与关系。
对于刚进入机器人操作领域的研究者,这份综述可以作为一张系统的知识地图;对于已经在研究 VLA、World Model、人形机器人或跨本体学习等方向的研究者,也可以借助这套分类体系更清楚地判断一个方法究竟解决了哪一类问题,以及它与上下游能力之间的关系。
随着机器人逐渐走向开放环境,接下来的关键问题将更多集中在数据规模与质量、跨任务和跨本体泛化、规划与动作生成协同、物理世界理解,以及系统的自主性与可靠性。欢迎阅读论文原文、收藏项目主页;如果你发现有值得补充的新论文、新评测基准或新的研究方向,也欢迎通过 GitHub Issue / PR 与我们交流,共同完善这张持续更新的机器人操作知识地图。
-END-
Ask Me Anything|提问箱
对文章有疑惑,或想聊更深?欢迎把你的问题丢给我们:技术方案、实操踩坑、课程与资料、项目合作、职业发展,都可以问。
怎么问:在评论区留言,或私信公众号
我们会做什么:每周集中整理高质量问题并公开回复,重点问题邀请作者或嘉宾深度解答;典型问题会加入知识库并持续更新。
提问小提示:尽量说明「你的目标—当前做法—期望产出」,附上必要信息(硬件/软件版本、数据规模等),能更快获得有用答案。
一起把问题变成知识,推动社区进步 🚀