ECCV 2026|不靠「上帝视角」,也不等「完美指令」:REAL 让具身智能体走向开放世界

机器之心 2026-09-15 11:12
ECCV 2026|不靠「上帝视角」,也不等「完美指令」:REAL 让具身智能体走向开放世界图1


真实家庭任务往往从「不完整的信息」开始:机器人不知道目标在哪里,用户也未必能一次说清自己想要什么。面对「帮我从餐桌上拿点零食」这样的模糊指令,机器人不仅要主动寻找候选物体,还要在发现面包和多个甜甜圈后进一步询问用户,确认究竟该拿哪一个。


在真实世界里,探索环境、理解意图和执行动作,本就不是三个彼此独立的问题。


围绕这一问题,来自上海交通大学、上海人工智能实验室等机构的研究者提出 REAL,一个面向开放世界移动操作的可探索、可交互、可部署的视觉具身智能体框架,并构建了贯穿仿真、数据生成、模型训练、系统评测与真机部署的完整技术链路。这篇工作已被 ECCV 2026 接收。



📄 论文链接:https://arxiv.org/abs/2607.13653

🏗️ 项目主页:https://internrobotics.github.io/REAL/

💻 开源代码:https://github.com/InternRobotics/REAL


一、从仿真到真实世界:

没有「上帝视角」,也没有「完美指令」


面向从仿真到真实世界的迁移,REAL 重点针对现有具身智能体仿真环境中两项被过度理想化的假设:环境信息充分可知用户意图清晰明确。而在真实部署中,智能体往往面临相反的情况——环境未知,机器人缺乏先验感知;以及意图模糊,用户难以在任务开始时一次性明确需求。具体而言:


首先是环境状态信息缺失。现有仿真环境通常通过特权感知接口(oracle perception API)提供任务相关物体的数量、位置等真实信息,但在真实环境中这些信息无法被直接获取,智能体需要依靠主动探索发现物体。依赖特权信息训练得到的智能体,在真实部署中往往缺乏自主感知与探索能力。


其次是用户意图信息模糊。现有的具身智能体评测任务通常假定指令是清晰明确的,但真实场景下的用户未必知晓环境全貌,往往只能给出模糊需求,并根据智能体的反馈逐步细化任务。因此,真实环境下的智能体需要能反馈当前环境状态,并按照用户需求调整后续行为。


为应对这两类不确定性,REAL 将主动探索、视觉目标定位、自然语言意图消歧和物理操作统一到同一决策闭环中:系统以第一视角 RGB 观测为主要感知输入,并结合建图系统提供的承载区域(如桌面、柜子)作为搜索先验;当智能体在探索阶段发现多个候选目标时,智能体会主动汇报探索结果并请求用户细化指令(例如:「我找到了一个面包和两个不同的甜甜圈,您想要哪一个?」);智能体的询问由当前探索结果触发,用户反馈则进一步细化任务目标。通过这一机制,环境探索、意图确认与物理执行被统一到同一决策闭环中。


ECCV 2026|不靠「上帝视角」,也不等「完美指令」:REAL 让具身智能体走向开放世界图2

图 1. REAL 的工作模式与既往执行方式的对比


二、REAL:

面向开放世界移动操作的 Agentic 架构


REAL 构建于 InternUtopia 仿真平台之上,利用其高保真渲染能力、丰富的可交互仿真场景与资产,设计了适用于移动操作智能体的数据采集、训练和评测管线,最终形成了一套面向开放世界移动操作的 Agentic 框架。该框架的系统顶层架构由以下三大核心组件构成:





ECCV 2026|不靠「上帝视角」,也不等「完美指令」:REAL 让具身智能体走向开放世界图3

图 2. REAL 框架设计


基于这一顶层架构,REAL 在环境、数据与部署层面实现了三项核心贡献:





三、技术实现:

主动探索、沟通与高低层解耦


无特权感知的主动探索与交互


在 REAL 框架中,智能体仅接收可获取的结构先验,即承载区域或场景节点(如桌面、柜体)的 ID 与语义类别。为了定位目标,智能体通过四步探索工具链(导航、多视角扫描、目标检测、对齐注视)主动获取视觉信息。系统将检测到的 2D 分割掩码反投影到 3D 空间以构建临时探索地图,并通过 SoM(Set-of-Mark)为物体分配视觉 ID。后续的抓取、放置等操作均基于视觉 ID 调用,使机器人能够完成视觉目标定位与消歧,有效区分同类但外观不同的物体。同时,REAL 接入了一个由大模型驱动的模拟用户,它能依据当前已发现的物体和任务配置给出回答,使主动沟通成为由探索结果直接触发的执行环节。


基于 MCP 协议的高低层解耦执行


得益于 MCP 协议的引入,模型「大脑」可以始终专注于任务规划与状态跟踪,并输出统一格式的离散工具调用。在此机制下,仿真环境与真实环境通过统一的工具接口被抽象为一致的交互空间当系统迁移到真机部署时,底层的连续物理控制由微调后的 $\pi_{0.5}$ 模型等专门的物理技能来接管。这种高低层解耦的设计,使得高层策略在完全不重新训练的情况下,就能直接零样本迁移到真实的物理机器人上。


SFT 与 GSPO:先完成工具对齐,再学习闭环决策


智能体采用 Qwen3-VL-8B-Instruct 作为基座模型,以兼顾多模态能力与机器人侧的推理效率。针对长程任务中容易出现的上下文膨胀问题,系统将决策过程建模为部分可观察马尔可夫决策过程,并使用结构化的自摘要历史状态,避免了在每一步重复拼接完整的交互轨迹。整个训练管线分为两个核心阶段:



通过这套双阶段训练管线,训练后的策略会根据环境的真实反馈,自主决定何时继续探索、何时重新规划,以及何时向用户确认。


四、REAL-Bench:

评测设计与实验结果


REAL-Bench 共包含 241 个任务实例分为四个任务族:






四类任务共同覆盖「探索—定位—操作—沟通」的完整执行过程,并从不同侧面检验智能体应对视觉干扰、感知动态状态、交互决策和主动探索的能力。


实验结果:SFT 学会「用工具」,RL 学会「自主交互」


ECCV 2026|不靠「上帝视角」,也不等「完美指令」:REAL 让具身智能体走向开放世界图4






五、真机部署:60 个真实世界测试

 episodes,78.3% 端到端成功率


为了验证 sim-to-real 能力,团队将训练得到的高层策略零样本迁移到 ARX LIFT2 双臂移动机器人



ECCV 2026|不靠「上帝视角」,也不等「完美指令」:REAL 让具身智能体走向开放世界图5

图 4. 真实任务中的部署验证了 REAL 的有效性


「把面包放进微波炉」这一任务直观展示了 REAL 在长程任务中的规划与状态维护能力。机器人并没有直接前往柜子取面包,而是先打开微波炉,再去柜子抓取面包,最后返回微波炉,放入面包并关门。这一执行顺序体现了系统对任务前置条件与操作依赖关系的理解。与此同时,REAL 通过结构化历史状态持续记录并更新当前任务进展,进展中仅保留与后续决策相关、并经过工具反馈验证的信息,而非完整的历史交互轨迹,从而避免了上下文的快速增长,减少了执行中的状态遗忘与错误累积。


六、总结


REAL 的核心是重新设计仿真训练与真实部署之间的信息边界,使具身智能体不再依赖两项传统的理想化假设——依赖现实中无法获取的「完美感知」,以及假定用户总能给出明确、完整的指令,转而面向更真实的部署条件:智能体必须通过视觉探索主动获取环境证据,在必要时通过沟通补全用户意图,并最终调用可部署的物理技能完成任务。


在此基础上,REAL 借助统一的 MCP 工具接口,将高层视觉推理与具体物理执行后端深度解耦,使得同一套高层策略能够从仿真环境零样本迁移至真实双臂移动机器人。REAL-Bench 与真机实验一致表明,促使模型学会在「看不全、说不清、执行会失败」的非理想条件下持续闭环决策,提供了一条具身智能从受限基准迈向真实世界的有效路径。



ECCV 2026|不靠「上帝视角」,也不等「完美指令」:REAL 让具身智能体走向开放世界图6


© THE END 

转载请联系本公众号获得授权

投稿或寻求报道:liyazhou@jiqizhixin.com

关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。
more
三星营销再出奇招:借“库克”之口评测折叠屏,暗讽苹果创新乏力
苹果iPhone18重磅新功能来了,但我劝你先别用!
折叠屏“三国杀”:华为小米如何抢在苹果前夜截胡流量?
火上热搜的苹果iPhone Duo折叠动画,有人不到一天实现复刻!
iPhone Duo 只是开始,苹果折叠屏路线图曝光:Duo Max、翻盖 Mini、第三代上 Face ID
苹果零售店悄然变阵:晨会禁水站立,AI介入天才吧服务
苹果的折叠屏等了十五年,体验还差临门一脚
苹果重构租赁版图:Klarna接手,全品类覆盖但价格迷雾待解
折叠屏市场变局:大折叠崛起,苹果入局重塑格局
苹果打破惯例上调旧机售价,印度市场溢价高达57%引争议
Copyright © 2025-成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号