机器人如何“三思而后行”?长时序具身智能正在争论什么

Xbotics具身智能实验室 2026-07-31 15:00

点击下方卡片,关注【Xbotics具身智能实验室】公众号

你想要的这里都有~~



机器人如何“三思而后行”?长时序具身智能正在争论什么图1

共识之下,路线之争

过去一年,具身智能领域出现了一个看似清晰的共识:只依靠当前视觉观测直接生成动作,很难支撑真正复杂的机器人任务。机器人不仅要知道“现在看到了什么”,还需要知道“任务进行到哪里”“下一步应该做什么”,甚至要在真正行动之前预判“这样做会发生什么”。

这个共识本身不难达成。长时序任务中,当前画面永远只是完整任务状态的切片,错误会向后传播并改变后续任务的前提,动作执行正确不代表任务方向正确,而物理世界中的某些错误一旦发生就不可逆。

所以,“三思而后行”不是一个拟人化的修辞,而是试图降低物理行动的试错成本。

但共识到此为止。一旦追问“机器人在哪里思考、思考什么、怎么思考”,不同团队给出了完全不同的答案。

π0.7认为,核心是为动作模型提供更丰富、更可控的上下文——语言子任务、视觉子目标、轨迹质量、控制模式都可以成为策略的条件。

DreamZero、Motus和Cosmos Policy更进一步,尝试把视频模型转化成世界动作模型,让预测未来和生成动作成为同一个建模问题。

τ0-WM将测试时计算放到动作块层,在执行前模拟和筛选候选动作。

τ0-VLA则把世界模型放进高层规划器,在子任务层进行搜索、评分和反思。

PAIWorld提出:如果多相机预测在三维空间中不一致,生成得再逼真也无法指导机器人。

World Value Models则把问题推向另一个方向:世界模型不一定直接生成动作,但可以负责判断轨迹质量、任务进度和未来价值。

ACE-BRAIN 的关注点则不局限于某一次行动之前的思考,而是整个任务生命周期中的持续闭环。它认为,预测未来、规划动作、评估结果和反思失败都应服务于同一个 Agent 循环。机器人需要在感知、规划、执行、评估和反思之间不断迭代,通过 Feedback 持续修正对世界和任务状态的理解,而不是将“思考”限制在单一模块或单一时刻。

机器人如何“三思而后行”?长时序具身智能正在争论什么图2

换句话说,所有人都同意机器人需要“思考”,但对于“思考”应该发生在哪一层、预测什么、评价什么、什么时候介入行动,答案远远没有收敛。

本文试图梳理这场争论的核心脉络,并把它拆解成几个可以被讨论的具体问题——不是为了给出答案,而是为一场真正的辩论做准备。

长时序任务究竟难在哪里?

首先需要澄清一个问题:长时序任务并不只是“动作步骤比较多”。

假设机器人要完成番茄炒蛋,它需要打开冰箱、取鸡蛋、取西红柿、关闭冰箱、打蛋、搅拌、倒油、加入蛋液、加入西红柿、调味、翻炒、装盘。如果只是把这些步骤依次写出来,这仍然只是一个任务脚本。

真正的长时序智能,至少包含四类更困难的问题。

1. 当前画面不能完整表达任务状态

“鸡蛋是否已经打入碗中”通常可以从图像判断,但“盐是否已经加入”“某个抽屉是否已经检查”“杯子是否已经冲洗过”,未必能从当前画面恢复。这意味着机器人面对的是一个部分可观测问题

机器人看到的是当前画面,但真正决定下一步的,是一个包含历史事件、隐藏状态和任务约束的内部状态。因此,长时序能力不能简单等同于更长的视觉上下文。机器人需要持续维护一个随执行不断更新的内部任务状态,用于整合历史事件、隐藏信息以及当前任务进度,而任务记忆只是维护这一状态的一种方式。

2. 前面的错误会改变后面的任务

在单步抓取中,抓取失败通常意味着重新抓一次。但在长任务中,失败可能改变整条任务路径。鸡蛋没有取出来,后面的打蛋、搅拌和下锅都失去前提;杯子被碰倒,系统可能需要先清理液体,而不是继续加入配料。

错误在长时序任务中具有因果传播效应。系统不仅需要判断动作是否失败,更需要重新评估环境和任务状态,分析失败对后续流程的影响,再决定当前计划是否仍然成立,以及是否需要重试、回退或重新规划。

3. 动作执行正确,不代表任务方向正确

机器人可能非常准确地执行了一个错误的子任务。例如,当前应该拿起勺子,但机器人重新拿起了已经放好的杯子。低层轨迹可能十分稳定,但整体任务出现了倒退。

长时序任务至少包含三个层次的正确性:运动执行是否正确、当前动作选择是否正确,以及这一动作是否仍然服务于整体任务目标。长时序任务需要自闭环任务的理解。

4. 物理世界中的错误可能不可逆

语言模型答错后可以重新生成,机器人把盐倒多了、把杯子摔碎了、把工具碰进锅里,环境已经被改变。因此,机器人不能始终采用“先执行,失败后再恢复”的模式。对于高风险、高代价或不可逆的步骤,机器人需要在行动前增加计算和验证。

这些问题看似分别对应记忆、规划、世界模型或测试时计算,但它们本质上都指向同一个问题:机器人需要”三思而后行”。这里的”三思”并不是在执行前简单增加一次推理,而是贯穿整个任务过程——行动前思考是否应该执行,行动中持续判断任务是否仍然朝着正确方向推进,行动后评估结果是否符合预期,并据此调整后续决策。只有将思考贯穿整个任务流程,机器人才能真正适应持续变化的物理世界。

这就是“三思而后行”真正具有意义的地方:它不是让机器人表现得更像人,而是试图降低物理行动的试错成本。

“三思”的三种可能含义

当前的研究路线里,“机器人在行动前思考”至少包含三种不同机制。

第一种:通过条件控制,让机器人知道应该怎样做

π0.7代表的是这条路线。传统VLA的输入通常包含当前观测、机器人状态和任务语言,然后直接预测动作块。但同一个任务可能存在速度快慢、质量高低、是否发生错误、不同机器人控制模式等多种执行方式。如果模型只接收到“把衣服叠好”,它并不知道训练数据中的某条轨迹是高质量演示、低效成功、人工接管,还是带有明显错误的自主执行。

π0.7因此把更多信息放入prompt:总任务指令、当前子任务、多视角视觉子目标、轨迹速度、轨迹质量、是否出现错误、关节空间或末端空间控制模式。世界模型在其中生成subgoal images,用视觉形式表达当前子任务完成后的目标状态。它不是用来搜索多条未来路线,而是给动作策略提供更具体的控制条件。

从这个角度看,π0.7的“思考”主要发生在条件表达层:不只是告诉机器人做什么,还要告诉它当前做到什么状态,以及希望以什么质量和方式完成。这条路线的优势是相对直接——世界模型生成一次视觉目标,VLA继续负责连续控制,不需要在每个子任务边界展开复杂搜索。

但它也留下一个问题:谁来决定当前的子任务是什么? π0.7可以接受人工coaching,也可以接受高层语言策略生成的子任务。如果高层对子任务判断错误,视觉子目标可能只是帮助低层更准确地完成错误任务。因此,π0.7更强地解决了“如何执行一个给定子任务”,但并没有完全解决“为什么当前应该选择这个子任务”。

第二种:通过未来预测,让机器人知道行动会导致什么

DreamZero、Motus、MotuBrain、Cosmos Policy和τ0-WM更接近这一思路。它们试图将动作与世界变化放进同一个生成过程。

DreamZero建立在预训练视频扩散模型之上,同时预测未来世界状态和机器人动作。其核心判断是,VLA擅长利用语言与视觉语义,但对新的物理运动和环境动力学未必足够敏感;视频模型通过预测世界如何变化,可能拥有更强的运动与物理先验。

Motus尝试统一理解、视频生成和动作建模,使同一个模型可以在世界模型、VLA、逆动力学和视频—动作联合预测等模式之间切换。Cosmos Policy直接把动作、未来图像和价值编码进视频模型的生成空间,模型既可以生成动作,也可以预测未来状态和累计价值。τ0-WM则把测试时计算直接放在动作块层——模型先生成候选动作,再预测候选动作可能导致的多视角未来状态,评估动作质量,并对低质量动作进行纠正。

这些工作共同代表一种观点:动作不应该只是视觉与语言的条件输出,动作本身应该与未来世界的变化联合建模。 在这种框架下,模型不仅学习“看到这种画面应该输出什么动作”,还学习“这个动作会把世界变成什么样”。

但这里存在一个尚未解决的核心问题:预测未来,与做出正确决策,是否真的是同一件事? 一个模型可以生成视觉上逼真的未来,但未必准确理解接触力、物体重量、摩擦、遮挡和机器人自身约束。未来视频生成质量通常强调画面连贯性,机器人控制却关心夹爪是否真正夹稳、插头是否完成插入、物体是否发生毫米级滑移、接触力是否超过安全范围。“画面合理”与“物理可执行”之间仍然存在距离。

第三种:通过搜索和反思,让机器人比较多种未来

τ0-VLA代表的是第三种路线。它们仍然采用高层与低层分离的双系统结构,但高层不再只生成一次下一子任务,而是包含四个角色:提议模型维护任务记忆并生成候选子任务;世界模型预测候选子任务执行后的视觉结果;价值模型评价预测结果是否推进总任务;反思模型综合搜索分支,决定真正提交的下一子任务。

系统先提出多个可能的下一步,用世界模型分别模拟,再用价值模型评分,并从高分结果继续向后搜索。最后,反思模型检查最高分路线是否存在重复、倒退、时序错误或与真实观测冲突。

与π0.7相比,τ0-VLA中的世界模型不是目标提供者,而是候选路线的模拟器。与τ0-WM相比,τ0-VLA不是在动作块层评估“这段动作怎样执行”,而是在子任务层判断“下一步做什么”。这两种测试时计算分别处理不同粒度的问题:τ0-VLA校正任务方向,τ0-WM校正局部执行。

理论上二者可以嵌套——高层先搜索下一子任务,中层选择技能与操作方式,低层再筛选动作块。但这样也会带来工程问题:模型数量增加、系统延迟增大,预测误差与评价误差还可能层层叠加。如果世界模型预测了一个不存在的成功状态,价值模型又对它给出高分,搜索深度越大,未必越正确,反而可能在错误假设上构造出一条非常完整的虚假路线。所以,搜索并不自动等于推理。搜索的上限取决于内部模拟器和评价器是否可信。

ACE-BRAIN 是该路线的另一个代表。它 面向 Physical Agentic AI 把感知、规划、执行、评估和自我进化统一到同一模型中;其价值不只是让机器人“动起来”,更是让机器人开始具备围绕真实世界目标进行感知、推理、行动与反馈的完整认知链路;也让机器人开始具备“自我检查”的能力:不是做完动作就结束,而是持续判断自己离目标更近了还是更远了。一旦任务进展停滞或出现偏差,自我监控信号就能够为后续恢复、纠错和重新规划提供依据。

机器人如何“三思而后行”?长时序具身智能正在争论什么图3

ACE-BRAIN 引入了“双时间尺度”的架构让机器人形成“慢脑”和“快脑”的协同机制:慢脑负责感知、规划和多模态推理,输出文本推理、区域框、指向、可供性和轨迹等结果;快脑负责实时感知和短时预测,快速反应和动作执行。二者协同,使 ACE-BRAIN 不只是理解模型,也不是单一动作策略,而是一个真正面向物理执行的闭环认知系统。

如果未来在三维空间里对不上,预测还有意义吗?

机器人通常同时使用头部相机、腕部相机和外部相机。这些相机看到的是同一个物理世界的不同投影。但很多多视角生成模型只是把不同视角token拼接起来,让Transformer自行学习视角关系。PAIWorld认为,这种处理容易导致跨视角物体漂移、深度不一致和纹理错位。

它因此引入显式的跨视角注意力、相机射线与外参编码,以及来自3D基础模型的空间特征蒸馏,使多视角未来预测保持更强的三维一致性。PAIWorld实际上提出了一条重要的评价原则:世界模型不能只在单个视角里看起来合理,还必须在统一三维空间中自洽。

这也暴露了τ0-VLA式高层视觉推演的限制。如果系统只通过一张终局图判断任务是否推进,它很难发现:物体在腕部视角中其实没有夹稳;抽屉在头部视角里像是关闭,但仍留有缝隙;双臂在另一个视角中即将碰撞;物体的深度位置与生成图像不一致;柔性物体只在表面看似平整。

所以,长时序推理不仅需要语义未来,还可能需要多层次的物理未来:高层判断任务阶段,中层判断三维空间关系,低层判断接触与动力学结果。仅凭语言与单帧图像,可能不足以支撑真正的物理反思。

世界模型应该预测未来,还是判断未来?

World Value Models提出了另一种定位。它不强调直接从世界模型生成动作,而是利用世界模型的时间理解能力,对任务进度、轨迹质量和状态价值进行判断。

传统机器人价值模型多建立在VLM之上,但VLM通常主要接受静态图像或稀疏视觉信息。价值判断却需要理解一段历史中发生了什么,以及当前状态未来是否可能成功。World Value Models因此将世界模型与价值估计结合,并构建包含低质量轨迹的评测集,测试模型能否正确区分专家行为、低效行为和失败行为。

这条路线的重要性不只体现在规划阶段,更体现在数据闭环。真实机器人部署后产生的数据一定是混合质量的:成功、失败、半成功、人工接管、低效成功、偶然恢复、危险动作、完成任务但质量不合格。如果没有可靠的价值模型,系统很难判断哪些数据值得重新训练。

这与π0.7使用episode metadata解决混合质量数据问题形成了有趣对照。π0.7的方法是:训练前尽量为轨迹提供质量、速度和错误标签,让策略知道应当模仿哪类行为。World Value Models的方法是:训练一个能够自动理解轨迹进展与价值的模型,降低对人工元数据的依赖。前者更像显式数据治理,后者更像自动化价值判断。一个值得追问的问题由此浮现:轨迹质量应该通过人工metadata表达,还是应该由世界价值模型自动发现? 前者可控,但标注成本高;后者可扩展,但可能继承模型偏差。

预测之后,机器人还需要做什么?

但即使未来预测能够保持三维一致,它仍然只是机器人决策过程中的一个环节,而不是终点。真实世界不会因为一次预测而停止变化,机器人执行动作之后,环境状态仍会不断演化,预测结果也可能因为外界扰动或执行误差而逐渐失效。因此,未来预测不能只是一次性的“看见未来”,还需要在执行过程中不断被真实观测验证,并根据新的反馈持续修正对世界状态和任务进度的理解。ACE-BRAIN 正是基于这一观点,进一步将预测、反馈与反思统一到同一个 Agent 闭环之中。它认为,世界模型的价值不仅在于预测未来,更在于为机器人提供持续推理的基础:预测未来、执行动作、验证结果、更新认知,再进入下一轮预测,使机器人始终处于边行动、边思考、边修正的自闭环过程中。

最值得讨论的的5个问题

1. 长时序能力究竟应该如何定义? 是任务步骤更多、执行时间更长,还是需要维护更多隐藏状态和因果依赖?一个25步但流程固定的任务,未必比一个5步但初始状态开放、存在多人干预的任务更难。长时序基准是否应该统计隐藏状态数量、因果依赖深度、失败恢复次数、不可逆动作数量、环境变化程度?

2. 世界模型需要预测多远? 动作级世界模型关注未来几秒,高层世界模型关注下一个子任务完成后的状态。预测越远,不确定性越大;预测越短,对长程决策的帮助越弱。世界模型是否应该采用分层时间尺度?

3. 世界模型与价值模型应该统一还是分离? 统一模型可以共享表征、降低系统复杂度;分离模型可能减少自我偏好,但不代表二者没有共同盲区。什么样的独立性才足以形成有效监督?

4. 机器人如何知道自己“不知道”? τ0-VLA使用语言生成概率和logit间隔触发慢速搜索,但语言不确定性不一定等于物理风险。更可靠的不确定性是否应该来自多世界模型预测分歧、多视角冲突、视觉与触觉不一致、当前状态距离训练分布的程度、技能成功率或失败恢复成本?“三思而后行”的关键可能不是思考能力,而是风险感知能力。

5. 长时序任务应该由一个模型完成,还是由系统完成? 如果记忆、规划、世界预测、价值评估和执行都由不同模型负责,系统更可解释,但误差和延迟会累积。如果全部内化到一个大模型,接口更短,但决策过程难以验证。家庭服务、工业生产和开放环境机器人,可能需要不同的架构答案。

这些路线或许都会被证明只对了一部分。但正是在这种分歧中,我们才能真正看清:让机器人学会思考,本质上是在教会它为自己的行为负责。


本周六晚8点,我们将邀请具身智能领域的一线研究者和从业者,围绕以上五个问题展开一场深度直播讨论。 不是发布会式的宣讲,而是真正把分歧摆到台面上——世界模型应该长在哪一层?预测未来和做出决策是不是同一件事?机器人怎么知道自己不知道?直播中见分晓。欢迎预约,一起来辩。


-END-

Ask Me Anything|提问箱

对文章有疑惑,或想聊更深?欢迎把你的问题丢给我们:技术方案、实操踩坑、课程与资料、项目合作、职业发展,都可以问。

怎么问:在评论区留言,或私信公众号

我们会做什么:每周集中整理高质量问题并公开回复,重点问题邀请作者或嘉宾深度解答;典型问题会加入知识库并持续更新。

提问小提示:尽量说明「你的目标—当前做法—期望产出」,附上必要信息(硬件/软件版本、数据规模等),能更快获得有用答案。

一起把问题变成知识,推动社区进步 🚀


关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。
机器人
more
特朗普政府再“挥刀”,中国人形机器人闯美遇阻
独家丨小鹏机器人施晓鑫再创业,切入家庭机器人赛道
人形机器人一用灵巧手就“站桩”?人形控制全新框架,双运动先验实现移动灵巧操作
【有奖活动】具身机器人关键技术解析
UCLA博士团队创业做人形机器人基础模型,拿下近5亿元天使++轮融资丨36氪首发
AMD开始为机器人造大脑了
大模型、机器人之外,社会智能补上AGI第三极
我看见了机器人的中式梦核
机器人如何“三思而后行”?长时序具身智能正在争论什么
别只盯着“大脑”!机器人迈向具身智能的第一步,是 “睁眼看世界”?
Copyright © 2025 成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号