具身智能的测试时扩展新范式:清华团队提出ParallelWorld,让AI像人一样预演未来再行动

机智流 2026-09-02 22:15

具身智能的测试时扩展新范式:清华团队提出ParallelWorld,让AI像人一样预演未来再行动图1

在复杂的物理环境中,一个智能体若要准确理解并做出合理决策,往往需要不断与环境互动以获取更多信息。例如,在一个光线昏暗的房间中寻找特定物品时,仅凭初始观察可能无法确认目标位置,此时智能体需通过移动视角或调整物体位置来逐步揭示隐藏信息。这种主动探索的能力,正是具身智能的核心挑战之一。

传统方法通常依赖于单步、逐次的动作选择,即每一步都基于当前状态决定下一步行动,缺乏对多种未来可能性的系统性评估。

面对这一局限,清华大学与新加坡国立大学的研究团队提出了一种名为 ParallelWorld 的多时域测试时扩展框架。该方法允许智能体在执行任何动作前,先在模拟环境中并行生成和评估多个潜在的未来轨迹,从而实现更全面的策略规划。

具身智能的测试时扩展新范式:清华团队提出ParallelWorld,让AI像人一样预演未来再行动图2

论文标题:ParallelWorld: Test-Time Scaling for Embodied Reasoning

论文链接:https://arxiv.org/pdf/2608.22971v1.pdf

项目链接;https://chen-min-22.github.io/ParallelWorld-page/

研究背景

具身推理要求智能体不仅能够感知环境,还需在动态变化的空间中进行持续的感知、推理与交互。近年来,随着多模态大语言模型(LLM)的发展,具身智能体已能在模拟或真实环境中完成日益复杂的任务。然而,由于视觉证据模糊、环境信息不完整或动态变化,可靠地构建对物理世界的理解仍面临挑战。

为应对这些挑战,研究趋势从被动感知转向主动探索——智能体不再仅依赖固定观测,而是通过与环境互动主动收集任务相关的信息。尽管如此,现有方法大多采用顺序式探索策略,即每个动作仅根据当前状态和已有历史信息作出决策,缺乏对不同行动路径后果的前瞻性评估。这限制了智能体在复杂、遮挡严重的空间中做出最优判断的能力。

创新点与核心思想

ParallelWorld 的核心创新在于引入“多时域未来世界模拟”机制。不同于传统的单步试探,该框架允许智能体在每次决策前,从当前状态出发,同时展开多条并行的未来轨迹,并在模拟中连续推进至多步远的未来状态。每一步模拟后,由一个验证器智能体(verifier agent)对中间状态进行评估,动态剪枝低价值分支,保留最具信息量的路径。

整个过程可类比于人类在做决策时的心理演练:我们不会立即采取行动,而是先在脑海中预演几种可能的结果,再选择最合理的方案。ParallelWorld 正是将这种“心理模拟”能力赋予了具身智能体,使其能够在真实执行前,基于模拟世界中的多路径推演,做出更稳健的判断。

方法设计:三阶段协同机制

ParallelWorld 的整体流程分为三个关键阶段:前景世界扩展、验证引导探索与顶一路由回答。

前景世界扩展

在每一轮探索中,系统会从当前保留的所有轨迹(称为“分支”)出发,对每一个可执行的动作(包括相机移动和任务相关的物理操作,如抓取、放置、倾倒等)进行模拟。每个动作都会触发一次环境状态的更新,并渲染出对应的视觉输出。所有这些候选状态共同构成一个“候选前沿”(candidate frontier),其规模随动作空间和分支数呈指数增长。

为了保持模拟的一致性,所有候选状态均从原始父状态恢复,确保物理交互的因果关系不受影响。对于产生有价值中间状态的动作,系统还会保存其过程帧,作为后续评估的依据。

验证引导探索

直接保留全部候选轨迹会导致计算成本急剧上升。为此,ParallelWorld 引入了一个验证器智能体,负责评估每个候选轨迹的潜在价值。验证器综合考虑问题内容、参考观测、历史探索记录以及候选轨迹提供的视觉证据,判断其是否有助于解决当前问题。

具体而言,验证器倾向于保留那些能揭示任务相关对象、消除视觉歧义或提供互补信息的分支。其评估结果决定了下一阶段保留多少条路径。该保留宽度(branch retention width)遵循一种预设的交替策略:奇数步保留多个分支以维持多样性,偶数步则收敛至单一主干路径,实现从探索到聚焦的自然过渡。

被选中的路径会被重新执行(replayed),其状态用于下一轮扩展;而其他分支虽被保留,但不再贡献给最终答案的推理。

Top1路由回答

由于机器人只能执行一条实际动作序列,且无法同时尝试多个路径或回溯到过去的状态,因此系统必须区分内部模拟与外部执行。尽管验证器在内部维护多个分支,但最终的答案生成只基于一条从根节点到叶节点的单一路径——即“Top1路由”。

该路径由当前最高排名的分支回溯而成,保证了所有观测来自同一物理一致的轨迹。答案智能体(answer agent)基于这条路径上的所有后置动作观测,结合初始参考信息,生成最终答案、置信度及推理过程。

当答案的置信度超过预设阈值且答案格式有效时,探索过程终止;否则将继续推进至最大探索深度。这一机制既避免了跨路径信息混合带来的逻辑矛盾,又实现了高效的决策输出。

具身智能的测试时扩展新范式:清华团队提出ParallelWorld,让AI像人一样预演未来再行动图3
图 1:ParallelWorld 架构图,展示了从初始状态出发,通过并行模拟未来世界、验证器筛选、最终选择顶一路由进行答案生成的全过程

实验结果:显著提升主动推理性能

研究团队在 ESI-Bench 基准上进行了广泛实验,涵盖 28 个子任务类别,涉及感知定位、物理结构、动态行为、认知地图、枚举感知等多个维度。结果显示,ParallelWorld 在绝大多数任务中均优于传统的主动探索基线方法,尤其在时间理解与度量比较类任务中表现突出。

例如,在“未观察到的变化”任务中,准确率从 70.95% 提升至 89.86%;在“空间距离”任务中,从 58.55% 提高到 67.11%。即使在部分任务中,如“连通性”,虽然被动单视图方法表现最佳,ParallelWorld 仍实现了从 55.00% 到 60.00% 的提升。

具身智能的测试时扩展新范式:清华团队提出ParallelWorld,让AI像人一样预演未来再行动图4

此外,消融实验表明,采用动态保留宽度策略的 ParallelWorld 在平均准确率(59.56%)和运行效率(平均 350.6 秒/问题)之间取得了最佳平衡。相比之下,固定宽度设置(K=2,3,4)在某些任务上表现更优,但整体性能下降,说明固定的搜索策略难以适应多样化任务需求。

具身智能的测试时扩展新范式:清华团队提出ParallelWorld,让AI像人一样预演未来再行动图5
具身智能的测试时扩展新范式:清华团队提出ParallelWorld,让AI像人一样预演未来再行动图6
图 2:验证引导探索的定性分析。对比了 Active Exploration 与 ParallelWorld 在同一任务中的探索过程。灰色视图为未被选中的候选分支,彩色视图为验证器保留的分支。

图 2 展示了一个典型案例:传统方法沿单一路径探索,因信息不足而得出错误结论;而 ParallelWorld 能够并行评估多个动作方向,验证器成功识别出能逐步暴露灯与投影仪相对位置的路径,最终帮助答案智能体正确作答。这直观体现了多路径模拟与智能筛选的价值。

局限与未来方向

尽管 ParallelWorld 显著提升了具身推理能力,但仍存在一些局限。

首先,其测试时计算开销较大,因为每个保留分支都需要遍历全部可执行动作。

其次,探索质量高度依赖于模拟器的精确性和验证器的可靠性。此外,仅保留单一路径可能导致部分互补信息被舍弃,影响全局判断。

未来工作可探索使用学习型分支剪枝模型、不确定性感知的验证器,以及分层动作提议策略,以进一步提升效率与鲁棒性。将该框架应用于真实机器人平台和动态开放环境,也是值得深入的方向。

结论

ParallelWorld 为具身智能体提供了一种全新的测试时扩展范式。它通过并行模拟未来世界、验证器引导筛选与顶一路由推理,使智能体能够在真实执行前系统性评估多种可能路径,从而做出更明智的决策。实验结果充分验证了未来世界模拟在增强具身推理方面的有效性,为构建更具自主性的智能体提供了新的思路。


> 本文由 Intern-S2 等 AI 生成,机智流编辑部校对


-- 完 --


加入机智流 Pro,1 天一块钱,AI 能力指数级增长时代,不掉队。机智流 AI 团队将燃烧远超人类的智能的 AI Tokens 驱动 AI Agents 军团带来「与你有关」「对你有用」的高质量资讯/研报。


机智流推荐阅读

1. 

2. 

3. 

4. 

关注机智流并加入 AI 技术交流群,不仅能和来自大厂名校的 AI 开发者、爱好者一起进行技术交流,同时还有等。
在「机智流」公众号后台回复下方标红内容即可加入对应群聊:
  • cc | 大模型技术交流群
  • hf | HuggingFace 高赞论文分享群
  • lc|LangChain 技术交流群
  • code | AI Coding 交流群
  • 具身 | 具身智能交流群
  • 硬件 | AI 硬件交流群
  • 推理 | AI 推理框架交流群
  • 智能体 | Agent 技术交流群

关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。
AI AR 测试
more
努比亚NaviX Ultra定档9月,倪飞揭秘AI原生手机底层逻辑
发帖就能赢大奖?智元AIMA社区上线,万元奖池寻找“头号玩家”
新品直击|全球首款全自主导盲机器人:朱葛机器人AI LOOK亮相福祉博览会
马斯克G20预言:AI将重塑全球生产力版图,电力短缺成最大隐忧
AI修车?网友实测大模型诊断引擎,被指“赛博朋克”却低效高危
OpenAI再遭30起诉讼:从“疏忽”到“共谋”,图姆勒里奇枪击案背后的算法伦理拷问
对话兰小欢:置身 AI 事内,不要拿旧理论硬套新现实|AI透镜研究系列
华硕ProArt GR1X迷你主机亮相:掌中AI算力怪兽,集成RTX Spark平台
AI 下一场竞争:谁能成为 Agent 的「上下文操作系统」
具身智能的测试时扩展新范式:清华团队提出ParallelWorld,让AI像人一样预演未来再行动
Copyright © 2025-成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号