
在复杂的物理环境中,一个智能体若要准确理解并做出合理决策,往往需要不断与环境互动以获取更多信息。例如,在一个光线昏暗的房间中寻找特定物品时,仅凭初始观察可能无法确认目标位置,此时智能体需通过移动视角或调整物体位置来逐步揭示隐藏信息。这种主动探索的能力,正是具身智能的核心挑战之一。
传统方法通常依赖于单步、逐次的动作选择,即每一步都基于当前状态决定下一步行动,缺乏对多种未来可能性的系统性评估。
面对这一局限,清华大学与新加坡国立大学的研究团队提出了一种名为 ParallelWorld 的多时域测试时扩展框架。该方法允许智能体在执行任何动作前,先在模拟环境中并行生成和评估多个潜在的未来轨迹,从而实现更全面的策略规划。

论文标题:ParallelWorld: Test-Time Scaling for Embodied Reasoning
论文链接:https://arxiv.org/pdf/2608.22971v1.pdf
项目链接;https://chen-min-22.github.io/ParallelWorld-page/
研究背景
具身推理要求智能体不仅能够感知环境,还需在动态变化的空间中进行持续的感知、推理与交互。近年来,随着多模态大语言模型(LLM)的发展,具身智能体已能在模拟或真实环境中完成日益复杂的任务。然而,由于视觉证据模糊、环境信息不完整或动态变化,可靠地构建对物理世界的理解仍面临挑战。
为应对这些挑战,研究趋势从被动感知转向主动探索——智能体不再仅依赖固定观测,而是通过与环境互动主动收集任务相关的信息。尽管如此,现有方法大多采用顺序式探索策略,即每个动作仅根据当前状态和已有历史信息作出决策,缺乏对不同行动路径后果的前瞻性评估。这限制了智能体在复杂、遮挡严重的空间中做出最优判断的能力。
创新点与核心思想
ParallelWorld 的核心创新在于引入“多时域未来世界模拟”机制。不同于传统的单步试探,该框架允许智能体在每次决策前,从当前状态出发,同时展开多条并行的未来轨迹,并在模拟中连续推进至多步远的未来状态。每一步模拟后,由一个验证器智能体(verifier agent)对中间状态进行评估,动态剪枝低价值分支,保留最具信息量的路径。
整个过程可类比于人类在做决策时的心理演练:我们不会立即采取行动,而是先在脑海中预演几种可能的结果,再选择最合理的方案。ParallelWorld 正是将这种“心理模拟”能力赋予了具身智能体,使其能够在真实执行前,基于模拟世界中的多路径推演,做出更稳健的判断。
方法设计:三阶段协同机制
ParallelWorld 的整体流程分为三个关键阶段:前景世界扩展、验证引导探索与顶一路由回答。
前景世界扩展
在每一轮探索中,系统会从当前保留的所有轨迹(称为“分支”)出发,对每一个可执行的动作(包括相机移动和任务相关的物理操作,如抓取、放置、倾倒等)进行模拟。每个动作都会触发一次环境状态的更新,并渲染出对应的视觉输出。所有这些候选状态共同构成一个“候选前沿”(candidate frontier),其规模随动作空间和分支数呈指数增长。
为了保持模拟的一致性,所有候选状态均从原始父状态恢复,确保物理交互的因果关系不受影响。对于产生有价值中间状态的动作,系统还会保存其过程帧,作为后续评估的依据。
验证引导探索
直接保留全部候选轨迹会导致计算成本急剧上升。为此,ParallelWorld 引入了一个验证器智能体,负责评估每个候选轨迹的潜在价值。验证器综合考虑问题内容、参考观测、历史探索记录以及候选轨迹提供的视觉证据,判断其是否有助于解决当前问题。
具体而言,验证器倾向于保留那些能揭示任务相关对象、消除视觉歧义或提供互补信息的分支。其评估结果决定了下一阶段保留多少条路径。该保留宽度(branch retention width)遵循一种预设的交替策略:奇数步保留多个分支以维持多样性,偶数步则收敛至单一主干路径,实现从探索到聚焦的自然过渡。
被选中的路径会被重新执行(replayed),其状态用于下一轮扩展;而其他分支虽被保留,但不再贡献给最终答案的推理。
Top1路由回答
由于机器人只能执行一条实际动作序列,且无法同时尝试多个路径或回溯到过去的状态,因此系统必须区分内部模拟与外部执行。尽管验证器在内部维护多个分支,但最终的答案生成只基于一条从根节点到叶节点的单一路径——即“Top1路由”。
该路径由当前最高排名的分支回溯而成,保证了所有观测来自同一物理一致的轨迹。答案智能体(answer agent)基于这条路径上的所有后置动作观测,结合初始参考信息,生成最终答案、置信度及推理过程。
当答案的置信度超过预设阈值且答案格式有效时,探索过程终止;否则将继续推进至最大探索深度。这一机制既避免了跨路径信息混合带来的逻辑矛盾,又实现了高效的决策输出。

实验结果:显著提升主动推理性能
研究团队在 ESI-Bench 基准上进行了广泛实验,涵盖 28 个子任务类别,涉及感知定位、物理结构、动态行为、认知地图、枚举感知等多个维度。结果显示,ParallelWorld 在绝大多数任务中均优于传统的主动探索基线方法,尤其在时间理解与度量比较类任务中表现突出。
例如,在“未观察到的变化”任务中,准确率从 70.95% 提升至 89.86%;在“空间距离”任务中,从 58.55% 提高到 67.11%。即使在部分任务中,如“连通性”,虽然被动单视图方法表现最佳,ParallelWorld 仍实现了从 55.00% 到 60.00% 的提升。

此外,消融实验表明,采用动态保留宽度策略的 ParallelWorld 在平均准确率(59.56%)和运行效率(平均 350.6 秒/问题)之间取得了最佳平衡。相比之下,固定宽度设置(K=2,3,4)在某些任务上表现更优,但整体性能下降,说明固定的搜索策略难以适应多样化任务需求。


图 2 展示了一个典型案例:传统方法沿单一路径探索,因信息不足而得出错误结论;而 ParallelWorld 能够并行评估多个动作方向,验证器成功识别出能逐步暴露灯与投影仪相对位置的路径,最终帮助答案智能体正确作答。这直观体现了多路径模拟与智能筛选的价值。
局限与未来方向
尽管 ParallelWorld 显著提升了具身推理能力,但仍存在一些局限。
首先,其测试时计算开销较大,因为每个保留分支都需要遍历全部可执行动作。
其次,探索质量高度依赖于模拟器的精确性和验证器的可靠性。此外,仅保留单一路径可能导致部分互补信息被舍弃,影响全局判断。
未来工作可探索使用学习型分支剪枝模型、不确定性感知的验证器,以及分层动作提议策略,以进一步提升效率与鲁棒性。将该框架应用于真实机器人平台和动态开放环境,也是值得深入的方向。
结论
ParallelWorld 为具身智能体提供了一种全新的测试时扩展范式。它通过并行模拟未来世界、验证器引导筛选与顶一路由推理,使智能体能够在真实执行前系统性评估多种可能路径,从而做出更明智的决策。实验结果充分验证了未来世界模拟在增强具身推理方面的有效性,为构建更具自主性的智能体提供了新的思路。
> 本文由 Intern-S2 等 AI 生成,机智流编辑部校对
-- 完 --
机智流推荐阅读:
1.
2.
3.
4.
cc | 大模型技术交流群 hf | HuggingFace 高赞论文分享群 lc|LangChain 技术交流群 code | AI Coding 交流群 具身 | 具身智能交流群 硬件 | AI 硬件交流群 推理 | AI 推理框架交流群 智能体 | Agent 技术交流群