点击下方卡片,关注“具身智能之心”公众号
编辑丨具身智能之心
本文只做学术分享,如有侵权,联系删文
更多干货,欢迎加入国内首个具身智能全栈学习社区:(戳我),这里包含所有你想要的。
过去一年,围绕如何实现物理智能的讨论,日益聚焦于世界模型(World Model)这一关键词——世界模型通过建模环境如何演化,包括其中的物理规律与动态过程,使具身智能体有望理解、预测并与物理世界进行交互。
而李飞飞则将世界模型进一步分为三种主要类型:
渲染器(Renderer):生成具有视觉真实感的世界表征; 模拟器(Simulator):预测世界如何响应动作与物理交互并随之演化; 规划器(Planner):对可能的未来进行推理,并选择能够实现目标的动作。
渲染器和规划器都已经经历了数年的发展。以 Sora 和 Veo 为代表的渲染器,建模一个合理的未来应该是什么样子;而包括视觉语言动作模型(VLA)和世界动作模型(WAM)在内的规划器,则选择能够实现目标的动作。但二者之间仍然缺少一个因果环节:预测某个特定动作在给定环境中究竟会产生什么结果。
这关键的一环,正是模拟器。
通过建模动作如何引发机器人运动、接触、交互以及环境变化,模拟器将视觉预测和动作规划建立在对因果性与交互动力学的共同理解之上。这一观点也推动了研究界对动作条件世界模型(Action-Conditioned World Models,ACWM)的持续投入,使模拟器不再只是与渲染器和规划器简单并列的第三种类型,而是充当连接视觉渲染与动作规划的关键因果桥梁,使具身智能闭环得以协同运转。
然而,评测体系的发展并未跟上这一趋势。
现有方法往往仍从渲染器或规划器的视角评测世界模拟器:前者侧重视觉与语义保真度,后者则主要衡量下游策略的成功或失败。这两类方法都难以充分评估模拟器的核心能力,包括动作遵循、交互性、物理一致性和因果保真度。
因此,来自北京大学和 Evophys AI 的研究者认为,世界模拟器的评测需要一个全新的视角。
这一视角专门衡量模型能否准确捕捉动作所产生的结果。为此,他们提出了新的评测范式:WorldSimProbe。其核心问题是:
❝生成结果是否准确呈现了当前输入动作在当前场景中应当产生的未来?
WorldSimProbe 基于 18K+ 个跨平台受控实例,沿“输入动作 → 机器人运动 → 接触与交互 → 环境变化”的因果链进行逐段评测。它覆盖从动作实现到交互响应的完整过程,旨在定位总体指标容易掩盖的具体失效模式。

❝论文:https://arxiv.org/abs/2608.09298
项目主页:https://evophys.com/WorldSimProbe/
开源代码:https://github.com/pxxq25/WorldSimProbe
数据集:https://huggingface.co/datasets/petersonco/worldsimprobe_robotwin
对 ACWM 来说,生成得像,并不等于模拟得对
一个生成的未来可以看起来自然、连贯,并且符合任务语义,甚至最终完成了预期任务,但它仍然可能没有准确呈现输入动作所产生的实际后果。
例如,输入动作的幅度已经显著增大,但生成视频中的机器人运动却只发生了轻微变化;夹爪始终处于张开状态,物体却像被抓住一样随之移动;机器人只是从物体附近经过,并未形成有效接触,物体却仍然作出了响应;物体最终可能到达一个看似合理的位置,但其交互过程并不符合指定动作——例如,模型生成了推动,而输入动作要求的却是旋转或晃动。
这些失效揭示了一个关键区别:任务语义与视觉先验或许足以生成一个看似合理的未来,但合理性并不等同于因果正确性。模型知道某个场景中通常会发生什么,并不意味着它能够准确生成特定输入动作在当前场景中应当导致的结果。这些正是 WorldSimProbe 旨在识别和揭示的失效模式。
为什么 ACWM 要按 simulator 的标准评估
当 ACWM 被用于规划、策略评估、反事实预测或合成数据生成时,判断标准不能停留在视频是否逼真、任务是否成功。模型还要根据当前状态和输入动作,给出与之对应的机器人运动和环境响应。
WorldSimProbe 因而从一个基本判断出发:一个好的 ACWM,首先应该是一个好的 simulator。 论文用 simulator faithfulness 描述模型作为 simulator 时,对输入动作及其物理后果的呈现是否准确。这并不是 ACWM 的全部能力,而是用于明确:生成结果至少应满足哪两层关系。论文将这套标准称为 Observable Simulator Contract。
第一项是 Action Realization(动作实现):输入动作需要在生成结果中转化为相应的机器人运动。动作的方向、幅度、速度或时间结构改变时,机器人轨迹也应作出尺度相符的变化,而不是只生成一段大致符合任务语义的运动。
第二项是 Interaction Response(交互响应):物体和环境的变化必须建立在生成结果中实际出现的机器人运动与接触关系之上。接触确实发生后,环境还应按照相应的交互方式继续变化。

两者连起来,就是一条连续的 simulator causal chain:
输入动作 → 机器人运动 → 接触与交互 → 环境变化
这条链还带来一个容易被任务评测忽略的问题:任务数据中的常见动作,只覆盖当前场景所有物理可执行动作的一部分。模型会生成“这项任务通常怎样完成”,并不等于它能处理这个场景中的其他物理可执行动作。作为 simulator,ACWM 还需要在动作偏离常见任务分布时,准确呈现相应结果。

简而言之, WorldSimProbe 的设计就是 One Standard, One Chain:以 Observable Simulator Contract 作为统一标准,再沿这条因果链逐段检查。

沿因果链设置五项评测
WorldSimProbe 沿这条链设置了五项任务。T1–T3 对应动作实现,依次覆盖局部动作差异、全局轨迹差异和不同执行方式;T4–T5 对应交互响应,分别判断交互是否具有真实接触依据,以及交互发生后是否按照正确过程展开。
Action Realization:动作如何转化为机器人运动
T1 Local Action Calibration(局部动作校准)
T1 区分两个经常被混在一起的问题:模型是否会响应动作,以及响应幅度是否与 simulator 一致。WorldSimProbe 从一条成功动作序列出发,在固定时间窗内对同一个非夹爪动作维度施加小幅和大幅扰动,再比较模型生成结果与 simulator 参照在原始、小扰动和大扰动三种条件下的相对变化尺度。即使视频随动作发生了变化,如果两种扰动产生的差别被明显压缩,动作实现仍然不准确。

T2 Global Trajectory Coverage(全局轨迹覆盖)
除了局部动作校准,还需要检查模型能否执行差异更大的完整轨迹。T2 将其他任务中的动作放入当前场景重新执行,只保留经 simulator 确认、在物理上可行的轨迹。场景与动作原本所属的任务由此被分开,模型不能只凭场景补出“这项任务通常怎么做”。

为比较生成运动与 simulator 参照,论文使用 Robot-Masked Flow Alignment(RMFA)。它在 simulator 参照给出的机器人运动区域内,对比时间对齐后两段视频的稠密光流;机器人运动的方向、幅度或空间位置出现偏差,都会拉低得分。这样可以避免用整帧画面的视觉相似度代替动作判断。
T3 Action-Source Behavior Preservation(动作来源特征保持)
T3 把范围进一步推进到同一任务中的不同执行方式。目标相同,不代表执行过程相同。 专家策略、人类操作者、训练早期策略和训练后期策略在速度、停顿、纠正方式、平滑程度和执行策略上都可能不同。论文同时纳入了成功与失败、但仍指向同一任务的轨迹,检查这些来自输入动作的特征是否保留在生成结果中,而不是被统一改写成一条“标准动作”。

Interaction Response:接触是否成立,过程是否正确
动作实现只是因果链的前半段。即使机器人运动已经正确生成,物体仍可能在没有接触依据的情况下移动,或者以错误的方式响应。
T4 Interaction Grounding(交互接触验证)
T4 构造了三类不应让被评估物体产生无依据交互的条件:加入应保持静止的无关干扰物、把目标移到机器人轨迹附近但不会形成有效接触的位置,以及制造视觉上很像接触、但控制状态明确不允许形成有效接触的虚假接触。最直观的例子是机械臂仍沿原轨迹运动,夹爪却被强制保持张开;simulator 已确认这一条件不会形成有效抓取。如果物体仍像被抓住一样移动,模型便产生了接触幻觉(Contact Hallucination)。

T5 Interaction Dynamics(交互动力学)
T4 回答“交互是否应该发生”,T5 继续检查“发生以后是否正确”。推、拉、拖动、旋转、晃动、轻触、推倒和释放掉落等交互原语,有时会产生相似的最终状态,但所需的机器人运动、接触方式和物体响应并不相同。T5 因而联合检查交互原语、机器人运动与物体随时间变化的过程,不能只看物体最后是否发生位移。

五项任务沿同一条链覆盖不同环节:从动作有没有按正确尺度变成运动,到更大范围的轨迹能否覆盖,再到具体执行方式能否保留;随后继续检查接触是否成立,以及环境是否给出了正确的动力学响应。
18K+ 个受控实例,如何建立可核验的参照
沿因果链诊断模型,首先要知道每个动作在当前场景中应该产生什么结果。WorldSimProbe 的做法不是从模型输出中挑选可疑案例,而是先用 simulator 建立可验证的参照:采样任务和场景,针对不同评测任务施加受控干预,在 simulator 中重新执行,检查参照是否有效,冻结最终评测清单,随后才运行模型推理。
所有参照筛选都在推理前完成,并且不查看模型输出。T2 和 T3 的机器人区域掩码只根据 simulator 参照计算;T4 的无接触条件先经过 simulator 验证,再用机器人运动门控排除“机器人没有动”造成的伪通过。这些设计避免评测条件随着模型表现而改变。
最终 benchmark 包含 18,608 个筛选后的受控实例:RoboTwin 覆盖 50 项任务、5,498 个实例,ManiSkill 覆盖 11 项任务、6,610 个实例,LIBERO 覆盖 40 项任务、6,500 个实例。论文评估了六个开源 ACWM:IRASim、Ctrl-World、BWM、DreamDojo、LingBot-VA 和 Cosmos-3-Nano。
实验中出现的几类典型失效
沿这条因果链展开结果后,一些总体指标容易掩盖的问题变得清楚:模型会响应动作,不代表响应尺度正确;任务目标相同,不代表执行细节得到保留;视觉上像接触,不代表物理接触真的成立;物体动了,也不代表交互过程正确。
模型会响应动作,但响应尺度可能严重失真
在 RoboTwin 的 50 项任务中,六个模型都出现了不同程度的动作响应衰减:随着输入扰动增大,生成结果中的机器人运动没有按照 simulator 的尺度同步变化。
ManiSkill 的 StackCube 给出了更直观的个案:LingBot-VA 和 Cosmos-3-Nano 的首次持续失败阈值,分别达到 simulator 阈值的 7.48 倍和 35.6 倍。

越偏离熟悉的执行方式,轨迹细节越容易丢失
T2 和 T3 从两个尺度观察到相近趋势。跨任务轨迹的差异逐步增大时,动作保真度随之下降。在 RoboTwin 上,将接收场景与供体动作之间的运动差异划分为十个区间后,六个模型平均 RMFA 与差异呈负相关(Spearman ,95% CI )。

问题并不只出现在跨任务动作上。同样是在 RoboTwin 中,六个模型对训练后期策略的行为保留得分,都比训练早期策略高 10.8–16.1 分,直接说明训练早期策略的运动保留得更差。这与定性结果中观察到的现象相一致:训练早期轨迹里常见的停顿、修正和不够平滑的执行方式,更容易在生成结果中消失。

这意味着,模型可能更多依赖与任务或场景相关的常见运动模式,而没有充分利用输入动作中的轨迹细节。
视觉上像接触,不等于物理接触真的发生
在 T4 的三类无接触条件中,虚假接触明显最具挑战。按照六个模型和三个平台的宏平均口径,虚假接触得分为 38.6,低于无关干扰物和空间接近条件。

物体动了,也不代表交互过程正确
T5 显示出明显的原语差异。shake(晃动)在六个模型中的得分只有 0.0–1.2,几乎没有被完整模拟;相比之下,tap(轻触)达到 40.8–56.9。六个模型各自的交互动力学平均分也只有 17.7–21.8。

要把晃动判为正确,持续抓持、周期性的机器人运动、稳定接触和物体同步响应必须同时成立。如此低的得分说明,这组要求在当前设置中很少被同时满足。少一个环节,最终画面可能仍然自然,却不是正确的交互过程。

Overall 能概括表现,却难以定位具体错误
以 LingBot-VA 在 ManiSkill 上的结果为例,五项任务在 0–100 量表上的无权平均分 Overall 为 63.5。拆开以后,T2 为 82.5,T4 为 76.3,T5 却只有 15.8。同一个总体分数背后,可能是一张差异很大的能力画像:全局轨迹覆盖和交互接触验证得分较高,具体交互动力学却明显较弱。

所以,总体得分能反映模型的平均表现,却很难说明失效发生在哪一环。WorldSimProbe 的重点是定位这条因果链中的具体问题,而非制造一张模型总榜。
评价器是否测到了正确的问题
一套诊断框架还必须回答:评价器识别的究竟是动作和交互错误,还是另一个同样容易受视觉合理性影响的替代信号?论文围绕这个问题比较了 RMFA、粗粒度视觉语言模型(VLM)和逆动力学模型(Inverse Dynamics Model,IDM),并对来自六个 ACWM 的 750 条生成轨迹进行了人类评审。
RMFA 比较生成结果与 simulator 参照中的机器人运动。在 T2 和 T3 中,机器人区域掩码只来自参照侧,模型输出不会反过来改变评价区域。

在由训练早期策略和跨任务动作组成的多样化/分布外动作组(Diverse/OOD)中,RMFA 与人类对“生成视频是否复现 simulator 参照行为”的 1–5 级评分达到 的 Spearman 相关。其中,动作和机器人运动相符是达到 3 分及以上的前提,4–5 分还要求环境响应更接近参照。
受控扰动实验给出了另一层验证。在 50 条 T2 simulator 参照中,破坏机器人区域使 RMFA 平均下降 30.55,破坏等面积背景区域时下降 7.93;随着机器人区域扰动增强,48/50 条轨迹的分数单调下降。
在同一组 Diverse/OOD 样本中,粗粒度 VLM 将 91.7% 判为正确跟随动作,而人类标注的正例只有 **42.2%**,二元判断一致率为 0.450。这表明 VLM 在当前陌生动作条件下明显偏向正判。论文据此认为,粗粒度视觉判断可能把画面上合理的结果当成了动作遵循。
IDM 暴露的是另一类问题:评价模型本身也会发生分布偏移。即使输入完全正确的 simulator 参照,它在专家策略、训练早期策略和跨任务动作上的 Micro-MSE 也会由 0.051 → 0.156 → 0.283。在当前设置中,IDM 可能把自身面对动作来源变化时产生的分布偏移混入 ACWM 误差。
这也说明,直接依赖动作估计模型来评估 ACWM 可能存在局限:当评价器自身可靠的动作分布与被评模型所覆盖的动作分布不一致时,世界模型误差与评价器的分布外误差可能被混在一起。
simulator faithfulness 与下游使用
论文还用一个 RoboTwin 合成数据案例,考察这些差异是否只存在于评测结果中。
研究者使用不同 ACWM 生成的数据训练策略。面对熟悉的常规动作时,策略成功率集中在 **78%–89%**;换成分布外动作后,范围扩大到 **21%–53%**。常规动作下不明显的模型差异,在更陌生的动作条件下被拉开。
更重要的是,只看熟悉任务分布中的下游成功率仍可能低估模型的模拟缺陷:如果评测没有覆盖偏离任务分布、但物理上仍可执行的动作,一些关键的动作条件模拟问题可能继续被最终任务指标掩盖。

从 World Model 走向可信的 World Simulator
ACWM 正越来越多地被视为可用于规划、策略评估和数据生成的可扩展预测 simulator。但要真正承担这些角色,仅仅生成视觉上逼真的未来还不够:模型还必须忠实保留当前输入动作实际会带来的后果。 WorldSimProbe 提供了一种真正可量化的方法。它从 Observable Simulator Contract 出发,沿着 输入动作 → 机器人运动 → 交互 → 环境响应 的完整因果链展开评测,并将 simulator 保真度拆解为五项具体能力。实验结果也说明了为什么这种拆解是必要的:一个模型即使在任务层面看起来表现不错,仍可能压缩动作效应、回到熟悉行为模式、产生 Contact Hallucination,或无法正确还原具体的交互动力学。
因此,WorldSimProbe 提出了一种不同的 ACWM 评测视角。随着 world model 在具身决策系统中承担越来越核心的角色,评测也需要从“生成的未来是否合理、是否符合任务语义”,进一步转向一个更关键的问题:它生成的,是否真的是当前输入动作应该导致的未来? WorldSimProbe 将这一问题转化为一套透明、标准化、可诊断的评测框架,也为后续衡量和提升具身 world model 的 simulator 能力提供了基础。
目前,WorldSimProbe 已开放 18K+ 个跨平台受控评测实例,并提供交互式体验。论文、开源信息与在线演示可在项目官网查看:
WorldSimProbe 项目官网:https://evophys.com/WorldSimProbe/
推荐阅读 :
