点击下方卡片,关注【Xbotics具身智能实验室】公众号
你想要的这里都有~~
物理引擎和视频世界模型的能力正在快速进步,也为物理智能研究带来更大的想象空间。但在性能指标之外,还有一个更根本的问题:这些系统只是生成了“看上去合理”的运动,还是已经能够较准确地复现碰撞、摩擦、振荡、动量传递以及不同材料的形变过程?当前研究常常知道模型“能力很强”,却很难准确描述它的物理适用边界。原因之一,是现有评测存在明显割裂:物理引擎往往在各自设计的环境中测试,世界模型则更多依赖视觉相似性或人工主观判断;不同系统的结果难以放到同一坐标系中比较,复杂差异也常被压缩为单个平均分。更重要的是,单条轨迹、合成数据或主观观感很难解释误差究竟来自哪一种物理机制,也无法把真实实验自身的随机波动与模型造成的系统偏差区分开来。
针对这一问题,上海人工智能实验室提出物理保真度评测基准 GAUGE。它以多次真实实验获得的数据作为参照,在统一框架下系统检验物理引擎和世界模型对刚体、绳索、织物及三维软体等对象的物理刻画能力。
GAUGE 依托 16 台运动捕捉相机,在 22 类受控实验场景中获得约 1560 条真实测量数据,并且还提供与任务匹配的实测物理参数,例如刚体接触中的摩擦系数和恢复系数、织物的拉伸与弯曲刚度,以及柔性材料的杨氏模量和泊松比等。团队据此设计了两条相互补充的评测路线,分别对应物理引擎与视频世界模型。评测关注的不只是画面是否逼真,还进一步检查运动是否遵循正确的方程结构、参数量级是否贴近现实、误差是否随时间放大,以及材料或提示条件变化后规律能否保持稳定。由此,系统的偏差可以落到具体物理机制上,研发人员也能更明确地找到优化方向。

技术报告:arxiv.2608.05948v1

1.从整体位移走向局部形变:把更复杂的物理过程纳入评测
不少传统物理测试偏向规则物体、短时间运动和单次接触,这些场景便于搭建,却也可能掩盖系统的真实短板:滑动方向对了、摆动具有周期、布料最后落在“差不多”的位置,并不等于模型真正掌握了相应物理规律。
GAUGE 因此把测试范围扩展到更高速、更强耦合、形变自由度更高的情形。为精确记录不同对象在交互中的 4D 轨迹与局部形变,研究团队在 2 m × 2 m × 2 m 的实验空间中布置 16 台 NOKOV Mars9H 红外动捕相机,以 180 Hz 采集标记点状态;每个任务场景还进行约 20 次独立重复实验,用于估计真实实验本身的试次波动。

其中,8 类刚体任务涵盖斜面接触、非光滑接触、滑动、转台、弹跳、牛顿摆和单摆等典型过程,从普通碰撞与摩擦逐步延伸到冲击以及能量、动量传递。
1 类柔性绳索任务面向准一维链式结构,考察弯曲、自接触等耦合行为,为刚体实验难以涉及的自由度提供补充。
6 类织物任务面向准二维结构,覆盖拉伸、弯曲和高速甩动等状态,用于区分系统在准静态形变与高加速度动态过程中的表现。
7 类体积软体任务则包含拉伸、剪切、扭转和弯曲,把材料本构、体积约束、接触处理与数值稳定性放在同一套测试体系下考察。
2. 共用同一套现实参照,分别评估物理引擎与视频世界模型
2.1 物理引擎路线:参照真实实验,而不是用另一个模拟器当答案
在物理引擎部分,团队使用 Isaac Sim、Genesis 和 Newton 重建 14 类代表性场景,重点考察三款引擎在“开箱即用”状态下的表现。实验标定得到的真实物理参数会被直接用于场景设置,其余配置保持默认,不针对单个任务做额外调优。为了让不同对象能够在统一框架中比较,研究者分别用三维位置、标记点高斯曲率和三角网格面片面积描述刚体、织物与体积软体的“广义轨迹”,再通过均方根误差(RMSE)、动态时间规整(DTW)等指标衡量仿真结果与真实实验分布之间的距离。
2.2 世界模型路线:先从视频提取轨迹,再检验背后的动力学
对于视频世界模型,GAUGE 在 5 类刚体任务上测试了 Cosmos3-Nano、Cosmos3-Super-I2V、Wan-2.2、Wan-2.7、Seedance 2.0 和 Genie 3 共 6 个模型。所有模型接收一致的初始图像与标准化文本提示来生成后续视频,之后借助 SAM3 在像素空间中跟踪目标并恢复运动轨迹。评测进一步判断这些轨迹是否符合预期物理方程的结构、由轨迹反演出的参数是否处于合理范围,以及物理条件改变时运动是否做出相应变化。相比只看生成质量,这种方法更接近于检验模型是否真正学到了训练数据背后的物理规律。

3. 物理引擎结果:不存在通吃所有场景的求解器
实验显示,三款引擎都各有擅长的任务,但当测试转向复杂接触、强冲击、织物快速运动或软体形变时,领先顺序会频繁变化。因此,GAUGE 的目标不是给出一个简单的“最佳引擎”结论,而是刻画不同引擎在具体物理机制上的可信范围。对于训练和评估流程来说,知道“什么条件下可以相信它”往往比一个跨任务平均分更有实际意义。

在常规接触与摩擦场景中,部分结果已经接近真实实验的波动范围。Isaac Sim 在斜面接触、非光滑接触和转台任务上的误差最低,其中转台任务的归一化 RMSE 仅为 0.17;Genesis 则在以摩擦为主的斜面滑块任务中取得 0.58 的归一化 RMSE,表现领先。
但在高速冲击和动量传递问题上,现实差距依旧明显。弹跳球任务即使取三款引擎中的最佳结果,归一化 RMSE 与 DTW 仍分别达到 15.63 和 5.58;牛顿摆测试中,Isaac Sim 与 Newton 的动量传递效率只有 0.20 和 0.26,而 Genesis 没有得到有效的 rollout。
大幅度、高速度的材料形变同样是当前仿真的难点。织物弯曲、快速甩动以及海绵等体积软体形变任务中,即便最佳归一化误差也显著高于现实参考值 1,说明材料响应、接触行为和高速动力学仍难以被现有引擎精确复现。
综合各类任务,没有一款物理引擎能够始终占优:Isaac Sim 在常规刚体轨迹复现方面更突出;Genesis 在复杂织物运动和多数体积柔性体任务中表现更好;Newton 则在部分物理规律相关指标以及海绵弯曲任务上体现出优势。
4. 世界模型结果:轨迹形式正确,不代表物理参数也正确
从测试结果看,现阶段世界模型更像是在调用训练数据中常见的视觉运动模式,而不是稳定地执行一套具有真实参数尺度的动力学规则。对于需要据此进行决策和规划的系统而言,“未来画面看起来合理”与“未来状态足以支持行动”之间仍然存在不小的鸿沟。



短时间内呈现“匀加速”的外观,并不能保证加速度数值正确。 在弹跳球测试中,Cosmos3-Super-I2V 加入负向提示词后取得最低 QFI 12.50,意味着轨迹形态更接近预期;但由此估计出的加速度只有 0.088 m/s²。所有被测模型中,最接近真实重力加速度的结果也只有 1.84 m/s²,与 9.81 m/s² 仍相差很远。这里的负向提示词用于减少不期望状态、视觉伪影或明显违背物理的生成结果。
周期运动也会出现“形状对、时间错”的情况。 Wan-2.2 与 Genie 3 在单摆任务中的 R² 都达到 0.99,生成视频也能看到清晰而规则的振荡;然而,两者预测周期分别为 1.93 秒和 1.90 秒,而真实实验为 1.06 秒。也就是说,模型抓住了类似简谐振荡的轨迹形态,却没有恢复正确的时间尺度,同时阻尼的方向与大小也缺乏稳定性。
材料一旦改变,模型排名和参数误差也会随之变化。 斜面滑动实验中,木材、塑料和金属对应的最低 QFI 分别由不同模型取得,表明目前还没有稳定的跨材料领先者。参数层面的差距更明显:木材条件下最佳加速度为 2.06 m/s²,与实测 2.58 m/s² 尚较接近;塑料和金属条件下最接近真实值的结果分别只有 0.75 和 0.43 m/s²,而实测值为 2.57 和 2.67 m/s²。这说明模型对材料变化所带来的动力学影响尚未形成可靠理解。
负向提示也不能被视为普遍有效的“物理增强”手段。 同一套负向提示可将 Cosmos3-Super-I2V 在弹跳球上的 QFI 从 270.69 降到 12.50,也可以帮助 Wan-2.2 生成此前失败的牛顿摆;但在 Cosmos3-Super-I2V 的木质斜面任务上,QFI 反而会从 13.61 上升至 569.36。换言之,提示词带来的收益高度依赖具体模型和任务,某一次改善不能直接推断为整体物理能力提升。
5. 超越单一排名:用可诊断的指标推动研发闭环
GAUGE 更重要的作用,并不是给某个系统贴上“已经理解物理”的标签,而是提供一套能够持续扩展的测量框架:把系统优势呈现出来,把失败原因落到具体机制,并让模拟器和世界模型的能力提升最终接受真实实验的校验。
对于物理引擎研发团队,GAUGE 可以把以“反复调参”为主的迭代方式,转向按物理机制制定验收标准。团队能够结合任务类型与材料属性设置合理的误差容限,而不是仅凭一个平均误差判断版本是否可用。比如织物快速甩动出现偏差时,可以进一步判断问题更可能来自局部高加速度、自碰撞响应还是离散耦合,而不是笼统地归结为“布料效果不好”。
对于世界模型研发团队,视觉生成质量和物理一致性应当被拆成两条独立的优化轴。画面更清晰、更连贯,并不自动意味着物理推演更可靠。借助 GAUGE,可以分别观察视觉连续性、动力学方程结构、物理参数以及时序稳定性,再据此决定是增加交互数据、加入动力学约束,还是重新设计长时序一致性的训练方式。
对于具身智能研究者,这套基准还能为模拟环境或世界模型进入智能体训练与规划流程提供更明确的物理门槛。底层仿真一旦存在系统偏差,这些偏差可能沿数据生成、模型训练和真机部署逐级传播甚至放大。因此,GAUGE 不只给出静态排行榜,更希望形成一套谨慎的使用依据:哪些物理机制已经接近真实工况、哪些环节仍然必须由真实机器人或真实实验完成最终验证。
-END-
Ask Me Anything|提问箱
对文章有疑惑,或想聊更深?欢迎把你的问题丢给我们:技术方案、实操踩坑、课程与资料、项目合作、职业发展,都可以问。
怎么问:在评论区留言,或私信公众号
我们会做什么:每周集中整理高质量问题并公开回复,重点问题邀请作者或嘉宾深度解答;典型问题会加入知识库并持续更新。
提问小提示:尽量说明「你的目标—当前做法—期望产出」,附上必要信息(硬件/软件版本、数据规模等),能更快获得有用答案。
一起把问题变成知识,推动社区进步 🚀