七校联合开源OpenWAM:机器人的「世界模拟器」来了

机器之心 2026-09-24 17:18
七校联合开源OpenWAM:机器人的「世界模拟器」来了图1

本文中,来自新加坡国立大学、清华大学、北京大学等七所高校的研究团队,最新开源 OpenWAM,面向世界动作模型的开源研究全栈与基座模型。




七校联合开源OpenWAM:机器人的「世界模拟器」来了图2

图 1  OpenWAM 总览:OpenWAM-Infra 提供模块化基础设施,OpenWAM-Study 提炼设计规律,OpenWAM-α 在大规模人类第一视角与机器人数据上验证方案。


当机器人需要完成一个动作时,仅仅识别眼前的物体还不够。它还要预测环境将如何变化,并判断哪些动作能够让变化发生。视频生成模型擅长学习世界如何随时间演化,机器人轨迹则提供可执行的动作监督。


OpenWAM 的核心思路,是把这两类能力放进同一个世界动作模型中,让模型一边理解可能发生的未来,一边学习如何改变未来。


论文标题为《OpenWAM: An Open, Modular Exploration Towards Systematic World–Action Model Pretraining》。研究团队将问题拆成三个层次:什么知识值得继承,世界建模和动作学习如何协同,以及这种协同如何跨数据域和具身形态扩展。全文的答案分别由 OpenWAM-Infra、OpenWAM-Study 和 OpenWAM-α 给出。


核心结论:OpenWAM 通过模块化基础设施把世界动作模型从紧耦合的单一实现,转化为可控、可复现的实验体系;研究结果表明,充足的生成式世界先验、紧凑且信息丰富的视觉表征、明确的世界到动作信息流,以及跨域具身预训练,是构建高性能 WAM 的关键。


为什么需要世界动作模型


现有机器人策略通常直接从机器人示范中同时学习视觉规律和控制信号。视觉语言动作模型则更多继承图像文本预训练带来的语义和语言知识。世界动作模型选择了另一条路径:从视频生成预训练中继承视觉动态先验,再通过具身经验学习在这个世界中采取行动。


这种路线面临一个现实的数据不对称。描述世界变化的视频很多,带有精确可执行动作标签的机器人轨迹却相对稀缺。世界建模可以补充视觉覆盖和动态知识,动作学习可以把这些知识锚定到控制目标,但二者能否真正形成协同,取决于模型结构、信息流、推理方式和数据配方的共同设计。


论文将问题归纳为三个研究问题:WAM 应该继承什么世界知识;继承的知识如何与动作学习建立有效协同;这种协同如何在不同领域、不同机器人形态之间迁移。


OpenWAM Infra 把研究变量拆开


OpenWAM-Infra 针对现有系统难以扩展、不同模块彼此干扰的问题,定义了四个有明确接口的部分:可组合模型、训练运行时、部署运行时和评测协议。模型由视觉编码器、不同的数据流骨干网络以及可见性注意力掩码组合而成;训练、部署和评测则使用统一的运行方式。这样,研究者可以只替换一个设计变量,观察它对结果的影响。


七校联合开源OpenWAM:机器人的「世界模拟器」来了图3

图 2  OpenWAM-Infra 的模块化设计。视觉编码器、数据流骨干网络和可见性注意力掩码可以独立替换,并组合成单系统、双系统和三系统架构。


在模型层面,OpenWAM-Infra 支持单系统、双系统和三系统三类架构。单系统让视频与动作共享主体网络;双系统为视频和动作分别配置骨干网络,再通过联合自注意力、交叉注意力或逆动力学模型连接;三系统在此基础上加入视觉语言模型理解流。不同架构都由同一套配置和注册机制装配,训练器与策略服务器不需要知道当前运行的是哪一种结构。


统一运行时还解决了实验落地中的细节问题。训练端支持预训练、微调和断点续训,检查点保存完整配置、模块重建信息以及动作归一化统计;部署端用同一个策略服务器承载不同模型,并提供同步或异步推理、不同去噪日程和多种加速方式;评测端通过轻量客户端连接服务器,使仿真环境和真实机器人遵循同一套输入输出接口。


目前的评测协议覆盖八个仿真基准,包括 LIBERO、LIBERO-Plus、VLABench、RoboTwin2.0、RoboDojo、RoboCasa365、EBench 和 RoboCasa-GR1,涵盖单臂、双臂、移动操作和灵巧手等具身形态。


OpenWAM Study 用受控实验回答三个问题


有了统一的实验底座,OpenWAM-Study 在 RoboTwin2.0 上固定训练预算和评测方式,逐步比较世界先验、架构容量、跨模态信息流、去噪日程和具身预训练配方。研究不把结果归因于某个孤立的超参数,而是沿着「继承 — 协同 — 整合」的顺序,将每一步得到的结论带入下一步。


先继承足够强的世界先验


研究首先比较了 1.3B、2B、5B 和 14B 四种视频生成骨干。随着骨干容量提升,WAM 的平均成功率持续提高:Wan2.1-VACE-1.3B 为 90.14%,Cosmos-Predict2.5-2B 为 91.64%,Wan2.2-TI2V-5B 为 92.39%,Wan2.1-I2V-14B 为 93.79%。14B 模型虽然最好,但 5B 模型只低 1.40 个百分点,训练与部署成本更易控制,因此被选为后续研究的默认骨干。论文也提醒,四个模型在结构、数据和目标上并不完全相同,结果说明骨干选择重要,但不能简单把收益全部归因于参数量。


七校联合开源OpenWAM:机器人的「世界模拟器」来了图4

图 3  不同视频生成骨干带来的 WAM 性能变化。容量更大的生成式世界先验通常带来更高的平均成功率。


七校联合开源OpenWAM:机器人的「世界模拟器」来了图5

OpenWAM Study 问题一配图 视觉表征先验比较。表征编码器经过时间压缩和维度收缩后,可以获得接近或超过重建型编码器的 WAM 性能。


视觉表征实验进一步说明,关键不在于编码器属于「重建型」还是「表征型」,而在于潜空间是否紧凑、是否保留丰富的世界信息。DINOv3 和 V-JEPA 2.1 等表征编码器直接产生高维特征时表现较弱,但经过 S-VAE 将维度压缩到适合 DiT 处理的空间后,性能显著提升;DINOv3 加 S-VAE 的结果已接近 Wan2.2-VAE。由此得到第一条原则:WAM 需要足够强的生成式骨干,同时需要在时间维和 token 维都更紧凑、信息密度更高的视觉潜空间。


再让世界信息真正流向动作


仅仅把世界流和动作流放进同一个模型,并不会自动产生协同。架构消融显示,模型容量从单系统增加到双系统、三系统时,平均成功率整体提升;双系统联合自注意力达到 92.36%,三系统联合自注意力达到 92.60%。在兼顾性能、复杂度和变量隔离后,研究选择双系统联合自注意力作为后续实验的基础。


七校联合开源OpenWAM:机器人的「世界模拟器」来了图6


七校联合开源OpenWAM:机器人的「世界模拟器」来了图7

OpenWAM Study 问题二配图 训练阶段的信息流掩码。让动作流看到世界流,是形成有效世界动作协同的必要条件。


信息流实验给出了更直接的答案。在 RoboTwin2.0-Full 上,孤立掩码和「视频看动作」分别只有 87.41% 和 87.63% 的平均成功率;让动作流看见世界流后,平均成功率达到 92.39%;双向互见为 92.15%。动作学习能否访问世界信息,是决定协同是否成立的关键。


七校联合开源OpenWAM:机器人的「世界模拟器」来了图8

OpenWAM Study 问题二配图 推理阶段的去噪规划。同步去噪沿联合噪声平面的对角线推进,在实验中表现最佳。


推理阶段的去噪顺序也被纳入比较。实验测试了同步去噪以及让视频流或动作流领先的异步去噪,结果显示同步去噪表现最好,没有一种异步去噪稳定超过同步方案。由此得到第二条原则:训练时必须建立明确的世界到动作信息流,推理时则应保持世界和动作的同步联合去噪。


具身预训练主要提升分布外泛化


第三组实验把问题从单一任务域扩展到跨域具身预训练。在相同的 600 小时预算下,研究比较了从零开始、仅机器人数据、先人类第一视角再机器人数据,以及人类第一视角与机器人数据单阶段协同训练。结果显示,预训练对域内表现的提升相对有限,却显著改善了 Clean2Random 设置下的分布外表现:从零开始的 OOD 成功率为 14.50%,机器人数据预训练为 23.80%,先人类后机器人为 26.50%,人类与机器人协同训练为 26.62%。


七校联合开源OpenWAM:机器人的「世界模拟器」来了图9

图 4  具身预训练主要改善分布外泛化。域内成功率变化较小,而在未见过的随机化场景中,预训练带来的提升更明显。


两类数据各有作用。机器人轨迹带来可执行的动作 grounding,因此机器人数据预训练的域内表现更强;人类第一视角视频带来更广的视觉和交互分布,因此混合策略的分布外泛化更好。单阶段协同训练与分阶段训练结果接近,但前者略优且省去额外的训练阶段切换,成为最终方案的默认选择。预训练还改变了信息流偏好:从零开始时单向世界到动作略占优势,具身预训练后,双向互见在域内和域外都更稳定。由此得到第三条原则:机器人数据保留动作 grounding,人类第一视角数据扩大世界覆盖,单阶段协同训练能够有效整合两者。


七校联合开源OpenWAM:机器人的「世界模拟器」来了图10

图 5  具身预训练改变信息流偏好。预训练后,双向互见相较于单向世界到动作在多个设置下获得提升。


OpenWAM Alpha 把规律扩展到大规模预训练


OpenWAM-α 将上述结论组合成一个可公开研究的基础世界动作模型。模型使用 Wan2.2-VAE 作为冻结视觉编码器,Wan2.2-TI2V-5B 作为视频流骨干,并配置一个 1B 参数的 ActionDiT 处理动作流。两个流通过联合自注意力交互,采用双向互见;语言指令和本体状态通过交叉注意力提供条件。


七校联合开源OpenWAM:机器人的「世界模拟器」来了图11

图 6  OpenWAM-α 的架构、数据与训练推理方案。模型在统一动作空间中联合预测未来视觉状态与动作,并在推理时沿同步对角线去噪。


为了让不同机器人形态共享一个动作头,OpenWAM-α 使用 80 维统一动作空间:两个镜像的 34 维手臂区块分别包含末端位置、6D 旋转、夹爪和灵巧手通道,另有 12 个预留槽位承载移动底盘等具身特定通道。每个数据集把自身的动作与状态映射到固定槽位,未使用的维度通过有效性掩码不参与训练。


预训练数据来自五个来源,包含人类第一视角视频、真实机器人数据和合成机器人数据。原始数据约 13.33 亿帧、约 14,300 小时;经过视觉质量筛选、机器人信号清洗和按来源采样后,实际训练集为 5.185 亿帧、约 6,369 小时。数据构成为:人类第一视角数据约占 30%,合成机器人数据约占 30%,三类真实机器人数据合计约占 40%。人类数据包含 7.16 万段长时第一视角记录,覆盖 3,006 类日常操作任务;真实机器人数据覆盖 17 个物理平台。


部署时,OpenWAM-α 使用同步推理和 10 步联合去噪。通过固定形状编译、CUDA Graph、速度缓存、提示词嵌入缓存以及跳过控制路径中的 VAE 解码,单个动作块在 RTX 5090 上约 170 毫秒完成。


仿真基准上的表现


OpenWAM-α 在八个仿真基准上接受评测,覆盖五类具身形态。论文报告显示,它在 LIBERO、VLABench、RoboTwin2.0-Full、RoboCasa365 和 RoboCasa-GR1 上处于第一梯队;在移动双臂基准 EBench 上达到当前最佳,SR 和 Score 均领先第二名约 4 个百分点;在 RoboTwin2.0-Clean2Random 和 RoboDojo 上,虽然与最佳 VLA 仍有差距,但均为 WAM 方法中表现最强者。


七校联合开源OpenWAM:机器人的「世界模拟器」来了图12

图 7  OpenWAM-α 与代表性 VLA 和 WAM 方法在八个仿真基准上的分数对比。各面板标注实际分数,便于按基准阅读。


LIBERO-Plus 是一个值得单独说明的例外。OpenWAM-α 的下降主要集中在相机和噪声扰动,也波及背景与布局扰动。论文将原因归结为两点:一是预训练数据中与单臂扰动测试接近的数据比例有限,二是像素潜空间上的长时未来预测对视角和噪声变化更敏感。这个结果也说明,模型在某个测试条件下的泛化能力,最终取决于预训练数据是否覆盖相近的具身形态和环境变化。


论文同时比较了 VLA 与 WAM。总体成功率不存在一方全面胜出的结论:WAM 借助未来视频潜变量监督,在分布内任务上更容易贴合训练分布;VLA 不承担长时未来预测,在分布外扰动下通常更稳健。两类不足都与数据有关,足够丰富、覆盖环境变化且带有精确动作标注的预训练数据,能够同时改善拟合与泛化。


真实机器人验证


研究进一步在三种具身形态上进行真实机器人实验:Franka-Research-3 单臂平台、RoboDojo 双臂平台,以及 Wuji 灵巧手与 Tianji 机械臂组成的灵巧操作平台。单臂实验包含堆叠、抓取放置和悬挂三类任务;双臂实验覆盖 ARX X5、Piper 和 Piper X 三种平台、共 18 个任务;灵巧手实验测试双臂交互、长时任务和精细操作。


七校联合开源OpenWAM:机器人的「世界模拟器」来了图13

图 8  三类真实机器人实验设置。上方为 Franka-Research-3 单臂任务,左下为 RoboDojo 双臂平台,右下为 Wuji 灵巧手与 Tianji 机械臂任务。


在单臂实验中,OpenWAM-α 六项任务平均成功率为 82.5%,高于 LingBot-VA 的 77.5% 和 π0.5 的 55.0%。其中「将辣椒放入抽屉」和「将积木放入抽屉」两项达到 100% 成功率。RoboDojo 双臂真实赛道上,OpenWAM-α 的整体平均分数为 37.6、平均成功率为 24.4%,在三种平台和多数任务上达到目前领先水平。


灵巧手实验尤其考验未见过的具身形态。Wuji 灵巧手与 Tianji 机械臂,以及 9 维末端位姿加 21 个灵巧手自由度的动作空间,都没有出现在 OpenWAM-α 的预训练混合数据中。微调后,OpenWAM-α 在玩具塔堆叠、羽毛球收集、衣物收纳和瓶盖旋拧四类任务的域内与域外设置中均明显超过 π0.5,说明统一动作空间和预训练先验可以支持模型适配新的机器人形态。


开放研究栈的意义


OpenWAM 的贡献不只是一组模型分数。OpenWAM-Infra 把模型、训练、部署和评测放入统一接口;OpenWAM-Study 用受控实验把经验判断转化为可检验的设计原则;OpenWAM-α 则把这些原则扩展到多来源、多领域和多具身数据。三者共同构成从研究问题、实验方法到可复用模型的完整链路。


论文发布了基础设施、评测协议、预训练权重和数据配方,旨在为世界动作模型研究提供可复现的共同起点。研究也明确指出,后续仍需要更大规模、更多样且带有精确动作标注的具身数据,更紧凑并且对环境变化更稳健的视觉表征,以及能够融合 WAM 与 VLA 优势的端到端设计。


七校联合开源OpenWAM:机器人的「世界模拟器」来了图14


© THE END 

转载请联系本公众号获得授权

投稿或寻求报道:liyazhou@jiqizhixin.com

关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。
开源 机器人
more
罗福莉带小米登顶全球开源榜首!大规模RL立功,斩杀Grok 4.7
开源鸿蒙走向千行百业 可靠硬件决定“连接”体验天花板
智谱ZCode陷“偷传代码”风波,官方致歉并承诺开源
GPT-6 Astra开进机器人身体!清华联手无问芯穹等开源RPent,92.6%成功率还快7倍
6天烧光2000多万,拿下开源第一!小米史无前例「炼丹直播」收官
开源王座易主?小米罗福莉发新模型:工程难度超DeepSeek-R1
开源Editable-Design,让AI生图终于能改字、拖图层
Baseten联手Hugging Face与Goodfire,为开源大模型筑起“安全防线”
DLSS 5“越狱”成功:开源项目OpenDLSS-NR让RTX 40系也能跑神经渲染
MiniMax 开源编程 Agent,实测更强更省钱!
Copyright © 2025-成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号