李飞飞团队造了个世界动作模型:换个底座,机器人成功率直接飙升

机器之心 2026-10-08 20:18
李飞飞团队造了个世界动作模型:换个底座,机器人成功率直接飙升图1
编辑|Panda

9 月 22 日,以 FLUX 图像模型闻名的 Black Forest Labs 跨界发布了开源 7B 世界动作模型 FLUX 3 Action。据其官方博客,该模型在英伟达 RoboLab-120 榜单上超过了此前最强的开源模型 Cosmos 3 Nano,参数量却不到后者一半。一家做图像生成的公司跑来卷机器人控制,说明视频模型里积累的「物理直觉」正被越来越多的团队当作机器人大脑的底座。


这条路线即所谓世界动作模型(World-Action Model,WAM)。自今年 2 月英伟达在 DreamZero 论文中明确提出这一术语以来,相关论文快速涌现。但热闹背后有个尴尬的问题:这些系统几乎都同时换了视频骨干、训练数据、视频与动作的交互方式和推理流程,谁也说不清究竟是哪个设计带来了提升。


本周,斯坦福大学李飞飞、吴佳俊、Ehsan Adeli 等人的团队发布论文,提出开放的世界动作建模框架 OpenWAM,试图给这个问题一个系统性的回答。


李飞飞团队造了个世界动作模型:换个底座,机器人成功率直接飙升图2

OpenWAM 框架总览:三阶段训练、共享 MoT 架构、四种可配置交互方式,以及可冻结复用的局部动力学模型。


李飞飞团队造了个世界动作模型:换个底座,机器人成功率直接飙升图3



为什么需要一张「统一考卷」


传统的视觉-语言-动作模型(VLA)像一个凭条件反射开车的司机,看到画面、听到指令就直接给出动作。


WAM 则多了一步「脑内预演」:同时预测接下来几秒画面会怎样,以及为此该怎么动。视频天然记录了物体如何下落、碰撞和被推动,用海量视频预训练过的模型因此自带物理先验。


问题在于,「预测画面」和「生成动作」可以有很多种耦合方式:先想象再动作,先动作再想象后果,两者同时生成,或者各算各的。各家选择不同、底座和数据也不同,放在一起比较,就像几位厨师同时换了食材、灶具和下锅顺序,很难判断菜好吃究竟归功于哪一步。


第二个问题更隐蔽。机器人训练数据大多是成功示范,只告诉模型「正确的路怎么走」,几乎不包含「手多伸出去两厘米会怎样」。这好比只看过教练完美绕桩录像的学员,记住了路线,却不懂方向盘打多少车会偏多少。


OpenWAM 对前者的回答是共享底座加可切换的交互方式,对后者的回答是大规模「反事实」数据。


同一副骨架,四种「先想还是先动」


OpenWAM 从阿里开源的视频模型 Wan2.2-5B 出发,先在约 334 万条机器人与人类交互视频上继续预训练,名义时长约 1.46 万小时,全程不用动作标签,在 32 块 B200 上训练了 14 天。


关键改动是「因果化」:每个视频块只能看到当前及之前的内容,不能偷看未来。原来的模型像拿着整本剧本反复改台词,现在则要像直播一样按时间顺序往下演,这正是机器人逐步行动所需要的。


随后,团队用 Mixture-of-Transformers(MoT)架构把 5B 的视频专家和 2B 的动作专家拼在一起。两者各自保留归一化、投影和前馈层,只在一层联合注意力中交换信息。


李飞飞团队造了个世界动作模型:换个底座,机器人成功率直接飙升图4

共享 MoT 架构,视频专家与动作专家在打包后的 token 上做联合注意力。


在这副骨架上,团队定义了四种「交互程序」:



这像同一支乐队演同一首曲子,变的只是谁先起奏、彼此能否听见。四者共用底座、tokenization 和 flow matching 目标,唯一的变量是生成顺序和跨模态注意力,比较因此有了「控制变量」的意味。


李飞飞团队造了个世界动作模型:换个底座,机器人成功率直接飙升图5

四种交互程序(A–D)与两种局部动力学程序(E–F)的注意力掩码。


把「动作翻译器」拆出来单独训练


论文更具新意的部分,是把逆向动力学模型(IDM)和正向动力学模型(FDM)拆成可独立训练的组件。


IDM 像翻译:输入当前画面、机器人本体状态和一段想象出的未来视频,输出具体动作;FDM 则反过来,根据动作预测画面会变成什么样。


关键在于「局部」:两者都不接收任务指令和更早的历史,只关心「这一小段画面变化对应什么动作」。因此它们不绑定具体任务,可以和任何兼容的视频预测器拼接,视频模型决定「该发生什么」,IDM 负责「怎么做到」。


但只学过成功示范的翻译器见识太窄。为此团队构建了 LIBERO-Long-CF 数据集:恢复示范中的仿真器状态,执行被改动过的动作,比如停止、反向、加噪声、改变夹爪开合时机等,共得到 32000 个片段、约 410 万条控制记录,是原始示范的 29.7 倍,其中 72.3% 的片段改变了物体的摆放状态。很多分支根本完成不了任务,但这正是重点。回到驾校的比方,这相当于教练让学员故意多打半圈方向盘,学员记住的不再只是路线,还有车本身的脾气。


实验:底座很能打,翻译器能搬家


在 LIBERO 四个子集上,四种交互程序的成功率都很高,VTA 平均达 98.6%,略高于论文引用的 LingBot-VA(98.5%)和 π0.5(96.9%)等已报告结果。不过 LIBERO 已接近饱和,更值得关注的细节是:在 LIBERO-Long 上,未来部分互不可见的 Decoupled(97.0%)与双向交互的 Joint(96.6%)不相上下。


李飞飞团队造了个世界动作模型:换个底座,机器人成功率直接飙升图6

四个 LIBERO 子集上的闭环成功率(%),基线为已报告结果。


真机上,团队用两台 Franka FR3 机械臂测试了烤面包、还原 2×2 魔方最后一层和按颜色分拣杯子,VTA 和 Joint 平均成功率分别为 92.1% 和 91.9%。


李飞飞团队造了个世界动作模型:换个底座,机器人成功率直接飙升图7

左为三项真机双臂任务,右为用于组件迁移的四个 LIBERO-90 任务。



消融实验显示了底座的分量:其他条件不变,用原版 Wan2.2 初始化时 VTA 在 LIBERO-Long 上只有 68.4%,换成机器人视频预训练的因果底座后升至 97.8%,提升 29.4 个百分点。作者强调,这是数据与因果化改造的共同效果。


李飞飞团队造了个世界动作模型:换个底座,机器人成功率直接飙升图8

视频骨干初始化方式对 LIBERO-Long 成功率的影响。


最关键的是组件迁移实验。团队把在 LIBERO-Long 上训练的 IDM 冻结,搭配针对四个 LIBERO-90 新任务调整过的视频预测器。


结果,示范加反事实数据训练的局部 IDM 平均成功率达 84.0%,而接收完整上下文的 IDM 只有 47.0%,只用示范训练的局部 IDM 更是只有 21.5%。


「只看局部」和「见过足够多样的后果」缺一不可,两者结合才得到一个能搬家的动作翻译器。 需要注意的是,目标任务上的视频预测器用含动作标签的示范微调过,这并非零样本迁移,作者对此有明确说明。


李飞飞团队造了个世界动作模型:换个底座,机器人成功率直接飙升图9

冻结 IDM 迁移到四个 LIBERO-90 任务的成功率。


FDM 的结论一致。从同一状态出发执行 16 种不同动作,让模型判断预测画面对应哪个真实结果,随机猜测约为 6%,只用示范训练的 FDM 为 21.1%,加入反事实数据后升至 71.3%,模型终于能分清「这样推」和「那样推」的区别。


李飞飞团队造了个世界动作模型:换个底座,机器人成功率直接飙升图10

局部 FDM 在反事实转移上的预测表现。


结语


作者也坦承了局限:组件复用主要在仿真中验证,真机上「故意做错」的成本高得多;FDM 也只覆盖短时程预测。但 OpenWAM 的价值不在于又多刷了零点几个百分点。在 WAM 论文以周为单位涌现的当下,一个固定底座、只改一个变量的公共试验台,能帮助领域从「谁的分更高」转向「为什么更高」。而可复用的动作翻译器则暗示,未来的机器人大脑或许不必是整体训练的黑箱,负责想象与负责落地的模块可以各自迭代、按需拼装。那些没能完成任务的轨迹,恰恰是让模型理解物理世界的养料。


目前,团队已开源训练、评测与组合代码,以及预训练视频模型权重。


李飞飞团队造了个世界动作模型:换个底座,机器人成功率直接飙升图11


© THE END 

转载请联系本公众号获得授权

投稿或寻求报道:liyazhou@jiqizhixin.com

关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。
功率 机器人
more
倍思新国标移动电源用上这颗国产功率电感!
数据中心VPD (垂直供电)-->高效率&功率密度
从电网到算力:东芝的功率半导体新版图
驱动、功率,正在塞进MCU中
AI时代下的 RTL 功率评估和优化
拆解飞利浦汽车搭电宝:12V 输出 500A,这么恐怖的功率是怎么实现的!
PCIM Asia 2026:东芝半导体联手本土功率厂商,剑指SiC高压全场景应用
直播报名|AI时代下的 RTL 功率评估和优化
香港首个五年规划发布,功率半导体被提及
直播:AI时代下的 RTL 功率评估和优化
Copyright © 2025-成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号