人大&星源智最新!JEPA-WAM:不生成未来视频,也能让机器人学会预测世界变化

具身智能之心 2026-08-18 18:00

点击下方卡片,关注“具身智能之心”公众号



01.

🤖 为什么 VLA 还需要“世界模型”?


现在机器人在熟悉的训练环境里,已经能稳定完成抓取、放置、开抽屉等任务;但如果换一个背景、挪一下物体位置,或者改变相机视角,原本稳定的策略就可能失效。对于现在的 VLA 来说,这类视觉和空间分布变化仍然是一个泛化问题。

其中一个值得关注的原因是,大多数 Vision-Language-Action(VLA)模型的训练目标仍以动作预测为主。模型主要学习“在这种观测下应该输出什么动作”,而随着机器人与环境持续交互,场景中的物体、局部区域和空间关系通常会如何变化,往往只被隐式地包含在动作学习过程中。

这种方式在训练分布内可以取得很高的成功率,但当相机视角、背景、光照或场景布局发生变化时,单纯依赖观测-动作相关性就可能变得不够稳定。也正因为如此,越来越多工作开始把 World Action Model(WAM)引入机器人策略:不仅学习“怎么做”,也显式学习当前状态如何随时间演化到未来状态。

但把世界模型接进 VLA,并不只是多加一个未来预测任务。基于视频生成的 WAM 通常需要迭代生成未来观测,带来明显的推理成本;Latent WAM 将预测转移到表示空间,避免了像素级未来帧生成,但又带来了两个更具体的问题:

  • 应该预测什么样的未来表示? 如果把未来压缩为少量 token 或全局 latent,细粒度的空间结构可能被削弱;如果只是预测单独的 future representation,模型学习到的更接近“最终会到哪里”,而不是“当前与未来之间发生了什么变化”。

  • 世界模型的监督应该怎样进入动作策略? 如果预测模块只是一个独立旁路,world modeling 对真正负责动作生成的 backbone 影响可能有限;如果把完整的未来表示直接塞给 action head,又可能引入冗余信息甚至任务干扰。


近日,中国人民大学信息学院联合北京星源智机器人等团队提出 JEPA-WAM,探索如何在不显式生成未来视频的情况下,将“世界变化规律”的学习真正融入机器人动作策略(本文第一作者为中国人民大学博士生林艺涵,共同一作为星源智联合创始人、算法负责人何嘉伟。论文通讯作者为中国人民大学信息学院助理教授迟程和教授张静)。

人大&星源智最新!JEPA-WAM:不生成未来视频,也能让机器人学会预测世界变化图1

Figure 1:JEPA-WAM 方法与性能概览。模型在 V-JEPA 表示空间中学习状态变化,并通过共享预测器将这种时序监督直接作用于动作生成 backbone;在多类 ID/OOD 评测中保持较强的泛化表现。


  • 论文链接:https://arxiv.org/abs/2608.09381

  • 论文标题:JEPA-WAM: Learning Vision-Language-Action Policies with Joint-Embedding World Modeling

  • 项目主页:https://spritewithoutice.github.io/JEPA_WAM/

工作沿着这两个问题展开:机器人究竟应该学习怎样的未来信息?学到之后,又怎样让它真正进入动作决策?

团队把目标转向“学习可供决策使用的变化表征”:在预训练 V-JEPA 2.1 的表示空间中直接建模当前与未来之间的结构化关系,并通过共享预测器,让这种时序监督直接更新动作生成所依赖的策略 backbone。


02.

💡 核心思路一:学习“场景如何变化”,

而不是只预测“未来长什么样”


先看第一个问题:未来到底应该怎么学?

传统 future prediction 的目标通常是:给定当前观测,预测未来观测或未来观测的表示。它更像是在回答:“接下来会看到什么?”

但机器人操作并不是一个唯一未来的问题。比如同样是“把物体放进抽屉”,机械臂可以采用不同轨迹、速度和抓取姿态完成任务,对应的未来视觉状态也存在多种可能。

JEPA-WAM 因此不把监督目标设为单独的 future-only feature,而是将 当前帧与未来帧一起送入冻结的 V-JEPA 2.1 编码器,构造 joint current–future target。这个目标同时看到两个时刻,并利用 V-JEPA 的视频表征能力编码它们之间的视觉时序关系。

更重要的是,目标并没有被压缩成少量全局 token,而是保留 dense patch-level 的空间组织。于是监督信号能够更细粒度地描述:

  • 哪些局部区域保持稳定、哪些区域正在发生变化;

  • 物体及其局部位置如何发生变化;

  • 局部物体关系和空间关系如何随时间发生重构。

因此,JEPA-WAM 希望模型从大量机器人轨迹中获得一种跨任务共享的 视觉时序结构 / 动态先验:不是记住某一条轨迹对应的唯一未来画面,而是更好地理解“从当前状态出发,世界中的变化通常是什么样的”。


03.

🔗 核心思路二:

让状态变化监督真正进入动作生成


确定了“学什么”之后,第二个问题就更直接:这些状态变化信息,怎样才能真正帮助机器人做动作?

JEPA-WAM 的做法是引入 Shared Predictor(共享预测器)。

人大&星源智最新!JEPA-WAM:不生成未来视频,也能让机器人学会预测世界变化图2

Figure 2:JEPA-WAM 整体框架。冻结的 V-JEPA 构造 joint current–future target;Qwen2.5-0.5B 作为共享预测器,同时承担 latent transition prediction 与 action conditioning;动作由 DiT-based action expert 生成。

在一次前向过程中,共享预测器承担两个相互关联但输出形式不同的任务:

  1. Transition Prediction:视觉 token 位置的 hidden states 被映射回 V-JEPA 空间,与 joint current–future target 做逐 patch 对齐。这样,状态变化监督会直接反向更新共享 predictor。

  2. Action Generation:专门的 action placeholder 从同一个 predictor 中读取动作所需的视觉与任务上下文,再交给 DiT action expert 通过 flow matching 生成连续动作。

这个设计的关键点是:世界模型监督和动作生成共享同一个主干,但不要求 action expert 直接使用完整的 transition representation。

于是,时序预测可以直接塑造策略 backbone,让 backbone 更关注运动变化和空间关系;与此同时,action placeholder 提供独立的动作 readout,降低 transition objective 与 action objective 之间相互干扰的风险。


04.

🧩 核心思路三:同一套 transition supervision 还能迁移到预训练 VLA


如果 joint current–future supervision 真正学到的是一种有用的状态变化规律,那么它应该不只对 JEPA-WAM 这一套结构有效。基于这个想法,团队进一步把同样的监督方式迁移到预训练 VLA π0.5 上,用来验证这套设计能否作为一种更通用的 policy supervision。

人大&星源智最新!JEPA-WAM:不生成未来视频,也能让机器人学会预测世界变化图3

Figure 3:向预训练 VLA 迁移。在原有 VLA 路径上增加轻量级 future tokens,并将其输出 reshape、投影和上采样后,对齐同一个 V-JEPA joint current–future target。

具体来说,团队在 π0.5 中加入一组轻量级 future tokens。这些 token 的 hidden states 被恢复成二维空间结构,并投影、上采样到与 V-JEPA target 相同的空间分辨率,从而施加同样的 patch-level transition supervision。

这里的 JEPA 对齐目标主要作为一种训练期的辅助世界变化监督,并不改变原有的动作生成路径。


05.

📊 实验:学会“状态如何变化”,

能否让策略更泛化?


方法设计完成后,真正要验证的还是一个问题:学会“状态如何变化”之后,机器人在环境发生变化时,能不能更稳?

团队在 LIBERO、LIBERO-Plus、RoboTwin 2.0 以及真实双臂机器人平台上进行了评测,重点考察能否在保持分布内能力的同时,提高面对视觉与空间分布偏移时的泛化能力。


1. LIBERO / LIBERO-Plus:保持 ID,同时提升 OOD


先看标准 LIBERO。JEPA-WAM 的平均成功率达到 96.7%,保持了较强的分布内表现;将同一监督加入 π0.5 后,平均成功率由 96.9% 提升至 97.8%。

更能体现泛化差异的是 LIBERO-Plus。这个 benchmark 会从相机、机器人状态等维度主动改变测试环境,而模型只在原始 LIBERO demonstration 上训练,不进行 OOD fine-tuning。

人大&星源智最新!JEPA-WAM:不生成未来视频,也能让机器人学会预测世界变化图4

Table 1:LIBERO-Plus OOD 结果。JEPA-WAM 达到 79.2%,在无大规模 robot-policy pretraining 的方法中表现最佳;π0.5 + JEPA Obj. 达到 86.3%,取得整体最优平均结果。

其中:

  • JEPA-WAM:79.2%,相比同组强基线表现更好;

  • π0.5:84.5% → π0.5 + JEPA Obj.:86.3%,说明即使已有大规模机器人策略预训练,transition supervision 仍能带来额外收益。


2. RoboTwin 2.0:从 Clean 训练到 Random 场景


接着把场景扰动进一步加大。在 RoboTwin 2.0 中,模型只使用 20 个任务的 Clean demonstrations 训练,再分别在 Clean 与 Random 场景下测试同一组任务。

人大&星源智最新!JEPA-WAM:不生成未来视频,也能让机器人学会预测世界变化图5

Table 2:RoboTwin 2.0 结果。JEPA-WAM 在无大规模预训练设置下取得 79.9% Clean / 36.9% Random;对 π0.5 加入 JEPA 监督后,Clean 从 75.4% 提升至 84.6%,Random 保持相当水平。

JEPA-WAM 在无 robot-policy pretraining 的设置下达到 79.9% Clean / 36.9% Random,Random 表现已经接近大规模预训练的 π0.5。对于 π0.5,加入 JEPA 目标后 Clean 成功率由 75.4% 提升至 84.6%,Random 则维持在相近水平。

这些结果表明,状态变化监督可以在保持较强 ID 能力的同时,在不同分布偏移下维持或提升策略的鲁棒性。


06.

🦾 真机:视觉和空间变化下仍然有效


最后从仿真到真机。团队进一步在 AgileX COBOT Magic 双臂机器人上评测五类任务,包括:

  • 将面包放到盘子上;

  • 将桃子和香蕉放到盘子上;

  • 将三个方块放到盘子上;

  • 堆叠三个方块;

  • 打开抽屉、放入两个玩具鸭并关闭抽屉。

OOD 设置会改变背景或物体初始配置,不额外进行 fine-tuning。

人大&星源智最新!JEPA-WAM:不生成未来视频,也能让机器人学会预测世界变化图6

Figure 5:真实双臂机器人实验。上方展示五类操作任务与 OOD 场景,下方对比 π0、JEPA-WAM、π0.5 与 π0.5 + JEPA Obj. 在 ID/OOD 条件下的表现。

在五个任务的平均 normalized completion score 上:

  • JEPA-WAM:ID 59.8%,OOD 54.2%;相比 π0 的 51.8% / 22.5%,尤其在 OOD 场景下提升明显。

  • π0.5 + JEPA Obj.:ID 从 77.5% 提升到 90.3%,OOD 从 72.5% 提升到 84.7%。

从仿真到真机,结果呈现出一致的趋势:当背景、物体配置和空间关系发生变化时,加入状态变化监督的策略表现更加稳定。


07.

📝 总结


如果说传统 VLA 更关注“下一步该做什么”,那么 JEPA-WAM 希望额外教会策略世界在动作过程中通常会怎样变化。

围绕这一点,JEPA-WAM 做了三件事:

  1. 从 future state prediction 转向 joint current–future transition representation:利用预训练 V-JEPA 共同编码当前与未来,学习二者之间的视觉时序关系;

  2. 保留 patch-level 空间结构:不把状态变化压缩成少量全局 latent,保留细粒度的局部和空间对应;

  3. 用 shared predictor 连接世界建模与动作生成:让 transition supervision 直接塑造 action generation,同时通过专用 action readout 避免预测目标与动作目标互相干扰。

同时,这套设计不仅适用于从头构建的 JEPA-WAM,也能够作为辅助监督迁移到已经预训练好的 VLA。

实验表明,这套设计在 LIBERO-Plus、RoboTwin 2.0 和真实双臂操作中均表现出较强的视觉与空间分布偏移泛化能力,并在多个设置下带来进一步提升。


END

 推荐阅读 :

关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。
机器人
more
人形机器人消费级市场有多大的想象空间?
RoboScience发布REX G1轮式仿人形机器人
WRC 期间,这场人形机器人研究型论坛值得关注
豆包支持手机远程操控电脑,DeepSeek价格涨幅最高1100%,大疆诉美国防部案赢得程序性胜利,FF机器人或上市,这就是今天的其他大新闻!
机器人学会驾车漂移?Best Paper得主联合创业,让全身智能“驶入”现实
人形机器人开始打国球了!两台机器人完整打完11分制比赛
宇树科技连发新品:人形机器人刷新人类极限,载人机甲售价近四百万
RoboScience机器科学发布轮式仿人形机器人REX G1,打造新一代具身生产力伙伴
宇树“超人”刷新百米极速,人形机器人迈入性能超越人类新纪元
卧安机器人与58同城达成深度合作
Copyright © 2025-成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号