点击下方卡片,关注“具身智能之心”公众号
01.
🤖 为什么 VLA 还需要“世界模型”?
现在机器人在熟悉的训练环境里,已经能稳定完成抓取、放置、开抽屉等任务;但如果换一个背景、挪一下物体位置,或者改变相机视角,原本稳定的策略就可能失效。对于现在的 VLA 来说,这类视觉和空间分布变化仍然是一个泛化问题。
其中一个值得关注的原因是,大多数 Vision-Language-Action(VLA)模型的训练目标仍以动作预测为主。模型主要学习“在这种观测下应该输出什么动作”,而随着机器人与环境持续交互,场景中的物体、局部区域和空间关系通常会如何变化,往往只被隐式地包含在动作学习过程中。
这种方式在训练分布内可以取得很高的成功率,但当相机视角、背景、光照或场景布局发生变化时,单纯依赖观测-动作相关性就可能变得不够稳定。也正因为如此,越来越多工作开始把 World Action Model(WAM)引入机器人策略:不仅学习“怎么做”,也显式学习当前状态如何随时间演化到未来状态。
但把世界模型接进 VLA,并不只是多加一个未来预测任务。基于视频生成的 WAM 通常需要迭代生成未来观测,带来明显的推理成本;Latent WAM 将预测转移到表示空间,避免了像素级未来帧生成,但又带来了两个更具体的问题:
应该预测什么样的未来表示? 如果把未来压缩为少量 token 或全局 latent,细粒度的空间结构可能被削弱;如果只是预测单独的 future representation,模型学习到的更接近“最终会到哪里”,而不是“当前与未来之间发生了什么变化”。
世界模型的监督应该怎样进入动作策略? 如果预测模块只是一个独立旁路,world modeling 对真正负责动作生成的 backbone 影响可能有限;如果把完整的未来表示直接塞给 action head,又可能引入冗余信息甚至任务干扰。
近日,中国人民大学信息学院联合北京星源智机器人等团队提出 JEPA-WAM,探索如何在不显式生成未来视频的情况下,将“世界变化规律”的学习真正融入机器人动作策略(本文第一作者为中国人民大学博士生林艺涵,共同一作为星源智联合创始人、算法负责人何嘉伟。论文通讯作者为中国人民大学信息学院助理教授迟程和教授张静)。

Figure 1:JEPA-WAM 方法与性能概览。模型在 V-JEPA 表示空间中学习状态变化,并通过共享预测器将这种时序监督直接作用于动作生成 backbone;在多类 ID/OOD 评测中保持较强的泛化表现。
论文链接:https://arxiv.org/abs/2608.09381
论文标题:JEPA-WAM: Learning Vision-Language-Action Policies with Joint-Embedding World Modeling
项目主页:https://spritewithoutice.github.io/JEPA_WAM/
工作沿着这两个问题展开:机器人究竟应该学习怎样的未来信息?学到之后,又怎样让它真正进入动作决策?
团队把目标转向“学习可供决策使用的变化表征”:在预训练 V-JEPA 2.1 的表示空间中直接建模当前与未来之间的结构化关系,并通过共享预测器,让这种时序监督直接更新动作生成所依赖的策略 backbone。
02.
💡 核心思路一:学习“场景如何变化”,
而不是只预测“未来长什么样”
先看第一个问题:未来到底应该怎么学?
传统 future prediction 的目标通常是:给定当前观测,预测未来观测或未来观测的表示。它更像是在回答:“接下来会看到什么?”
但机器人操作并不是一个唯一未来的问题。比如同样是“把物体放进抽屉”,机械臂可以采用不同轨迹、速度和抓取姿态完成任务,对应的未来视觉状态也存在多种可能。
JEPA-WAM 因此不把监督目标设为单独的 future-only feature,而是将 当前帧与未来帧一起送入冻结的 V-JEPA 2.1 编码器,构造 joint current–future target。这个目标同时看到两个时刻,并利用 V-JEPA 的视频表征能力编码它们之间的视觉时序关系。
更重要的是,目标并没有被压缩成少量全局 token,而是保留 dense patch-level 的空间组织。于是监督信号能够更细粒度地描述:
哪些局部区域保持稳定、哪些区域正在发生变化;
物体及其局部位置如何发生变化;
局部物体关系和空间关系如何随时间发生重构。
因此,JEPA-WAM 希望模型从大量机器人轨迹中获得一种跨任务共享的 视觉时序结构 / 动态先验:不是记住某一条轨迹对应的唯一未来画面,而是更好地理解“从当前状态出发,世界中的变化通常是什么样的”。
03.
🔗 核心思路二:
让状态变化监督真正进入动作生成
确定了“学什么”之后,第二个问题就更直接:这些状态变化信息,怎样才能真正帮助机器人做动作?
JEPA-WAM 的做法是引入 Shared Predictor(共享预测器)。

Figure 2:JEPA-WAM 整体框架。冻结的 V-JEPA 构造 joint current–future target;Qwen2.5-0.5B 作为共享预测器,同时承担 latent transition prediction 与 action conditioning;动作由 DiT-based action expert 生成。
在一次前向过程中,共享预测器承担两个相互关联但输出形式不同的任务:
Transition Prediction:视觉 token 位置的 hidden states 被映射回 V-JEPA 空间,与 joint current–future target 做逐 patch 对齐。这样,状态变化监督会直接反向更新共享 predictor。
Action Generation:专门的 action placeholder 从同一个 predictor 中读取动作所需的视觉与任务上下文,再交给 DiT action expert 通过 flow matching 生成连续动作。
这个设计的关键点是:世界模型监督和动作生成共享同一个主干,但不要求 action expert 直接使用完整的 transition representation。
于是,时序预测可以直接塑造策略 backbone,让 backbone 更关注运动变化和空间关系;与此同时,action placeholder 提供独立的动作 readout,降低 transition objective 与 action objective 之间相互干扰的风险。
04.
🧩 核心思路三:同一套 transition supervision 还能迁移到预训练 VLA
如果 joint current–future supervision 真正学到的是一种有用的状态变化规律,那么它应该不只对 JEPA-WAM 这一套结构有效。基于这个想法,团队进一步把同样的监督方式迁移到预训练 VLA π0.5 上,用来验证这套设计能否作为一种更通用的 policy supervision。

Figure 3:向预训练 VLA 迁移。在原有 VLA 路径上增加轻量级 future tokens,并将其输出 reshape、投影和上采样后,对齐同一个 V-JEPA joint current–future target。
具体来说,团队在 π0.5 中加入一组轻量级 future tokens。这些 token 的 hidden states 被恢复成二维空间结构,并投影、上采样到与 V-JEPA target 相同的空间分辨率,从而施加同样的 patch-level transition supervision。
这里的 JEPA 对齐目标主要作为一种训练期的辅助世界变化监督,并不改变原有的动作生成路径。
05.
📊 实验:学会“状态如何变化”,
能否让策略更泛化?
方法设计完成后,真正要验证的还是一个问题:学会“状态如何变化”之后,机器人在环境发生变化时,能不能更稳?
团队在 LIBERO、LIBERO-Plus、RoboTwin 2.0 以及真实双臂机器人平台上进行了评测,重点考察能否在保持分布内能力的同时,提高面对视觉与空间分布偏移时的泛化能力。
1. LIBERO / LIBERO-Plus:保持 ID,同时提升 OOD
先看标准 LIBERO。JEPA-WAM 的平均成功率达到 96.7%,保持了较强的分布内表现;将同一监督加入 π0.5 后,平均成功率由 96.9% 提升至 97.8%。
更能体现泛化差异的是 LIBERO-Plus。这个 benchmark 会从相机、机器人状态等维度主动改变测试环境,而模型只在原始 LIBERO demonstration 上训练,不进行 OOD fine-tuning。

Table 1:LIBERO-Plus OOD 结果。JEPA-WAM 达到 79.2%,在无大规模 robot-policy pretraining 的方法中表现最佳;π0.5 + JEPA Obj. 达到 86.3%,取得整体最优平均结果。
其中:
JEPA-WAM:79.2%,相比同组强基线表现更好;
π0.5:84.5% → π0.5 + JEPA Obj.:86.3%,说明即使已有大规模机器人策略预训练,transition supervision 仍能带来额外收益。
2. RoboTwin 2.0:从 Clean 训练到 Random 场景
接着把场景扰动进一步加大。在 RoboTwin 2.0 中,模型只使用 20 个任务的 Clean demonstrations 训练,再分别在 Clean 与 Random 场景下测试同一组任务。

Table 2:RoboTwin 2.0 结果。JEPA-WAM 在无大规模预训练设置下取得 79.9% Clean / 36.9% Random;对 π0.5 加入 JEPA 监督后,Clean 从 75.4% 提升至 84.6%,Random 保持相当水平。
JEPA-WAM 在无 robot-policy pretraining 的设置下达到 79.9% Clean / 36.9% Random,Random 表现已经接近大规模预训练的 π0.5。对于 π0.5,加入 JEPA 目标后 Clean 成功率由 75.4% 提升至 84.6%,Random 则维持在相近水平。
这些结果表明,状态变化监督可以在保持较强 ID 能力的同时,在不同分布偏移下维持或提升策略的鲁棒性。
06.
🦾 真机:视觉和空间变化下仍然有效
最后从仿真到真机。团队进一步在 AgileX COBOT Magic 双臂机器人上评测五类任务,包括:
将面包放到盘子上;
将桃子和香蕉放到盘子上;
将三个方块放到盘子上;
堆叠三个方块;
打开抽屉、放入两个玩具鸭并关闭抽屉。
OOD 设置会改变背景或物体初始配置,不额外进行 fine-tuning。

Figure 5:真实双臂机器人实验。上方展示五类操作任务与 OOD 场景,下方对比 π0、JEPA-WAM、π0.5 与 π0.5 + JEPA Obj. 在 ID/OOD 条件下的表现。
在五个任务的平均 normalized completion score 上:
JEPA-WAM:ID 59.8%,OOD 54.2%;相比 π0 的 51.8% / 22.5%,尤其在 OOD 场景下提升明显。
π0.5 + JEPA Obj.:ID 从 77.5% 提升到 90.3%,OOD 从 72.5% 提升到 84.7%。
从仿真到真机,结果呈现出一致的趋势:当背景、物体配置和空间关系发生变化时,加入状态变化监督的策略表现更加稳定。
07.
📝 总结
如果说传统 VLA 更关注“下一步该做什么”,那么 JEPA-WAM 希望额外教会策略世界在动作过程中通常会怎样变化。
围绕这一点,JEPA-WAM 做了三件事:
从 future state prediction 转向 joint current–future transition representation:利用预训练 V-JEPA 共同编码当前与未来,学习二者之间的视觉时序关系;
保留 patch-level 空间结构:不把状态变化压缩成少量全局 latent,保留细粒度的局部和空间对应;
用 shared predictor 连接世界建模与动作生成:让 transition supervision 直接塑造 action generation,同时通过专用 action readout 避免预测目标与动作目标互相干扰。
同时,这套设计不仅适用于从头构建的 JEPA-WAM,也能够作为辅助监督迁移到已经预训练好的 VLA。
实验表明,这套设计在 LIBERO-Plus、RoboTwin 2.0 和真实双臂操作中均表现出较强的视觉与空间分布偏移泛化能力,并在多个设置下带来进一步提升。