给机器人一个会预测未来的Critic,VLA强化学习直接起飞

机器之心 2026-08-13 00:26
给机器人一个会预测未来的Critic,VLA强化学习直接起飞图1


一台机械臂正伸向转盘上的寿司。此刻,它是在稳定接近目标,还是已经错过最佳抓取时机?夹爪与物体接触得恰到好处,还是下一秒就会把寿司撞飞?只看一张静态图片,这些状态几乎一模一样。


但在不少视觉-语言-动作模型强化学习(VLA-RL)方法中,负责评价当前状态好坏的批评家模型(Critic Model),恰恰主要依赖单帧观测或单帧 VLM 特征来打分。这就像让一名只看比赛截图、没有回放的裁判,判断运动员究竟是在完成关键动作,还是已经失去平衡。


近期,OpenMOSS 团队开源了 World Critic Model(WCM)。它提出了一个直接却常被忽略的问题:机器人控制天然是一个部分可观测问题。既然一帧画面看不清动态,为什么 Critic 还要“凭一帧图打分”?


给机器人一个会预测未来的Critic,VLA强化学习直接起飞图2

图 1|WCM 从单帧 Critic 的局限出发,将世界预测与价值学习统一起来。


WCM 的答案不是简单堆叠更多图像,而是让 Critic 在估计价值的同时,学习预测执行动作后的下一时刻潜在状态。换句话说,它不仅要回答“现在有多好”,还要回答: “照这样做下去,接下来会发生什么?”


WCM 的代码、数据、权重全开源,仅 15 分钟训练即可得到真机价值曲线!


给机器人一个会预测未来的Critic,VLA强化学习直接起飞图3



WCM 在 4 个仿真基准、149 项任务,以及 7 项真实机器人任务上进行了系统验证,覆盖抓取、柔性物体、长程和动态目标操作任务。同时,WCM 可搭配三种主流 VLA 模型:π₀、π₀.₅、OpenVLA-OFT。


其中最醒目的结果之一来自 ManiSkill:一个此前没有接触过 ManiSkill 数据、初始成功率仅 0.78% 的 VLA 模型,在 WCM 引导的强化学习后达到 98.7%,提升了 97.9 个百分点。更重要的是,提升并没有只发生在训练分布内,在 OOD 平均成功率上也取得了 72.7% 的提升。


这组结果指向了 WCM 最核心的价值:它不只是把训练任务做得更熟,还让 Critic 在环境变化后更不容易看走眼。


01|VLA-RL 的 Critic

可能一直少看了最关键的信息


在 Actor-Critic 类强化学习中,策略(Policy)决定做什么,Critic 则负责判断这个状态有多好,并据此计算优势、指导 Policy 更新。因此,Critic 并不是一个可有可无的配角。Critic 的判断一旦失真,Policy 就可能被非常自信地带向错误方向。


给机器人一个会预测未来的Critic,VLA强化学习直接起飞图4

图 2|Critic 负责判断当前状态有多好。图为 WCM 的价值估计曲线,当发生碰撞导致物体掉落时曲线开始下降。


问题在于,机器人操作通常可以建模为部分可观测马尔可夫决策过程(POMDP)。单帧画面可以告诉模型物体在哪里、机械臂大致处于什么姿态、当前场景包含哪些视觉元素。但它往往无法可靠告诉模型:机械臂正在靠近还是远离目标;夹爪是否刚刚发生滑移;当前接触是稳定支撑还是即将碰撞;目标物体是否仍在运动;动作序列是在向成功推进,还是已经进入不可恢复的失败……


给机器人一个会预测未来的Critic,VLA强化学习直接起飞图5

图 3|机器人操作任务具有部分可观测性质,智能体只能通过观测重建系统状态。


以擦拭灶台为例,同样是末端执行器接近桌面,可能代表“正在施力清洁”,也可能代表“机械臂被桌面卡住”。像素很像,价值却完全不同。这也是为什么在真实机器人实验中,单帧 Critic 容易学到一些危险的伪相关:例如把“末端靠近桌面”一概视为高价值,最终导致机械臂反复顶住台面。


02|反直觉的是

给 Critic 多看几帧,也未必有用


既然单帧不够,最自然的方案似乎是把多帧图像直接堆起来,或者加一个时序 Transformer。但论文发现,事情并没有这么简单。


真正缺少的不是“历史输入”本身,而是迫使模型理解历史变化的监督信号。


传统 Critic 的核心目标通常只是回归一个标量回报。面对高维图像序列,这个监督过于稀疏。即使输入中包含过去几帧,模型也可能把它们当成一块更大的静态特征,而不是去学习物体如何运动、接触如何变化、动作将把环境带向哪里


实验中出现了三个值得注意的现象:(1)直接给原始 Critic 增加历史观测,性能可能反而下降;(2)换成具备时序建模能力的 Transformer,但不加入世界预测目标,仍然难以利用历史;(3)只有在加入未来状态预测后,多帧历史才稳定转化为更好的价值估计。


给机器人一个会预测未来的Critic,VLA强化学习直接起飞图6

图 4|MLP、仅时序 ViT 与完整 WCM 的对比。完整 WCM 在不同骨干和任务上取得最高整体表现。


这个结论也解释了一个常见误区: “有记忆”不等于“理解动态”;只有可预测的历史表征,才更接近机器人真正需要的状态。


03|WCM 怎么做

让 Critic 一边打分,一边做未来推演


WCM 基于轻量级 LeJEPA 风格架构,由四个关键部分组成:观测编码器、世界预测器、价值头、动态预测头。整个过程可以拆成四步:


给机器人一个会预测未来的Critic,VLA强化学习直接起飞图7

图 5|WCM 核心架构:共享的历史表征同时服务于价值估计与下一潜在状态预测。


第一步:编码连续历史。WCM 接收最近 K 帧观测。每一帧先被独立编码为潜在表示。在不同实现中,编码器既可以是 ViT,也可以直接复用 VLA 的 VLM Backbone。


第二步:加入语言条件。机器人执行的不是无条件动作。“把胡萝卜放到盘子里”和“折叠毛巾”,即使视觉画面相似,对状态价值的定义也完全不同。因此,WCM 通过语言编码与适配模块,把任务指令注入历史表征。


第三步:用因果时序模型聚合历史。经过语言条件化的多帧特征,被送入因果 Transformer World Predictor,形成当前的历史状态表示。这个表示不是简单的多帧拼接,而是要同时支持两件事:判断当前状态的预期回报;结合当前动作,预测下一时刻的潜在状态。


第四步:双头联合学习。WCM 设置两个轻量预测头:Value Head 输出当前状态价值;World Head 接收动作条件,预测下一潜在状态。


其总体目标可以概括为:总损失 = 价值回归损失 + 世界预测损失 + 特征空间正则损失。其中,特征空间使用 SIGReg 抑制潜在表示发生维度坍缩。这里有一个设计细节非常关键:价值估计保持 action-free,而状态转移预测是 action-conditioned。也就是说,WCM 不会把状态有多好和执行某个动作后会怎样混为一谈,却又允许两类目标共同改善共享表征。


WCM 也不是一个额外生成像素、规模庞大的视频世界模型。它预测的是任务相关的下一潜在状态,目标非常明确:让 Critic 学会捕捉对价值判断真正有用的动态。


04|它不绑定某一种 RL

On-policy 与 Off-policy 都能接


WCM 的另一个特点,是没有重新发明一整套强化学习算法,而是作为 Critic 接入现有训练流程。在同策略(On-policy)学习场景中:自回归 VLA 可接入 PPO,Flow Matching VLA 可接入 Flow-SDE,WCM 提供价值估计,用于计算 Return 与 GAE Advantage;在异策略(Off-policy)学习场景中:OpenVLA-OFT 可结合 AWR,π₀.₅ 可结合 RECAP,SFT 数据、成功 Rollout 和失败 Rollout 被放入统一数据缓冲区,用于持续更新 Critic 与 Policy。


给机器人一个会预测未来的Critic,VLA强化学习直接起飞图8

图 6|WCM 可直接嵌入 On-policy 与 Off-policy 两类 VLA-RL 管线。


这种模块化设计意味着,WCM 更像一次对 Critic 表征学习方式的升级,而不是只能在特定 Policy 或特定算法上生效的技巧。


05|实验结果:IND 和 OOD 的双重 SOTA


在 RL4VLA 设置的 Maniskill 任务上,加了 WCM 的强化学习取得了分布内(IND)和分布外(OOD)的双重 SOTA 性能。更令人瞩目的是,在零样本(Zero-Shot)设定下,WCM 直接将近乎无效的 0.8 分拉升至 98.7 分,提升高达 97.9 分,充分验证了其卓越的泛化能力与强化学习适配效果。


给机器人一个会预测未来的Critic,VLA强化学习直接起飞图9

表 1|WCM 在 Maniskill 分布内和分布外测试集上取得 SOTA 结果。


团队在 LIBERO-Plus 基准上设计了一组极具说服力的对比实验。其中,One-SFT 表示每项任务仅提供 1 条示范数据,而 Full-SFT 则提供多达 50 条。实验结果显示,基于 One-SFT 的 WCM 方法,仅需约 250 步的强化学习微调,便能从极简的初始策略出发,在总体性能上成功反超依赖大量示范的 Full-SFT 基线。


给机器人一个会预测未来的Critic,VLA强化学习直接起飞图10

表 2|WCM 在 LIBERO-Plus 泛化测试基准上通过 250 步 RL 训练即可超越 Full-SFT。


这并不意味着示范数据不重要,而是说明:当 Critic 能更准确地理解动态与结果,环境交互产生的失败数据也可以变成非常有价值的学习信号


在 MetaWorld 与 CALVIN 上,WCM 同样使得持续接触和长程操作的表现稳定提升。


给机器人一个会预测未来的Critic,VLA强化学习直接起飞图11

图 7|WCM 在 MetaWorld 成功率与 CALVIN 平均任务完成均取得亮眼表现。


真机方面,团队在 WidowX-250S 上测试了 7 个任务:胡萝卜、香蕉、甜椒抓取放置;叠衣服、叠毛巾;灶台整理;转盘寿司动态抓取。每项任务首先采集 100 条遥操作轨迹,随后进行 8 轮 RL 更新;每轮、每项任务收集 50 条 Rollout。相较于使用 VLM Critic Model 进行 RL 训练,使用 WCM 的方法可以取得更好的性能。


给机器人一个会预测未来的Critic,VLA强化学习直接起飞图12

表 3|使用 WCM 进行真机强化学习,可以获得比 VLM Critic 更好的效果。


真实机器人设置中的 WCM 约有 107.2M 可训练参数。数百到数千条轨迹的数据规模下,WCM 可在不到半小时内完成快速迭代。而且,这种提升不只体现在最后有没有成功,WCM 训练出的 Policy 动作更连贯,停顿和无效小动作更少,因此单位时间内的吞吐量也更多。


给机器人一个会预测未来的Critic,VLA强化学习直接起飞图13

图 8|在叠毛巾、灶台整理和抓取旋转寿司任务上,RECAP + WCM 的吞吐量均高于 Gemma Critic。


06|价值曲线可视化


WCM 仓库提供了价值曲线视频生成工具。把模型预测的价值叠加到真实轨迹后,可以直观看到它如何评价动作进展。


给机器人一个会预测未来的Critic,VLA强化学习直接起飞图14

图 9|对于成功轨迹:价值随任务推进整体上升。


给机器人一个会预测未来的Critic,VLA强化学习直接起飞图15

图 10|对于失败轨迹:从开始失败的时刻起,价值快速下降。


给机器人一个会预测未来的Critic,VLA强化学习直接起飞图16

图 11|对于无效轨迹:随机运动没有形成稳定的成功趋势。


可视化说明 WCM 学到的并非简单的终点分类器,而是一个能够反映过程变化的连续评价信号。在真实数据中,暂停、滑移、碰撞、抓姿不佳或折叠不整齐,都会让价值曲线停滞或下降。


07|结语


如果你正在研究 VLA、机器人强化学习、Critic Model 或真机后训练,WCM 提供了代码、数据处理脚本、训练配置、模型权重以及价值曲线可视化工具,适合作为一个新的可复现基线。


当机器人不再只看“这一帧”,它才更有可能理解自己正在走向哪里。



© THE END 

转载请联系本公众号获得授权

投稿或寻求报道:liyazhou@jiqizhixin.com

关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。
IC 机器人
more
Claude全线植入隐形水印,Anthropic率先响应欧盟AI法案合规要求
Anthropic回应造芯!327万年薪招揽芯片工程师
IC设计与工艺适配遇阻?2026湾芯展IC论坛揭晓破局思路!
荣耀MagicOS 11内测启动,双架构重塑视觉与流畅体验
Anthropic宣布Claude Code自动模式成默认设置,人类监督将大幅减少
聚灿光电宣布Micro LED光互连重要落子
阿维塔称与华为合作非必要是误读,曝字节继成立AI数据与安全部门,传Anthropic最快9月上市,索尼与台积电合资,这就是今天的其他大新闻!
让生成式模型「画」出空间智能,而非强迫LLM输出「坐标」! 浙大提出Agentic空间认知评估框架
刚刚,Anthropic最新Fable泄露了!
半导体全链聚合,IICIE国际集成电路创新博览会9月深圳举办
Copyright © 2025-成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号