RL好用,但缺少可规模化的反馈信号?!阿里提出RynnValue,正式开启scaling时代

具身智能之心 2026-08-13 10:58

点击下方卡片,关注“具身智能之心”公众号


这两年,机器人基础模型的动作能力一直在向前推进。

从理解语言指令、识别物体,到直接生成连续动作,VLA 正在覆盖越来越多机器人和真实操作任务。随着基础策略逐渐成熟,越来越多工作也开始引入在线和离线强化学习,让机器人从真实交互和混合质量数据中继续提升。

但强化学习要规模化,还有一个前提:机器人需要持续、可靠的反馈信号。

一次操作让任务状态变得更好还是更差?机器人是在接近目标,还是因为失误回到了更早的状态?如果每增加一项任务,都要重新设计奖励函数、标注任务进度或构造轨迹偏好,那么策略训练可以扩展,反馈信号却很难以同样的速度扩展。

阿里巴巴达摩院与湖畔实验室,联合北京大学,南洋理工大学,西湖大学等高校近日发布并开源了 RynnValue,尝试回答机器人价值模型应该如何 Scaling。

RynnValue 不负责生成动作。给定任务指令和一段机器人观察,它预测当前状态完成任务所需的剩余时间,并将这种时间距离转换成强化学习能够使用的过程奖励。

先看最有分量的几组结果:

  • 不使用轨迹偏好标签,刷新分布外轨迹排序 SOTA。 RynnValue-8B 在 RBM-EVAL-OOD 上取得 0.675 的平均 Kendall's Ta,超过完整偏好监督模型的 0.655,也达到仅使用归一化进度监督版本 0.292 的两倍以上;

  • 价值模型零样本进入真实机器人 RL。 四项下游任务、操作物体和工作场景均未出现在价值模型的训练数据中,RynnValue 也没有进行目标域微调,而是直接为在线和离线强化学习提供过程反馈;

  • 真机策略成功率出现明显提升。 相比最强奖励模型基线,在线 RL 的四任务平均成功率从 52.5% 提升到 72.5%,增加 20 个百分点;离线 RL 从 63.8% 提升到 82.5%,增加 18.7 个百分点。其中,铲子转移牛排和双臂搬箱的在线成功率分别提高 30 和 35 个百分点;

  • 价值监督扩展到超过 7000 小时异构数据。 整个训练集包含 167 万条原始 episode 和约 309 万段指令条件轨迹,时间距离标签直接从轨迹时间戳生成,不需要构造偏好对,也不需要为每项任务制作归一化进度标签。

目前,论文、项目代码、4B/8B 模型权重、推理工具和强化学习代码均已公开。

论文链接:https://arxiv.org/abs/2608.09853

项目主页:https://alibaba-damo-academy.github.io/RynnValue.github.io/

GitHub:https://github.com/alibaba-damo-academy/RynnValue

Hugging Face:https://huggingface.co/collections/Alibaba-DAMO-Academy/rynnvalue

ModelScope:https://www.modelscope.cn/collections/DAMO_Academy/RynnValue

RL好用,但缺少可规模化的反馈信号?!阿里提出RynnValue,正式开启scaling时代图1


01

机器人强化学习,

为什么缺少可规模化的反馈信号?


强化学习依赖奖励,但真实机器人的奖励并不容易获得。

在固定环境中,工程师可以根据物体位置、机械臂状态和任务完成条件手工设计奖励。机器人一旦面对更多任务、更多物体和不同本体,这些规则通常无法直接复用。

仅在任务完成时提供成功信号,扩展成本相对较低,但反馈过于稀疏。机器人知道一次执行最终失败了,却不知道中间的哪一步让状态开始恶化。

另一条路线是训练通用机器人奖励模型。现有方法通常使用归一化任务进度、参考演示或轨迹偏好作为监督。

这些目标在单个任务中有效,但扩大到异构数据时,会遇到尺度和标注成本问题。

例如,一个 4 秒完成的抓取任务和一个 40 秒完成的复合操作,都可以被标记为完成了 50%。前者可能只剩一次抓取和放置,后者仍要处理多个物体状态和接触阶段。

归一化进度描述的是当前状态位于某条轨迹的什么位置,却没有保留不同任务之间真实的时间尺度。轨迹偏好可以进一步区分成功、次优和失败执行,但需要先找到可比较的轨迹,再提供可靠的优劣关系。

当训练数据从少量任务扩展到数百万段、覆盖多种机器人时,价值监督本身就会成为新的扩展瓶颈。

因此,RynnValue首先寻找的不是更复杂的奖励结构,而是一种能够随数据规模同步增长的监督目标。


02

不再预测进度,

直接学习“离目标还有多远”


RynnValue 最关键的变化,不是把奖励模型做得更大,而是重新定义了价值模型应该预测什么。

过去常见的做法,是把每条轨迹压缩到 [0,1],让模型预测任务“完成了百分之多少”。RynnValue 则直接预测:给定语言指令,机器人从当前状态到完成任务还需要多少时间。 论文将这一目标称为 时间距离(temporal distance)。

这并不只是换了一种数值表达。归一化进度描述的是当前状态位于一段轨迹的什么位置;时间距离描述的则是当前状态距离任务目标还有多远。在控制问题中,后者对应目标条件下的 cost-to-go,也更接近“价值”本身的定义。

这一步带来的直接变化是,不同时长、不同结构、甚至不同机器人上的任务,都可以进入同一套价值接口。时间距离越短,说明状态越接近完成;机器人停滞时不再获得前进反馈,走错或回退时,价值会立即下降。

为了让模型既看清全局目标,也能捕捉局部变化,RynnValue 同时学习两类信号:绝对时间距离判断当前状态离完成还有多远,相对时间变化识别相邻观察之间的前进与回退。自然语言分支还会判断视频与指令是否匹配、任务是否成功,并生成相应的视频描述。

进入强化学习后,RynnValue 将预测的时间距离转换为“越接近目标、数值越高”的状态势能,再通过相邻状态的势能变化生成稠密的过程奖励。一次有效推进会得到正向反馈,一次错误操作会拉低价值。由此,同一个价值模型无需为下游任务重新定义进度,就能作为统一反馈接口接入在线和离线 RL。

也正是这一价值目标的变化,让 RynnValue 有可能把监督规模扩展到 7000 小时异构数据,并零样本迁移到训练中从未出现过的真实机器人任务。


03

7000 小时数据,

价值监督如何同步 Scaling?


时间距离的另一个关键特征,是标签可以利用轨迹中本来就存在的时间戳生成。

一旦确定任务完成时刻,每个中间状态距离完成还剩多少时间,就可以直接计算。训练数据继续增加时,不需要按相同比例增加偏好比较或人工进度标注。

基于这套目标,RynnValue 汇集了真实机器人、仿真机器人和第一视角人类操作数据,代表性来源包括 Open X-Embodiment、AgiBot、EgoDex、RoboMIND、RoboTwin 等。

整个训练混合包含:

  • 1,671,313 条原始 episode;

  • 3,091,969 段指令条件轨迹;

  • 223,395 条任务指令;

  • 总时长超过 7000 小时。

这些数据的差异不只体现在任务内容上。

它们覆盖单臂、双臂、移动操作和灵巧手等机器人形态,也包含不同相机视角、执行速度、控制频率和任务时长。部分数据来自真实机器人,部分来自仿真,还有一部分记录人类第一视角操作。

时间距离为这些原本缺少统一进度定义的数据提供了共同单位。团队通过子任务切分和完成时刻校正,使时间标签对应语义上的任务完成,再利用时间戳生成状态级监督。

这也是RynnValue所强调的第一层Scaling:数据来源可以不同,但价值监督能够以相同方式生成。


04

数据规模扩大后,

模型会不会只根据时间顺序猜答案?


监督能够扩展,不代表模型一定会学到可靠的价值。

在多帧训练中,序列本身可能泄露答案。如果模型每次看到的 8 帧观察都按时间顺序排列,那么第一帧通常距离完成最远,最后一帧通常距离完成最近。

模型甚至不需要准确理解机械臂和物体的状态,只要根据帧的位置,就可能输出一条看起来合理的价值曲线。

这种捷径在成功轨迹中不容易暴露。到了真实机器人执行中,一旦出现试错、停滞和回退,模型仍可能按照序列位置持续提高价值。

RynnValue从数据采样和模型注意力两方面处理这个问题。

首先,模型从每段轨迹中随机选择 8 个不规则时间点,打破固定采样间隔。

其次,训练序列不再始终按时间正序排列。一半序列会被打乱,另一半整体向前采样,但允许出现回到更早时刻的情况。输入位置因此无法直接代表任务进展。

在模型内部,RynnValue加入 value-isolation attention。每个观察对应的价值查询无法读取其他观察的价值查询,避免后续预测根据前面已经产生的数值继续外推。

此外,10%的训练样本会替换成来自其他轨迹的错误指令。模型必须识别视频与语言目标是否一致,而不能只判断画面中是否发生了机器人运动。

RL好用,但缺少可规模化的反馈信号?!阿里提出RynnValue,正式开启scaling时代图2

消融实验直接体现了这些设计的重要性。

完整RynnValue-8B的平均Kendall's 为 0.675。改用均匀时间采样后下降到0.379,去掉价值隔离注意力后下降到0.482。

影响最大的是时间顺序打乱。移除这一设计后,结果从0.675下降到 0.189

这说明价值模型的Scaling不能只增加训练数据。如果数据中的时间规律没有被打破,规模越大的训练反而越可能强化错误捷径。


05

Scaling的关键,

不是重复轨迹,而是任务多样性


有了可以扩展的监督目标以后,下一个问题是:继续增加什么数据,才能真正提高价值模型的泛化能力?

论文设计了两组对照实验。

第一组固定完整任务集合,分别使用每项任务1%、10%、25%、50%和75%的episode,观察在相同任务中继续增加轨迹数量的效果。

第二组保持单任务数据量不变,逐步增加训练任务种类。两组实验在相同比例下使用可比的数据总量,并最终汇合到同一个完整训练集。

结果显示,两种Scaling方式带来的收益并不相同。

在固定任务中增加episode,误差在较低数据比例后就很快进入平台期。继续重复观察相同任务,并没有持续改善未见任务上的时间距离预测。

增加任务种类则表现出不同趋势。随着任务覆盖不断扩大,模型在未见任务上的误差持续下降,并且在训练规模过半后仍然能够获得明显收益。

RL好用,但缺少可规模化的反馈信号?!阿里提出RynnValue,正式开启scaling时代图3

这一结果意味着,对通用价值模型来说,训练数据的目标结构可能需要重新考虑。

更多任务能够带来不同的物体配置、完成条件、中间状态和失败方式。相比在少量任务上反复增加相似轨迹,这些差异更有可能迁移到新的任务。

模型规模实验也提供了相似信号:RynnValue-4B在OOD轨迹排序上达到 0.670,8B版本为 0.675。参数规模翻倍,并没有带来同等幅度的增长。

至少在当前实验中,RynnValue呈现出一个清晰结论:

任务多样性的Scaling,比重复轨迹和单纯扩大参数更能推动价值泛化。


06

规模化训练,

是否产生了通用价值能力?


团队首先在RBM-EVAL-OOD上测试RynnValue的分布外泛化。

这项评测包含来自6个机器人数据集的976条轨迹,覆盖不同机构、本体、相机视角和任务类型。轨迹包含失败、次优和成功执行,模型需要判断不同轨迹的相对质量。

RynnValue-8B取得 0.675 的平均Kendall's ,RynnValue-4B达到0.670。

作为对比,使用任务进度和轨迹偏好共同监督的完整Robometer为0.655;只使用归一化进度的版本为0.292。

RL好用,但缺少可规模化的反馈信号?!阿里提出RynnValue,正式开启scaling时代图4

这组结果的重点不只是0.675本身。

RynnValue没有使用轨迹偏好标签,却超过了完整偏好监督模型;同时,时间距离版本的结果达到仅进度监督版本的两倍以上。

团队还将每条任务指令与所有轨迹交叉组合,检查模型能否区分正确与错误的“指令—轨迹”配对。

RynnValue的归一化对角优势达到 0.79,高于最强基线的0.67。清晰的对角结构表明,模型判断的不是泛化的视觉运动,而是轨迹是否在完成语言指定的目标。

RL好用,但缺少可规模化的反馈信号?!阿里提出RynnValue,正式开启scaling时代图5

真实执行片段进一步展示了这种差异。

当机器人因试错远离有效状态时,RynnValue的输出出现明显下降;恢复正确操作后,价值重新上升。相比之下,基于归一化进度的模型对中途回退反应更弱。

RL好用,但缺少可规模化的反馈信号?!阿里提出RynnValue,正式开启scaling时代图6

从轨迹排序、语言对齐到非单调状态变化,这些结果共同验证了Scaling路线的第二步:从异构数据中学习到的时间距离,能够迁移到训练分布之外。


07

无需目标域微调,RynnValue零样本进入真实机器人RL


分布外评测能够验证价值预测,但RynnValue最终希望服务的是机器人策略学习。

团队在双臂Franka平台上设计了四项真实操作任务:

  1. 将两片面包放入篮子;

  2. 使用铲子把牛排从平底锅转移到盘子;

  3. 将盒子放入抽屉并关闭抽屉;

  4. 使用双臂协作搬运盒子。

RL好用,但缺少可规模化的反馈信号?!阿里提出RynnValue,正式开启scaling时代图7

这里最重要的实验设置,是价值模型的 零样本迁移。

四项任务、操作物体和工作场景都没有出现在RynnValue的训练数据中。面对新的真实机器人环境,RynnValue也没有进行目标域微调,而是直接作为奖励标注器,为在线和离线RL提供过程反馈。

零样本迁移的是价值模型和奖励能力。机器人策略仍然使用对应任务的数据进行训练和强化学习。

离线实验使用IQL,从成功与失败混合的数据中继续优化 π0.5 策略;在线实验使用DSRL,在冻结VLA的基础上学习潜变量策略。每种策略在每项任务上评测20次。

在线RL中:

  • RynnValue的平均成功率达到 72.5%

  • Robometer为52.5%,稀疏奖励为48.8%;

  • 在铲子转移牛排任务上,RynnValue达到75%,比Robometer提高30个百分点;

  • 在双臂搬箱任务上,RynnValue达到100%,提高35个百分点。

离线RL中:

  • RynnValue的平均成功率达到 82.5%

  • Robometer为63.8%,原始SFT策略为23.8%;

  • 面包放置达到100%,牛排转移和抽屉放置均达到90%;

  • 原始SFT成功率为0的抽屉放置和双臂搬箱任务,被分别提升至90%和50%。

RL好用,但缺少可规模化的反馈信号?!阿里提出RynnValue,正式开启scaling时代图8

真机结果完成了RynnValue Scaling路线中最关键的一步。

它证明从大规模异构数据中学到的价值能力,不只能够在未见数据集上评价轨迹,还可以在不微调价值模型的情况下,迁移到新的真实机器人任务,并产生足以改善策略的反馈信号。


08

从规模化价值监督,到价值基础模型


RynnValue所讨论的Scaling,可以归纳为三个层次。

第一,使用时间距离替代偏好对和任务内部进度,使价值监督可以随着轨迹数据同步扩展。

第二,在数据扩展中,任务多样性比重复采集同类episode更能推动未见任务泛化,单纯扩大模型参数带来的收益则相对有限。

第三,通过零样本真实机器人RL,规模化训练得到的价值能力最终转化成了策略能够使用的反馈信号。

这也让价值模型的定位发生了变化。它不再只负责对一组轨迹进行离线评分,而是可以同时服务进展估计、失败识别、策略评价和强化学习奖励。

随着VLA逐渐成为机器人动作生成的通用底座,价值基础模型可能成为与其配套的另一类基础模块。

目前,RynnValue仍以时间距离作为主要价值目标。未来,这套接口还可以进一步扩展到安全、能耗和操作精度等更丰富的价值维度。

对于机器人强化学习来说,真正值得关注的或许不只是策略模型还能扩大多少,而是反馈信号能否以同样的速度走向规模化。

RL好用,但缺少可规模化的反馈信号?!阿里提出RynnValue,正式开启scaling时代图9


END

 推荐阅读 :

RL好用,但缺少可规模化的反馈信号?!阿里提出RynnValue,正式开启scaling时代图10


关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。
阿里
more
阿里荣膺 ACL 2026 最佳资源论文奖,揭示AI Agent的专家能力鸿沟
阿里发布RynnBrain1.1,从122B具身基模到跨本体操作,一套模型打通“看懂-定位-行动”
蔡崇信吴明华宣布离婚,阿里与体育资产版图维持原状
阿里达摩院启动“阿里星”招募,聚焦AI芯片与医疗智能体前沿课题
狐讯 | 上海重磅发布“星枢计划”;阿里 Token Plan 个人版发布
离谱!欧盟罚阿里42亿,中国公司海外第二大罚款
刚刚,阿里开源2.4万亿参数大模型!性能比肩Fable 5
刘强东杀疯了,京东拿下第一,超越阿里巴巴
全球首台机器人手机,能预购了!与阿里合作
嘉宾观点 | 阿里云王鹏:面向AI集群的OCS技术演进及应用展望
Copyright © 2025-成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号