CoRL 2026 | 0条带力数据预训练!上海交大卢策吾、汶川团队让VLA学会力

机器之心 2026-09-27 17:34

CoRL 2026 | 0条带力数据预训练!上海交大卢策吾、汶川团队让VLA学会力图1


把一本书放到书架,前面的动作并不复杂:找到空位,对准方向,向前推。真正的困难在接触发生时:书撞到旁边了吗?推的方向偏了吗?推到底了吗?在这种时候,视觉几乎没有任何变化,模型只能靠力来推断任务状态。


想学会力,离不开数据。但是力和真实机器人硬件强绑定,带力数据采集成本太高,也很难通过 UMI、ego 等方式规模化。


还有更棘手的问题:引入新模态会改变模型架构,是否需要重新预训练,又会不会让模型遗忘原有知识?


这些一直是纯视觉预训练 VLA 不得不面对的问题。


上海交通大学卢策吾、汶川团队联合穹彻提出 LIFT(Late Reactive Injection of Force for VLA Post-Training),在保留模型预训练知识的情况下,仅通过在线后训练教模型学会感知力,并通过力高频反应式生成动作。


这项工作被 CoRL 2026 高分收录,其核心贡献是走通了预训练学先验知识,后训练靠力学高频反应式操作的训练范式,为 VLA 解决感知模态稀缺的难题提供新的可行解。甚至不只是 VLA,对任何以 MoT 为基础架构的预训练模型,LIFT 所提出的方法在理论上都可以适用。相关代码已经开源。


CoRL 2026 | 0条带力数据预训练!上海交大卢策吾、汶川团队让VLA学会力图2



CoRL 2026 | 0条带力数据预训练!上海交大卢策吾、汶川团队让VLA学会力图3

图1 LIFT方法总览。LIFT复用预训练动作专家参数,通过反应式力注入与在线纠正学习接触行为。


先看结果:力显著提升任务表现


团队在叠毛巾、插书和汉诺塔圆环放置三个任务上进行测试,LIFT 相比纯视觉后训练分数提升为:




只需要 20~30 条带力的在线数据,就可以达到这样的效果。而且不仅是插书、汉诺塔放圆环这样的密集接触任务,像叠毛巾这类接触状态相对简单的任务,力依然可以提升其表现并加速这一过程。


想要用好力,LIFT 提出了必须解决的三个难点。


用好力,需要解决三个难点



围绕这三个难点,LIFT 提出了一套完整且系统的解决办法。


反应式注入力,完成控制闭环


CoRL 2026 | 0条带力数据预训练!上海交大卢策吾、汶川团队让VLA学会力图4

图2 LIFT架构图。


LIFT 复制预训练动作专家参数,得到一个能根据力反馈及时调整动作的「反应式动作专家」。它通过因果交叉注意力感知最新一个时间段内的力,并据此高频反应式地调整动作;视觉和语言信息则提前计算并缓存,将控制闭环频率从 1Hz 显著提高到 10Hz。


对齐动作专家输出,保留预训练先验知识

CoRL 2026 | 0条带力数据预训练!上海交大卢策吾、汶川团队让VLA学会力图5

图3 平移因果注意力掩码。


如图 3 所示,LIFT 使用平移因果注意力掩码。P 为视觉语言前缀,a 为基础动作 token,r 为反应式 token。①为 base 动作专家注意力,保持全自注意力。②确保反应式动作专家注意力因果性。③为平移注意力。通过权重复制,训练起始时 a=r。通过平移注意力,r 获得与 a 数值完全相同的上下文 token,进而对齐两个动作专家的输出。通过这种方式,LIFT 在数值层面保持预训练模型先验知识。


视觉数据和带力纠正混合训练


CoRL 2026 | 0条带力数据预训练!上海交大卢策吾、汶川团队让VLA学会力图6

图4 LIFT训练管线。


LIFT 采用二阶段式训练。第一阶段,团队用  采集不带力的纯视觉数据,让模型先学会目标任务;第二阶段,再把模型部署到机器人上,通过在线人工纠正,学习真实接触下的动作调整。在第二阶段,模型同时利用视觉数据和带力数据,对于不含力的纯视觉数据通过力掩码截断其梯度。


LIFT 的四个关键结论


CoRL 2026 | 0条带力数据预训练!上海交大卢策吾、汶川团队让VLA学会力图7

图5 LIFT主要实验结果。横轴为在线采集到的10fps数据帧数,只使用人类干预部分数据训练和统计。每次在线实验2~3小时,采集20~30条数据。


仅靠后训练也能学会力


整个实验中,LIFT 没有用任何一条带力数据重新预训练。


团队证明了在后训练中注入力依然可以发挥力的优势,这是一条更加实际却足够吸引人的路线。


接触一变,动作要立马跟上


许多机器人策略会一次预测未来一段动作,形成一个动作块。这样的设计有利于动作连贯,却也带来一个问题:如果机器人在一个动作块执行途中时碰到阻碍,只能等到下一个动作块生成时再尝试调整。而在接触过程中,任务的成败往往是由一瞬间的精细调整决定的。


LIFT 反应式地注入力,使得策略可以在动作块内根据实时的力感知做高频调整。图 5 对比了 LIFT 与没有反应式力注入的基线,团队发现反应式地注入力对密集接触任务尤其重要。而在叠毛巾这类没有复杂接触的任务上,反应式地注入力相比于纯视觉策略,依然显著加速了任务表现的提升。


真实失误中才好学会力


力与视觉不同,轻微的位置变化就可能带来力分布的巨大漂移。而一旦力出现在数据分布外,模型可能就傻眼了。LIFT 在线地采集带力数据,让数据分布随着模型更新,极大地缓解了这一问题。图 5 对比了 LIFT 与离线采集带力数据的基线,证明了这一结论。


学会力,也能保留先验知识


CoRL 2026 | 0条带力数据预训练!上海交大卢策吾、汶川团队让VLA学会力图8

图7 桌布、物体和光照改变的条件。


CoRL 2026 | 0条带力数据预训练!上海交大卢策吾、汶川团队让VLA学会力图9


后训练加入力,有没有让模型忘记预训练知识?团队发现经过后训练,模型同时保留了力的知识和泛化能力,在桌布、光照甚至操作物体变化后任务表现并没有出现显著下降。


结语:学会力,为时不晚


LIFT 展示了一条面向现有预训练模型的后训练路径:先利用大规模预训练建立任务先验知识,积累空间理解能力,再用少量真机带力纠正补上接触细节;在模型侧,通过复制动作专家、平移因果注意力和零初始化交叉注意力,让新增模态从原有能力出发;在数据侧,通过在线后训练,让数据覆盖策略自身真正遇到的接触状态。


正如论文标题所说,对力而言一直都不晚。


CoRL 2026 | 0条带力数据预训练!上海交大卢策吾、汶川团队让VLA学会力图10


© THE END 

转载请联系本公众号获得授权

投稿或寻求报道:liyazhou@jiqizhixin.com

关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。
more
OpenAI,经历了最漫长的一天
OpenAI最强模型因DNS漏洞“越狱”,自我复制代码引发安全警报
本周AI项目推荐:Ling、AirJelly、HanaAgent……Muse之外的Personal Agent路线
微信鸿蒙版App安装量破8000万;豆包手机助手回应努比亚手机王者荣耀异常;华为大疆联名推出Pocket 4;OpenAI暂停最强模型训练...
围观科学家云集的两场活动,我发现他们都建议“别太依赖 AI”
努比亚AI手机玩《王者荣耀》被踢下线,豆包助手致歉称无外挂行为
刚刚,OpenAI又停训了:Agent逃出沙箱,更多越权事件被扒
人教版英语课本“女孩”现身辟谣:非AI生成,未收分文稿费
Meta Connect现场直击:去摄像头化与AI代理,智能眼镜的“务实”突围
啥题啊能干崩OpenAI最强模型训练…
Copyright © 2025-成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号