VLA开环盲区,终于被堵上了:40M Corrector让机器人边做边纠错

机器之心 2026-09-05 15:11
VLA开环盲区,终于被堵上了:40M Corrector让机器人边做边纠错图1



机器人抓住积木,正准备往碗里放。就在这时,有人突然把碗挪走了。


人会本能地停一下、看一眼,再重新对准;但不少 VLA 机器人不会。它明明还在接收相机画面,手上却继续执行几百毫秒前生成的旧动作,最后把积木放进空气里。


这不是模型「没看见」,而是它在这段时间里,根本没被允许重新思考。


浙江大学 ACES 实验室 OmniAI 团队与阿里巴巴达摩院的最新工作 VLA-Corrector,盯住了这个长期被 action chunk 掩盖的问题:VLA 一次预测一串动作确实高效,但从开始执行到下一次推理之间,也出现了一块危险的开环盲区



他们给出的答案很直接:不必逼大模型每一步都重算,也别让机器人闭着眼把整段动作做完。给 VLA 加一个约 40M 参数的轻量级 Corrector,让它知道什么时候该继续,什么时候必须停手纠错。


VLA开环盲区,终于被堵上了:40M Corrector让机器人边做边纠错图2

长 action horizon 与严格闭环执行的对比


VLA 明明一直睁着眼,为什么还像没看见?


现在主流的生成式 VLA,常用 action chunk 来摊薄推理成本:模型看一次画面,一口气生成未来一段动作;机器人再从中连续执行前 H 步。H 越大,调用模型的次数越少,动作也更连贯。


代价同样明显。抓取时打滑、插入时偏了两毫米,或者目标被人移动,后面的动作就已经「过期」了。但只要 horizon 还没结束,机器人仍会照着旧计划往下做。小偏差很快滚成大错误,等下一次推理终于到来,状态可能已经偏到救不回来了。


把 H 设成 1,当然可以步步闭环,却等于每个控制步都调用一次 VLA。论文的 horizon sweep 也把这笔账算得很清楚:以 π0.5 为例,拉长 horizon 能把 policy call 降低约 4 倍,但成功率会从约 64% 掉到 49% 以下。


所以,问题并不是再猜一个「最佳 H」。真正该问的是:当前这段动作,什么时候已经不值得信了?


不要一直重规划,

只在动作失效的那一刻接管


VLA-Corrector 没有改动 VLA 主干权重,而是在推理链路外加了一条「监测—打断—纠正」的旁路。


第一步是监测。Latent-space Vision Monitor(LVM)学习一个很局部的问题:执行这个动作后,视觉特征接下来应该往哪个方向变化?在线运行时,它不断比较「预期变化」和相机里「真实发生的变化」。模型不是直接预测像素,而是在信息密度高的 latent space 中预测视觉动态残差。这样有助于减少静态背景,光照的干扰,让模型优先关注对执行任务而言重要的动态部分,降低学习难度的同时还能让预测更加准确。


第二步是打断。如果这种偏差持续出现,而非单帧抖动,系统立刻清空队列中尚未执行的 stale actions。动态阈值、迟滞机制和连续步检查,保证它不会一有风吹草动就停机。


第三步才是纠正。简单地再问一次 VLA,可能只会得到另一段同样出不去的动作。为此,Online Gradient Guidance(OGG)会把刚才检测到的视觉偏差变成梯度信号,只引导中断后的那一次恢复推理,把新动作往更可恢复的方向推。


VLA开环盲区,终于被堵上了:40M Corrector让机器人边做边纠错图3

VLA-Corrector:监测、打断与纠正


这套机制最终得到的不是另一个固定 horizon,而是事件触发的自适应 horizon:搬运平稳时,大步往前走;到了抓取、对齐、插入这些容易出错的阶段,随时准备切回短视野纠错。实验中,83.7% 的截断恰好发生在这些关键阶段。


换句话说,它不是在开环和闭环之间二选一,而是把闭环反馈用在了最值钱的时刻。


成功率涨了,调用次数反而还能降


在 MetaWorld 上,给 π0.5 加入 VLA-Corrector 后,平均成功率从 48.70% 提升到 64.35%;在 Very Hard 任务上,提升达到 24 个百分点


更有意思的是,它并不是靠疯狂增加推理次数换来的。SmolVLA 在 horizon 10 下,成功率从 61.90% 提升到 73.00%,平均 policy call 却从 19.27 次降到 15.64 次。原因不难理解:及时扔掉过期动作,远比在失败轨迹上继续浪费整段 chunk 划算。


真实 AgileX PiPER 机械臂上的结果更直观。九项任务的平均成功率从 55.6% 提升到 73.3%;在人为移动物体或目标的扰动恢复任务中,成功率从 40.0% 跃升到 68.3%。而在 LIBERO 上,加入 Corrector 的 few-shot 模型达到 97.8%,还超过了 fully fine-tuned baseline 的 96.95%。


VLA开环盲区,终于被堵上了:40M Corrector让机器人边做边纠错图4

VLA-Corrector 的真实机械臂结果


这项工作真正值得带走的 insight


过去我们常把 VLA 的可靠性理解成「第一次就预测出完美动作」。但机器人进入物理世界后,动作会反过来改变环境,计划也会随时过期。一个永远不犯错的长动作块并不现实,真正重要的是:系统能不能尽早知道自己已经走偏,并保留打断自己的权力。


VLA-Corrector 给出了一种很有启发的系统分工:大模型负责提出计划,小模型负责审计计划,执行层拥有随时叫停的权力。 这可能比一味堆大 backbone 更接近具身智能的可靠落地。


它当然不是万能恢复器。OGG 仍受基础策略能力上限约束。但VLA-Corrector真正的核心在于它能有效抑制错误在开环盲区中被放大,大幅降低VLA policy从错误中恢复的难度。它改变了问题的解法:不再要求 VLA 时时严格闭环,而是让系统在该闭环的瞬间,真的闭上这个环。


一句话概括:机器人未必需要永远不出错,但它必须学会不把错误继续做完。


作者介绍


本工作由浙江大学 OmniAI 团队与阿里巴巴达摩院联合完成,第一作者是浙大准研一的硕士研究生潘翼,研究聚焦 action-chunked VLA 的开环盲区与真实机器人纠错,通讯作者为浙大百人计划研究员张文祺。


VLA开环盲区,终于被堵上了:40M Corrector让机器人边做边纠错图5


© THE END 

转载请联系本公众号获得授权

投稿或寻求报道:liyazhou@jiqizhixin.com

关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。
机器人
more
出货量市占率位列行业前列,WRC知行机器人给出具身智能新解题思路
人形机器人背后的“隐形冠军”,要赴港IPO了
中国机器人干到全球第二,给 F-35 造测试设备的美国公司坐不住了?
汽车早餐 | 一汽攻克硫化物全固态电池低压力运行重大技术难题;马斯克称10年内全球人形机器人超10亿台;1-7月全球汽车销量达5611万辆
新品直击|走得更稳、走得更远,优龙机器人下肢助力全系产品福祉博览会亮相
山东大学出来的机器人团队,完成亿元级融资
一池水,困住了中国机器人
马斯克G20连线预言:AI将终结数字岗位,人形机器人产能超人类总和
元点“小桥”机器人8888元爆卖后,我发现他们在构建物理AI的新路径
The Imitator Game:定义机器人视频模仿能力的完整评测框架
Copyright © 2025-成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号