点击下方卡片,关注“具身智能之心”公众号
最近看到了一篇新工作Harness VLA。
同一个 VLA,参数保持冻结,只是换了一种被组织和调用的方式,在模型泛化性测试任务 LIBERO-Pro 上的成功率就从 50.0% 提升到了 82.4%,而同期英伟达的Cap-X仅18.2%。
这正是Harness VLA值得关注的地方。
机器人并没有重新学会一套抓取或放置动作,底层模型的能力也没有发生改变;真正变化的是,这些已有能力如何进入任务执行过程。
过去,当 VLA 在新目标、新布局或长时程任务中表现不佳时,最直接的思路通常是继续扩大模型规模、收集更多机器人轨迹,让模型覆盖更多任务状态。但近年来 Claude Code、Codex 等 Coding Agent 的发展表明,决定一个 AI 系统最终能力的,可能不只是基础模型本身。
这也带来了一个自然的问题:
当基础模型从数字世界进入物理世界,VLA 是否也需要属于自己的 Harness?
这篇工作来自清华大学于超教授团队。
之前我们一直在跟进RLinf相关进展,这次看到Harness VLA之后,觉得这种不继续微调底层 VLA,也不在部署阶段不断增加新的机器人技能,而是改变冻结 VLA 在系统中的使用方式很有意思。VLA 不再独自承担从任务开始到结束的完整控制,而是进入一个能够组织调用、接收反馈并处理失败的 Agentic 执行闭环。
这项工作所关注的,不只是怎样训练一个能力更强的 VLA,而是另一个长期被忽视的问题:
VLA到底应该怎么用?

论文链接:https://arxiv.org/pdf/2607.08448
项目主页:https://harnessvla.github.io/
01.
重新划分 VLA、解析式控制与规划器的职责
一个机器人长程任务通常包含多种性质不同的操作。
以“拿起平底锅,将其放进水槽,然后打开水龙头”为例,机器人首先需要理解语言指令,识别平底锅、水槽和水龙头;随后导航至合适位置,使机械臂能够接近平底锅并完成抓取,将其运输到水槽附近,再调整姿态完成放置,最后重新寻找并操作水龙头。
在这一过程中,真正需要学习型视觉运动控制的,主要是不规则抓取、受约束放置和水龙头操作等富接触阶段。自由空间运输、腕部调整、底盘导航、夹爪释放和重新预置位,则更适合由确定性较强的控制器完成。

原语组合如何使冻结 VLA 能够用于原始轨迹分布之外的任务状态
端到端 VLA 通常被要求从任务开始一直控制到任务结束。这意味着模型不仅要学习接触动作,还要同时承担目标定位、任务分解、长距离运动和失败恢复。一旦任务指令、物体布局或目标关系发生变化,模型可能继续执行训练阶段熟悉但已经不再适用的行为。
而 Harness VLA 将系统能力重新分为三部分。
首先,冻结 VLA 被封装为统一的 VLA_ACT 原语,负责抓取、受约束放置、按钮按压、抽屉和门操作等富接触行为。不同 Benchmark 可以使用不同的冻结 VLA,但它们向高层规划器暴露相同的调用接口。
其次,固定的解析式原语负责非接触执行,包括末端移动、位姿调整、腕部旋转、夹爪控制、运输、释放,以及在移动机器人场景中的底盘导航和局部微调。例如,MOVE_TO 用于将末端执行器移动到目标区域,RELEASE 用于释放物体,RoboCasa365 中的 NAVIGATE_TO 则负责厨房尺度的移动平台预置位。
最后,Agentic Planner 通过few-shot learning来理解任务,最终可以实现zero-shotdepolyment,即根据实时 RGB-D 观测进行目标定位、选择下一项原语、检查执行结果,并在失败后重新组织任务。

Harness VLA 系统总览
这套原语库在部署前便已固定。规划器不能在评估过程中临时生成新的低层控制程序,也不能通过扩展技能库覆盖每个失败案例。
因此,Harness VLA 学习的并不是新的机器人技能,而是已有原语的适用范围:什么阶段应该使用解析式控制,什么时候需要调用 VLA,调用前应怎样调整机器人状态,以及一次接触失败后如何重新尝试。
02.
VLA_ACT:关键不只是调用 VLA,
而是学会何时、如何调用
将冻结的 VLA 封装为 VLA_ACT,并不意味着只要增加调用次数,就能自然提升任务成功率。如果机器人尚未接近目标,观察视角或接触前姿态不合适,或者当前任务还没有进入真正需要富接触控制的阶段,VLA 仍可能在超出其优势范围的状态下执行。
因此,Harness VLA 的关键不只是为 Agentic Planner 提供一个 VLA 接口,而是让它逐步掌握 何时调用 VLA,以及调用前应创造怎样的局部条件。VLA_ACT 主要负责抓取、受约束放置和机构部件操控等富接触行为;在此之前,Planner 会先利用解析式原语完成目标定位、空间移动和预置位,尽可能将机器人调整到适合 VLA 接管的局部状态。
每次 VLA_ACT 调用都受到任务提示、动作块预算和提前返回条件的约束。调用结束后,控制权重新交还给 Planner,系统再根据新的 RGB-D 观测和机器人状态判断局部操作是否取得了预期效果。如果结果不完整或不稳定,Planner 可以调整接触前构型,重新预置位后再次调用 VLA,而不是在相同条件下机械重复。
由此,Harness VLA 将冻结 VLA 从一条需要承担完整任务的单体式策略,转化为一种由 Planner 选择调用、具有明确执行边界,并能够在重新预置位后再次尝试的局部富接触原语。系统真正需要探索和积累的,并不是新的底层动作技能,而是 VLA 的适用阶段、合适的接管状态,以及局部失败后的恢复方式。
03.
如何学会调用 VLA:闭环探索与两类记忆
上一节的问题随之而来:Agentic Planner 如何判断 VLA 应该在什么阶段介入,调用前应当怎样预置位,以及局部操作失败后应如何组织下一次尝试?
Agentic Planner 本身已经具备一定的任务理解、场景分析和工具调用能力。即使没有任务级记忆,它也能够根据当前指令和 RGB-D 观测选择解析式原语,或直接调用 VLA_ACT。但这类通用 Agentic Planner 的能力主要来自互联网文本、代码和多模态数据,并没有针对当前机器人形态、原语接口以及冻结 VLA 的实际能力边界接受系统性的具身执行训练。
因此,Agentic Planner 往往能够从语义上判断“下一步大致应该完成什么”,却未必准确掌握“怎样执行才更容易成功”。例如,它可能知道当前需要抓取某个物体,但不一定知道应当先将机械臂调整到什么接触前位姿;它可能判断此时需要调用 VLA,却未必清楚什么视角和局部状态更符合冻结 VLA 的训练分布;当抓取或放置失败后,它也可能缺少针对具体物理结果的恢复经验。
Harness VLA 并不是让 Agentic Planner 从零开始学习如何调用 VLA,而是通过闭环探索和记忆积累,对其原有的通用推理能力进行具身执行层面的校准。系统需要逐步确定各类原语的实际适用范围:哪些阶段可以稳定地交给解析式控制,VLA 应当从什么局部状态开始工作,怎样设置调用提示和提前返回条件,以及一次接触失败后应如何改变下一次尝试的初始条件。
在每个执行轮次中,Agentic Planner 综合任务描述、RGB-D 观测、机器人本体状态和记忆上下文,选择并发出一项结构化原语调用。原语执行结束后,环境返回新的观测与机器人状态,Planner 再根据实际物理结果判断是继续当前流程、切换到下一阶段,还是调整方案并重新尝试。这个循环持续到任务完成或预算耗尽。
在探索式自举阶段,Agentic Planner 会在一个参考任务实例上尝试不同的原语顺序、接触前位姿、VLA_ACT 调用时机和提前返回条件。此时系统允许使用 RESET,并提供相对充足的探索预算。自举阶段要寻找的并不只是一条偶然成功的执行轨迹,而是一种经过物理执行验证的原语组织方式:任务的哪些部分应由解析式原语完成,VLA 应在什么状态下接管,以及局部失败后应如何重新定位和预置位。
任务成功后,这些经验会被写入两类记忆。
Task Specific Memory 保存经过验证的原语调用序列,包括 VLA_ACT 在任务流程中的调用位置,以及富接触操作与运输、姿态调整、释放等阶段之间的组织关系。轨迹中的具体坐标会被替换为依赖实时感知的符号化查询,使相同的执行结构能够在新的物体布局中重新实例化。它保存的不是某一次执行中的固定动作,而是关于“这一任务应当如何组织不同原语”的任务级结构先验。
Global Memory 则记录能够跨任务复用的成功规则和失败模型,例如如何识别空抓取和错误的成功判断,以及遇到不稳定接触时应如何重新定位、调整姿态和再次预置位。它补充的不是某个任务的具体步骤,而是能够帮助 Planner 修正判断、避免重复已知错误的通用执行经验。
进入部署评估后,RESET 被禁用,执行预算也会收紧。Planner 会检索参考实例中形成的任务结构,但不会直接回放原有轨迹,而是根据当前 RGB-D 观测重新确定目标、绑定空间参数,并在执行过程中持续检查每项原语的实际效果。记忆提供的是经过验证的调用结构和恢复经验,具体的目标位置、预置位姿和调用参数仍需根据当前场景动态确定。
因此,两类 Memory 并不是替代 Planner 的在线推理,也不是保存一套冻结的动作答案。它们的作用,是弥补通用 Planner 在具身执行经验上的不足,将其原本较为粗粒度的任务理解和工具调用能力,进一步校准为对当前机器人、固定原语库和冻结 VLA 更可靠的调度能力。Planner 仍然负责根据实时场景作出决策,而 Memory 则帮助它更准确地判断 VLA 应在何时介入、从何种状态开始执行,以及失败后应如何组织下一次尝试。
04.
实验设置与整体结果
论文在 LIBERO、LIBERO-Pro、RoboCasa365 和 RoboTwin C2R 四类 Benchmark 上评估 Harness VLA。不同任务使用各自对应的冻结 VLA,但都通过统一的 VLA_ACT 接口接入同一套固定原语库;在正式部署阶段,系统既不微调底层 VLA,也不引入新的原语。
整体实验主要包含三种设定:基于 Task Specific Memory 的少样本评估、不使用目标设定 Memory 的零样本评估,以及从 Clean 场景到 Randomized 场景的直接迁移。这样的安排不仅用于比较最终成功率,也试图区分在线规划能力、任务级执行记忆和底层 VLA 能力各自发挥的作用。
基于任务记忆的少样本评估
在少样本设定下,Agent 首先在一个参考 Seed 上进行任务级自举,将成功的参数化原语轨迹写入 Task Specific Memory;随后在新的 Seed 或扰动条件下,根据实时 RGB-D 观测重新确定目标和空间参数,而不是直接回放参考场景中的固定坐标。
Standard LIBERO 首先用于检查:将冻结 VLA 纳入原语化闭环后,是否会损害它原有的分布内能力。直接运行冻结 VLA 时,总体成功率为 95.3%;接入 Harness 后为 96.0%。两者表现接近,说明新的执行组织方式基本保留了底层策略在标准任务中的原有能力。
LIBERO-Pro 则进一步改变任务指令或场景中的空间关系。其中,指令重定向要求机器人在相似场景中操作新的目标;位置交换则改变物体与目标区域之间的布局关系。直接运行冻结 VLA 时,总体成功率为 50.0%,Harness VLA 将其提升至 82.4%。由于两种方法使用相同的冻结 VLA,这组结果表明,原有的局部视觉运动能力在扰动场景中仍然具有利用价值,但需要由 Planner 根据当前任务和观测重新组织其执行。

LIBERO-Pro 上的总体成功率(%)。 “/”表示该结果不可用或未报告。Cap-X 和 RATS 仅报告了 6 个不包含 LIBERO-10 的评测项,因此其总体结果仅对已报告的单元格取平均。
RoboCasa365 将评估从桌面操作扩展到家庭厨房任务。此类任务不仅包含抓取和放置,还涉及移动平台预置位、抽屉和水龙头等关节式机构操作,以及多个阶段组成的复合流程。直接运行冻结 VLA 的任务加权总体成功率为 30.0%,Harness VLA 达到 55.4%,说明相同的原语接口和 Memory 工作流可以进一步应用于执行链条更长、任务结构更复杂的场景。

RoboCasa365 上的成功率(%)。分隔线上方的基线结果来自相应先前论文在 ATOMIC-SEEN、COMPOSITE-SEEN 和 COMPOSITE-UNSEEN 三个评测的报告。
Memory 对执行有什么影响?
为了将 Planner 的在线推理能力与自举阶段形成的任务记忆区分开来,论文还在 LIBERO-Pro GOAL 上设置了严格的零样本评估。在该设定中,系统不检索目标设定下的 Task Specific Memory 和对应的 Global Memory,只依靠当前任务指令、实时观测和固定原语接口进行在线决策。
结果显示,不使用 Memory 时,Harness VLA 在指令重定向任务上仍达到 79.0%,与少样本设定下的 87.0%较为接近;但在位置交换任务上,成功率由少样本设定下的 87.0%下降到 31.0%。
这一差异说明,两类扰动对系统提出的要求并不相同。语义目标发生变化时,Planner 可以较多依赖当前指令和视觉观测在线重新确定操作对象;而当物体布局发生明显变化时,接触前预置位、空间运输和不同原语之间的衔接更依赖参考实例中形成的任务级执行结构。
从 Clean 场景迁移到 Randomized 场景
RoboTwin C2R 采用了另一种迁移协议。Agent 先在 Clean 场景中获得一条 Task Specific Memory,随后将其直接应用到 Randomized 任务实例中。在随机化场景里,系统不再进行新的任务级自举,也不增加额外探索或微调底层 VLA。
直接运行冻结 VLA 时,C2R 成功率为 50.4%;使用 Harness VLA 后达到 58.4%。这里迁移的并不是 Clean 场景中的完整动作轨迹,而是经过参数化的原语组织结构;具体目标位置和调用参数仍需要根据 Randomized 场景中的实时观测重新确定。

RoboTwin C2R 上的成功率(%)。 各列比较了在C2R设定下,具有代表性的 VLA 基线与 Harness VLA 的性能。
总体而言,Harness VLA 在基本保持标准 LIBERO 性能的同时,在指令重定向、空间布局变化、厨房长时程操作和 Clean-to-Randomized 迁移中取得了更高的成功率。
LIBERO-Pro GOAL 上的 few-shot 与 zero-shot 对比还显示,在线规划与任务级 Memory 在不同类型的扰动中发挥着不同作用:指令重定向更多依赖当前任务描述和视觉观测,而位置交换则更依赖自举阶段形成的空间预置位与原语组织经验。
05.
实验分析:三个关键发现
在整体性能评估之后,论文进一步分析 Harness VLA 的具体执行过程,并总结出三个关键发现:Agentic Planner 层面的语义与场景重新定位能够恢复任务条件化行为;由 Agentic Planner 完成预置位后的 VLA_ACT 调用与重试能够提高冻结策略的可靠性;解析式原语则将非接触执行与富接触控制分离开来。
规划器层面的语义重新定位
在 LIBERO-Pro 的指令重定向任务中,视觉场景可能基本不变,但当前指令要求操作不同对象。冻结 VLA 往往仍会重复标准任务中的熟悉行为。
在位置交换任务中,物体与目标区域之间的关系已经变化,VLA 也可能继续将物体移动到训练阶段熟悉的位置。

LIBERO-Pro 中的目标重定向与布局交换。
这些失败并不一定表现为动作不流畅。机械臂可能正常靠近、抓取和移动,只是服务的对象或目标已经错误。
Harness VLA 将语义重新定位显式交给 Planner。规划器解析完整任务描述,根据实时 RGB-D 判断当前需要接触的对象和目标区域,再使用解析式原语完成接近和预置位。
VLA 仍然负责“怎样完成接触”,但“当前应当对谁执行接触”由规划器显式确定。
重新预置位后的稀疏调用与重试
空间布局发生变化后,目标可能不再以 VLA 熟悉的相对位置和视角出现。Planner 可以先通过末端移动、腕部旋转或底盘调整,将机器人送到更适合 VLA 接管的局部状态。
这相当于不要求 VLA 独自跨越整个分布偏移,而是先通过解析式控制,将当前状态重新映射到其更可能成功的工作区域。
一次接触失败也不再必然破坏整条长程任务。若抓取不稳定、物体只部分进入容器,或者机构状态没有改变,Planner 可以重新预置位并再次调用 VLA。
论文限制每个 Episode 允许调用 VLA 原语的最大次数,并统计累计成功率。结果显示,LIBERO-Pro、RoboCasa365 和 RoboTwin C2R 的成功率都在最初几次调用后迅速上升,随后逐渐接近完整 Harness 的最终性能。

不同 VLA 调用上限下的累计成功率
这说明 Harness 并不依赖大量无目的重复。VLA 调用仍然稀疏,关键在于 Planner 选择合适的调用时机,并在失败后改变局部初始条件。

重新预置位与局部重试案例
解析式原语隔离非接触执行
解析式原语并不是用来替代 VLA。它们处理的是富接触阶段周围的大量非接触结构,包括运输、预置位、腕部和底盘重新定向、撤退、导航和释放。
当 VLA 建立稳定抓取后,Planner 可以使用解析式原语将物体运输到目标区域;当任务再次进入机构操作或受约束放置阶段时,再重新调用 VLA。
这使同一个冻结 VLA 可以在更多状态中被复用,同时避免其承担长时程任务中的所有中间动作。
论文根据触发最终成功谓词的原语类别,对成功 Rollout 进行了归因统计。

不同 Benchmark 上的任务完成归因
在 LIBERO-Pro 系列任务中,VLA 通常先建立关键接触,任务随后由运输或释放等解析式原语完成。因此,最终成功谓词更多地在解析式原语后触发。
RoboCasa365 和 RoboTwin C2R 的任务末端则包含更多机构操作、受约束放置或双臂交互,因此成功更常发生在 VLA 原语执行后。
这种差异并不表示某类任务完全由某一种原语解决,而是说明 Harness 会根据任务结构调整两类能力的职责边界。
06.
这项工作代表着一类新的研究范式
作者在文末也进行了详细的定位与讨论。
Harness VLA 位于端到端机器人基础策略、多模态 LLM 智能体和程序化机器人控制三类研究方向的交叉位置。它的重点既不是微调一个能力更强的 VLA,也不是在部署过程中持续扩展技能库,而是利用 Memory-guided Agent,将冻结 VLA 转化为一种可控的富接触原语,并与固定的解析式控制器组合完成任务。
相较于端到端 VLA,Harness VLA 没有继续要求统一策略同时承担语言理解、目标定位、长程规划和低层控制。论文认为,现有 VLA 在不规则抓取、机构部件操控等富接触阶段具有明显优势,但在指令跟随、长程组合和分布外场景中容易退化。因此,Harness VLA 将语言解析、目标定位、运输、姿态调整、导航和释放交给高层 Agentic Planner,仅将 VLA 保留给局部富接触操作。
相较于多模态 LLM 智能体,Harness VLA 不让高层模型直接端到端预测机器人动作。Agentic Planner 位于闭环 Harness 中,通过结构化原语调用控制机器人,并在每次执行后读取新的 RGB-D 观测、执行反馈和 Memory,再决定下一步操作。
相较于 Code-as-Policies 等程序化机器人智能体,Harness VLA 不生成可执行代码或新的控制程序,而是在固定原语库中输出结构化 JSON 调用。解析式原语负责确定可执行的非接触阶段,VLA_ACT 则补充手工控制器难以覆盖的抓取、受约束放置和机构操作等富接触能力。
它与自动技能发现方法的关注点也不同。自动技能发现通常根据失败轨迹生成和验证新的技能,并不断扩展技能库;Harness VLA 则刻意保持原语词汇表固定,研究如何通过 Memory-guided composition 扩展冻结 VLA 的使用范围。成功的参数化原语序列被保存到 Task Specific Memory,可复用的成功规则和失败模型则进入 Global Memory。
同时作者指出这一设计也存在明确边界。固定原语库提高了接口的可控性和可审计性,但无法直接补充当前词汇表中缺失的能力;高层 Agentic Planner 与低层 VLA 之间的反馈机制仍有进一步闭合的空间,二者也尚未结合环境奖励和人类偏好进行联合优化。
此外,在高度杂乱或更长时程的任务中,细粒度视觉理解和结构化场景推理仍可能成为限制因素。未来,固定原语组合可以与经过验证的自动技能发现结合,在保留结构化接口的同时补充真正缺失的任务抽象。
07.
结语
Harness VLA 并不是对端到端 VLA 路线的否定,也没有提出新的 VLA 网络结构。它关注的是另一个问题:当一个预训练 VLA 已经具备较强的局部视觉运动能力时,机器人系统应当如何组织、调用并复用这些能力。
在这一框架中,VLA 不再作为从任务开始持续运行到结束的单体式策略,而是被封装为由 Agentic Planner 选择调用的局部富接触原语。Agentic Planner 与 Memory 负责目标定位、任务分解、预置位和失败恢复,解析式原语负责连接不同的接触阶段,VLA_ACT 则专注于抓取、受约束放置和机构操作等学习型控制更具优势的环节。
因此,Harness VLA 所强调的不只是模型“学会了什么”,还包括已有能力“在什么条件下被使用”。更强的 VLA 可以扩大局部富接触原语的能力范围,而更可靠的 Harness 则决定这些局部能力能否被正确调用、恢复并组合成长时程任务。对于具身智能系统而言,模型能力与执行组织可能是两个需要同时推进的问题,也是之前领域内一直忽略的研究方向。