
人类可以自然地把数字世界里学到的操作能力迁移到物理世界:第一次接触陌生游戏或机器人,只需看懂规则、观察几次反馈,就能逐渐掌握操作。由此产生了一个关键问题:在海量数字数据上训练的视觉语言模型,能否不经过机器人专项训练,直接把已有智能迁移到实体机器人?
RoboDawn 给出的答案是:通过一套符合人类直觉的语义动作接口,加上少量上下文演示,冻结参数的 VLM 也能完成闭环机器人控制。

论文标题:Transferring the Intelligence of VLMs to Robotic Control
论文链接:https://arxiv.org/pdf/2609.22966
项目主页:https://RoboDawn.top/
作者单位:清华大学、腾讯混元
1. 为什么不继续训练一个机器人模型?
当前具身智能的主流路线,是在预训练 VLM 基础上,使用大量机器人专属数据微调视觉语言动作模型(VLA)或世界动作模型(WAM),学习从观测到动作的映射。
问题在于,机器人数据不仅昂贵,而且通常绑定特定机器人形态、场景和任务,很难规模化迁移。更棘手的是,近期研究发现,针对动作预测持续微调 VLM,可能损害模型原有的指令遵循与逻辑推理能力:机器人数据的规模和丰富度远低于 VLM 的预训练语料,大规模参数更新容易让模型过拟合到狭窄分布。

清华大学与腾讯混元团队提出 RoboDawn,探索一条不同的路线:不使用大规模机器人数据更新模型参数,而是设计轻量交互接口,再用少量上下文示例教会 VLM 如何使用这套接口。
2. RoboDawn 如何把 VLM 接到机器人上?
RoboDawn 的关键不是让 VLM 直接预测关节级控制信号,而是提供一套类似游戏操作的离散语义指令,包含平移、旋转、夹爪控制、复位、等待和任务完成等动作。
这些指令统一以夹爪交互点——两个指尖的中点——为基准。VLM 只需决定“向哪个方向移动多少”“绕哪个轴旋转多少”以及“何时开合夹爪”,系统再把语义指令自动转换为完整运动轨迹。底层轨迹规划与机器人控制对模型保持透明,从而显著降低理解和决策成本。

仅有文字说明还不够。RoboDawn 进一步把上下文示例拆成两层:通用指令说明展示每条基础动作的实际效果,任务级示例展示如何把动作组合成完整策略。它们只是输入上下文,不触碰模型参数;还可以按上下文长度做稀疏化,只保留抓取、旋转与任务完成等关键节点。
在闭环执行中,模型会反复经历“观察—推理—执行—反馈”:每完成一步,都重新观察环境,根据真实结果修正下一步动作。相比一次性生成完整轨迹,这种方式更容易处理动作偏差和环境变化。
3. 一条示例,能带来多大提升?
团队在模拟基准和真实机器人上验证了 RoboDawn,覆盖不同任务、环境与机器人形态。
在 RoboTwin 2.0 C2R 的 50 个双手操作任务上,对比方法通常使用每项任务 50 条演示做全量训练。RoboDawn 全程不更新参数:零样本设置下,基于 GPT-6 Astra 的版本达到 53.2% 成功率;加入 1 条上下文示例后提升到 **73.6%**,比 HarnessVLA(Claude Code)高 15.2 个百分点。
消融实验显示,一条示例带来的提升最明显;继续增加示例通常仍有收益,但达到 8 条时略有回落,说明过长上下文会干扰 VLM 推理。底层模型能力越强,RoboDawn 的效果越好;移除显式推理或网格定位模块,也会造成明显下降。
在 RoboDojo 的 42 个双手任务上,RoboDawn 零样本成功率达到 **35.67%**,单样本达到 **47.17%**,明显高于全量训练的 DM0.5(19.34%)。

指令预算从 60 增至 240 时,单样本成功率由 31.2% 上升到 47.2%。这说明模型不仅会执行预定动作,还能利用持续观察、反馈与记忆进行错误恢复。不过,RoboDawn 的单步推理延迟仍高于端到端 VLA;它平均仅需 3.4 条高层指令完成任务,后续可通过推理与运动的流水线并行改善整体效率。
真实 Franka 机器人测试中,放积木到篮子的成功率达到 **90%**,积木堆叠达到 50% ,证明该方法可以从模拟环境迁移到实体场景。
4. 能力边界在哪里?
RoboDawn 仍有清晰的局限。首先,推理延迟较高,不适合需要高频反馈的控制任务;其次,VLM 对平移动作的理解通常比旋转和三维姿态更可靠;离散语义指令也难以覆盖高精度插入、接触和放置。

另外,高层语义规划正确,不代表底层物理执行一定安全。逆运动学求解仍可能让机械臂碰撞周围物体,模型对“任务已经完成”的判断也可能与评测标准不一致。面向真实部署,碰撞防护、动作约束和失败恢复仍是不可绕过的问题。
RoboDawn 的意义不在于替代端到端 VLA,而是证明了一件值得重视的事:对于相当一部分通用操作任务,预训练 VLM 可能已经具备决策能力,缺少的是一套它能够理解、机器人又能执行的接口。与其一味扩充机器人数据、更新大模型参数,设计更好的交互抽象和上下文教学,也可能成为具身智能的重要路线。
> 本文由 AI 生成,机智流编辑部校对
-- 完 --
机智流推荐阅读:
1.
2.
3.
4.
cc | 大模型技术交流群 hf | HuggingFace 高赞论文分享群 lc|LangChain 技术交流群 code | AI Coding 交流群 具身 | 具身智能交流群 硬件 | AI 硬件交流群 推理 | AI 推理框架交流群 智能体 | Agent 技术交流群