不用额外训练也能控制机器人?清华与腾讯提出 RoboDawn

机智流 2026-09-23 20:00

不用额外训练也能控制机器人?清华与腾讯提出 RoboDawn图1

人类可以自然地把数字世界里学到的操作能力迁移到物理世界:第一次接触陌生游戏或机器人,只需看懂规则、观察几次反馈,就能逐渐掌握操作。由此产生了一个关键问题:在海量数字数据上训练的视觉语言模型,能否不经过机器人专项训练,直接把已有智能迁移到实体机器人?

RoboDawn 给出的答案是:通过一套符合人类直觉的语义动作接口,加上少量上下文演示,冻结参数的 VLM 也能完成闭环机器人控制。

不用额外训练也能控制机器人?清华与腾讯提出 RoboDawn图2

论文标题:Transferring the Intelligence of VLMs to Robotic Control

论文链接:https://arxiv.org/pdf/2609.22966

项目主页:https://RoboDawn.top/

作者单位:清华大学、腾讯混元


1. 为什么不继续训练一个机器人模型?

当前具身智能的主流路线,是在预训练 VLM 基础上,使用大量机器人专属数据微调视觉语言动作模型(VLA)或世界动作模型(WAM),学习从观测到动作的映射。

问题在于,机器人数据不仅昂贵,而且通常绑定特定机器人形态、场景和任务,很难规模化迁移。更棘手的是,近期研究发现,针对动作预测持续微调 VLM,可能损害模型原有的指令遵循与逻辑推理能力:机器人数据的规模和丰富度远低于 VLM 的预训练语料,大规模参数更新容易让模型过拟合到狭窄分布。

不用额外训练也能控制机器人?清华与腾讯提出 RoboDawn图3
图1:RoboDawn 将数字世界中的通用 VLM 智能,通过语义动作接口与上下文示例迁移到实体机器人控制

清华大学与腾讯混元团队提出 RoboDawn,探索一条不同的路线:不使用大规模机器人数据更新模型参数,而是设计轻量交互接口,再用少量上下文示例教会 VLM 如何使用这套接口。


2. RoboDawn 如何把 VLM 接到机器人上?

RoboDawn 的关键不是让 VLM 直接预测关节级控制信号,而是提供一套类似游戏操作的离散语义指令,包含平移、旋转、夹爪控制、复位、等待和任务完成等动作。

这些指令统一以夹爪交互点——两个指尖的中点——为基准。VLM 只需决定“向哪个方向移动多少”“绕哪个轴旋转多少”以及“何时开合夹爪”,系统再把语义指令自动转换为完整运动轨迹。底层轨迹规划与机器人控制对模型保持透明,从而显著降低理解和决策成本。

不用额外训练也能控制机器人?清华与腾讯提出 RoboDawn图4
图2:RoboDawn 整体框架,VLM 在多视角观测、机器人状态、执行反馈与记忆上持续推理,并输出可落地的语义动作

仅有文字说明还不够。RoboDawn 进一步把上下文示例拆成两层:通用指令说明展示每条基础动作的实际效果,任务级示例展示如何把动作组合成完整策略。它们只是输入上下文,不触碰模型参数;还可以按上下文长度做稀疏化,只保留抓取、旋转与任务完成等关键节点。

在闭环执行中,模型会反复经历“观察—推理—执行—反馈”:每完成一步,都重新观察环境,根据真实结果修正下一步动作。相比一次性生成完整轨迹,这种方式更容易处理动作偏差和环境变化。


3. 一条示例,能带来多大提升?

团队在模拟基准和真实机器人上验证了 RoboDawn,覆盖不同任务、环境与机器人形态。

在 RoboTwin 2.0 C2R 的 50 个双手操作任务上,对比方法通常使用每项任务 50 条演示做全量训练。RoboDawn 全程不更新参数:零样本设置下,基于 GPT-6 Astra 的版本达到 53.2% 成功率;加入 1 条上下文示例后提升到 **73.6%**,比 HarnessVLA(Claude Code)高 15.2 个百分点

消融实验显示,一条示例带来的提升最明显;继续增加示例通常仍有收益,但达到 8 条时略有回落,说明过长上下文会干扰 VLM 推理。底层模型能力越强,RoboDawn 的效果越好;移除显式推理或网格定位模块,也会造成明显下降。

在 RoboDojo 的 42 个双手任务上,RoboDawn 零样本成功率达到 **35.67%**,单样本达到 **47.17%**,明显高于全量训练的 DM0.5(19.34%)。

不用额外训练也能控制机器人?清华与腾讯提出 RoboDawn图5
图3:随着单回合指令预算增加,RoboDawn 在 RoboDojo 上的零样本与单样本成功率持续提升,呈现测试时缩放特性

指令预算从 60 增至 240 时,单样本成功率由 31.2% 上升到 47.2%。这说明模型不仅会执行预定动作,还能利用持续观察、反馈与记忆进行错误恢复。不过,RoboDawn 的单步推理延迟仍高于端到端 VLA;它平均仅需 3.4 条高层指令完成任务,后续可通过推理与运动的流水线并行改善整体效率。

真实 Franka 机器人测试中,放积木到篮子的成功率达到 **90%**,积木堆叠达到 50% ,证明该方法可以从模拟环境迁移到实体场景。


4. 能力边界在哪里?

RoboDawn 仍有清晰的局限。首先,推理延迟较高,不适合需要高频反馈的控制任务;其次,VLM 对平移动作的理解通常比旋转和三维姿态更可靠;离散语义指令也难以覆盖高精度插入、接触和放置。

不用额外训练也能控制机器人?清华与腾讯提出 RoboDawn图6
图4:RoboDawn 的三类典型失败,包括精细操作精度不足、逆运动学执行碰撞和任务完成判断偏差

另外,高层语义规划正确,不代表底层物理执行一定安全。逆运动学求解仍可能让机械臂碰撞周围物体,模型对“任务已经完成”的判断也可能与评测标准不一致。面向真实部署,碰撞防护、动作约束和失败恢复仍是不可绕过的问题。

RoboDawn 的意义不在于替代端到端 VLA,而是证明了一件值得重视的事:对于相当一部分通用操作任务,预训练 VLM 可能已经具备决策能力,缺少的是一套它能够理解、机器人又能执行的接口。与其一味扩充机器人数据、更新大模型参数,设计更好的交互抽象和上下文教学,也可能成为具身智能的重要路线。


> 本文由 AI 生成,机智流编辑部校对


-- 完 --


加入机智流 Pro,1 天一块钱,AI 能力指数级增长时代,不掉队。机智流 AI 团队将燃烧远超人类的智能的 AI Tokens 驱动 AI Agents 军团带来「与你有关」「对你有用」的高质量资讯/研报。


机智流推荐阅读

1. 

2. 

3. 

4. 

关注机智流并加入 AI 技术交流群,不仅能和来自大厂名校的 AI 开发者、爱好者一起进行技术交流,同时还有等。
在「机智流」公众号后台回复下方标红内容即可加入对应群聊:
  • cc | 大模型技术交流群
  • hf | HuggingFace 高赞论文分享群
  • lc|LangChain 技术交流群
  • code | AI Coding 交流群
  • 具身 | 具身智能交流群
  • 硬件 | AI 硬件交流群
  • 推理 | AI 推理框架交流群
  • 智能体 | Agent 技术交流群

关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。
机器人
more
法拉第未来9款EAI机器人齐发:最贵超92万!
拓普集团收入涨10%、利润掉21%:机器人故事还只值1404万
机器人进入晶圆厂,半导体制造走向无人化
一场靠谱的机器人黑客松,到底长什么样?36小时做10几个APP!
被传破产的泳池机器人明星企业,发文澄清!
告别“炫技”式表演:Hello Robot Stretch 4如何重新定义家庭辅助机器人的实用边界
用GPT-6 Astra就能直接控制机器人?可具身真机没那么简单
中国舞者携宇树G1机器人惊艳《美国达人秀》总决赛,人机共舞展现科技美学新高度
长鑫科技第五代技术平台正式量产,特斯拉Roadster开放预订,英特尔关停漏洞赏金计划,贾跃亭发布九款机器人,这就是今天的其他大新闻!
议程公布!家用服务机器人产业生态交流会倒计时1天!
Copyright © 2025-成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号