20%数据超GR00T N1.6、RoboDojo超WAM!StarVLA只用16卡训出全新VLA!

机器之心 2026-09-06 13:00
20%数据超GR00T N1.6、RoboDojo超WAM!StarVLA只用16卡训出全新VLA!图1


机器人 VLA 还在疯狂卷数据,StarVLA 团队这次却把目光放到了另一个问题上:除了继续 scale 数据以外,能不能让每一条数据都学得更值?


他们最新发布了面向 VLA 的 VLM 底座 VLAct


VLAct 的整个 continued pre-training 只使用开源数据和 16  GPU,但成绩相当能打:RoboTwin 2.0 成功率达到 92.5%;在 RoboDojo 榜单中超过所有明确标注为 World Action Model(WAM)的模型;面对预训练阶段从未见过的 GR-1 机器人,只使用 20%的 RoboCasa-GR1 下游数据,就已经超过 NVIDIA GR00T N1.6 的全量数据基线。模型、Checkpoint、训练代码和 Pipeline 也全部开源


20%数据超GR00T N1.6、RoboDojo超WAM!StarVLA只用16卡训出全新VLA!图2

图 1|VLAct 主要结果一览:RoboDojo、RoboTwin 2.0、RoboCasa-GR1,以及 16 GPUs 与全开源。(项目宣传图)


机器人数据

没法像互联网数据一样“爬”


过去几年,大模型已经证明了一条非常有效的路线:数据更多、模型更大、算力更强,能力就不断往上走。VLA 自然也希望复制这条 Scaling 路线。


但机器人领域有一个绕不开的现实:机器人轨迹不是网页数据,不能从互联网直接爬下来。每条数据都需要机器人真正在物理世界里完成操作,背后往往还有遥操作、数据采集和硬件成本。更麻烦的是,机器人最终面对的是几乎无限的场景、物体、任务和机器人形态组合。


所以 VLAct 并不是想否定 Data Scaling,而是补上另一个问题:在同样的数据预算下,能不能让机器人轨迹在 Backbone 里留下更多可以跨任务、跨 Action Head、甚至跨机器人迁移的知识?


20%数据超GR00T N1.6、RoboDojo超WAM!StarVLA只用16卡训出全新VLA!图3

图 2|Naive VLA pre-training 容易绑定预训练场景;VLAct 把目标转向更可迁移的 Action-aware Representation。


一个有点反常识的发现:

Action 学得更好,Backbone 不一定更好


VLAct 真正的起点,来自团队前期实验中一个很有意思的现象。现在很多 VLA 都会从一个 VLM 出发,挂上 Action Head,再用机器人数据继续训练。很自然的想法是:Action 预测越准,说明这次 VLA 预训练越成功。


但实验发现,并不一定。以 RoboTwin 为例,使用 OFT Head 做 continued pre-training 后,如果下游继续使用 OFT,成功率可以从 61.7%提高到 75.8%;但把同一个 Backbone 换成 PI Head,下游反而从 60.5%下降到 55.1%;换成 GR00T Head 甚至从 51.2%降到 28.9%。


换句话说:Policy 在原来的 Head 上变强了,不代表 Backbone 真的变得更通用


20%数据超GR00T N1.6、RoboDojo超WAM!StarVLA只用16卡训出全新VLA!图4

图 3|Action supervision 会直接塑造 Backbone:同 Head 性能提升,并不自动转化为 Cross-head 迁移能力。


原因也很直观。Action Head 和 Backbone 是一起训练的,只用一种 Head 时,Backbone 很容易逐渐学会一种“最方便这个 Head 读取”的 Feature Geometry。对于当前 Policy,这当然很好;但换一个 Action Head、任务甚至机器人后,这些 Representation 未必还能继续复用。论文把这种现象称为 head-specific representation collapse


于是 VLAct 把 continued pre-training 的目标重新定义了一遍:不是训练一个已经很会做动作的固定 Policy Initialization,而是训练一个能被不同 Action Head、不同任务、不同机器人继续利用的 VLM Backbone


那怎么避免 Backbone 被“带偏”?


围绕这个目标,VLAct 没有重新发明复杂的 Policy Architecture,而是在 continued pre-training 阶段做了三件事。


第一,别把 VLM 原来学会的东西忘了。VLAct 保护 Vision Encoder 和较浅的 LLM 层,同时混入 Caption 数据,让模型在学习 Action 时尽量保住原来的视觉语言先验。


第二,别让一种 Action Head 说了算。VLAct 同时挂上 OFT、PI 和 GR00T 三种连续 Action Head,让它们共同读取一个 Backbone、预测同一套动作。这样 Backbone 想同时服务不同 Decoder,就不能只把信息组织成某一种 Head 最喜欢的形式。更重要的是,预训练结束后这些 Head 全部可以丢掉,下游重新初始化自己的 Action Head。


第三,不同机器人之间,该共享的物理语义就共享。例如“打开/关闭夹爪”在不同机器人上的物理意义高度相似,但不同机械臂的自由度和运动学结构又不能粗暴统一。因此 VLAct 只统一真正一致的 Action 维度,其他部分继续保持 Embodiment-specific。


20%数据超GR00T N1.6、RoboDojo超WAM!StarVLA只用16卡训出全新VLA!图5

图 4|VLAct 完整训练框架:Preserve VLM Prior、Multi-head Continuous Supervision、Partially Unified Action Space,下游重新初始化 Action Head。(论文 Figure 3 原图裁切)


RoboTwin 92.5%

RoboDojo 超所有 WAM


最终,这种 Representation 能不能迁移,还是得看结果。在 LIBERO-Plus 上,VLAct 达到 82.6%;到了双臂操作的 RoboTwin 2.0,Data Scaling 设置下 Clean 成功率进一步达到 92.5%,Random 设置也达到 90.8%


在 RoboDojo 上,VLAct 取得 10.66 Score 和 7.60%的 Success Rate,并超过所有明确标注为 WAM 的参赛模型。也就是说,这套预训练并不是只在某一个机器人、某一个 Benchmark 上有效。


论文还在 Franka 真机上覆盖了单臂短时序、长时序、双臂协同,以及 Novel Object 和 Full Substitution 等 OOD 设置。


20%数据超GR00T N1.6、RoboDojo超WAM!StarVLA只用16卡训出全新VLA!图6

图 5|真实机器人评测任务:包括 In-domain 与 Out-of-domain、短时序、长时序和双臂操作。(论文 Figure 11 原图裁切)


20%数据

超过 GR00T N1.6 的 100%


最能体现迁移能力的实验来自 RoboCasa-GR1。GR-1 这种机器人在 VLAct continued pre-training 的数据里一次都没有出现过:预训练阶段模型看到的是 Franka、AgileX 等机器人,然后再把 Backbone 拿到 GR-1 上进行下游 Fine-tuning。


结果只使用 20% 的 RoboCasa-GR1 轨迹,VLAct 就达到 49.5%的成功率,已经超过 GR00T N1.6 和 Qwen3VL-OFT 的全量数据基线;当数据提高到 100%时,VLAct 进一步达到 54.0%。


20%数据超GR00T N1.6、RoboDojo超WAM!StarVLA只用16卡训出全新VLA!图7

图 6|论文 Figure 5:真机单臂/长时序/双臂结果,以及 RoboCasa-GR1 跨本体迁移;20%下游数据已超过公开 full-data baselines。


Beyond Data Scaling

让每条机器人数据“学得更值”


VLAct 并不是想证明“数据不重要”。机器人数据当然还需要继续 Scale,但由于机器人数据昂贵、稀缺,而且很难完整覆盖真实物理世界,Representation Quality 本身也应该成为 VLA Scaling 的一条独立轴线。


过去大家更常问:“还能收多少机器人数据?”VLAct 希望同时再问一句:“同样这些机器人数据,到底能让模型学到多少可以迁移的东西?”


整个 VLAct continued pre-training 基于 Qwen3-VL-4B,只使用公开机器人数据和 16 张 GPU 完成。目前模型权重、Checkpoint、数据处理及训练 Pipeline 均已开放,希望把一个更适合物理世界、也更 Research-friendly 的 VLM Backbone 交给 VLA 社区。


项目链接


20%数据超GR00T N1.6、RoboDojo超WAM!StarVLA只用16卡训出全新VLA!图8



20%数据超GR00T N1.6、RoboDojo超WAM!StarVLA只用16卡训出全新VLA!图9


© THE END 

转载请联系本公众号获得授权

投稿或寻求报道:liyazhou@jiqizhixin.com

关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。
AR
more
NUS推出Harness基座模型JIT-Agent,为每个任务设计一套“Claude Code”,让普通大模型也能打赢GPT-5.6
晚点独家丨Sharpa 首次披露超 45 亿融资,李一帆:不为机器人创造就业机会
16台DGX Spark集群实测Kimi-K3,峰值生成速度达38 t/s
Lovart 悄悄大更新,这一次轮到 AI 适应设计师了
RTX 5090再陷“烧线”危机,Hardware Unboxed实测接口温度飙至175°C
超节点演进之路:机柜Tray级解耦、PowerShelf与Busbar工程化验证|科华数据黄新GACS26预告
华硕ProArt GR1X迷你主机亮相:掌中AI算力怪兽,集成RTX Spark平台
20%数据超GR00T N1.6、RoboDojo超WAM!StarVLA只用16卡训出全新VLA!
联想IFA 2026发布全新AI终端矩阵,YOGA Pro 9n搭载RTX Spark芯片
百年Packard Bell重启:宏碁借“Tech it easy”理念重返欧洲主流市场
Copyright © 2025-成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号