点击下方卡片,关注【Xbotics具身智能实验室】公众号
你想要的这里都有~~
把一台人形机器人送进工厂,客户通常不会先问模型有多少参数,而会问一些具体得多的问题:换一种物料,需要重新采集多少数据?换一个工位,需要训练多长时间?一条产线跑通以后,这套能力能不能复用到下一条产线?

过去几年,人形机器人产业一边提高本体的负载、自由度和可靠性,一边训练能够理解语言、识别环境并生成动作的通用基模。但从模型“会做一件事”,到机器人在工厂里稳定做好一份工作,中间仍有一条不短的开发链路。
乐聚此次发布KUAVO-VLA,在通用基模与具体岗位技能之间,增加了一层面向KUAVO本体和工业场景的垂域能力。它要解决的,是让机器人学习下一项工业技能时,不必再从头开始。

通用模型走到工厂,先碰到的是具体问题
通用VLA模型通过不同机器人、物体和任务数据,建立视觉、语言与动作之间的联系,尽可能扩大能力边界。但通用能力并不等于岗位能力。同一个模型落到KUAVO上,需要适应它的关节、动作空间和控制规律;进入工厂后,还要面对不同物料、工位、节拍和操作顺序。
过去的“基模—技能”路径,让二次开发团队同时承担本体适配、基础操作学习和具体任务训练。做一个标杆项目可以集中攻关,但当机器人需要学会几十项甚至上百项技能时,重复适配就会不断抬高时间和成本。
KUAVO-VLA承担的正是这层共性工作:通用基模提供广泛的视觉、语言和动作能力,垂域模型让这些能力适应KUAVO及工业任务,技能开发团队再完成具体岗位的最后训练。这就像在通识教育和岗前培训之间,补上一门工业专业课。

600多小时真机数据,先让KUAVO熟悉工业任务
KUAVO-VLA以LingBot-VLA 2.0为能力基础,对约6B参数进行全参数微调。乐聚选择投入更重的全参数微调,是希望KUAVO的本体控制和工业操作规律真正进入模型,而不是停留在少量参数适配上。模型使用600多小时高质量真机数据,覆盖100项工业任务。这些数据来自乐聚在全国参与共建的训练场对真实工业场景的复刻,并通过自动化任务派发和清洗系统进行处理。
训练数据全部来自KUAVO同构型机器人,使模型能够集中学习同一套动作空间、运动特性和控制规律。这是一种明确的分工:通用基模负责拓宽能力边界,垂域模型负责把这些能力更深地落到一套具体本体上。
100项任务覆盖分拣、搬运、上下料和装配等操作。不同任务虽然面对的物料和流程不同,却会反复使用识别、定位、抓取、搬运和放置。KUAVO-VLA要留下的不是100套孤立脚本,而是任务之间可以复用的操作能力。
模型设计讲得再完整,最终仍要回到真机效果。乐聚随后用25项任务对这条路线进行了验证。


比成功率更重要的,是机器人能否稳定走完整个流程
乐聚使用20项定制工业任务和5项GM100公共任务进行评测,对照模型包括π0.5、GR00T N1.7和LingBot-VLA 2.0。KUAVO-VLA的整体任务成功率为48.27%,过程分为74.51%,两项指标在本次评测中均位列第一。LingBot-VLA 2.0的两项得分分别为16.27%和42.06%。


根据乐聚的测试,经过垂域训练后,模型在无动作需求时能够保持稳定,动作平滑性和执行一致性也有所改善。在流水线开关分拣任务中,模型使用约5小时示范数据完成后训练,成功率达到80%;在GM100零食分拣任务中,使用150条示范数据适配后,成功率为73.33%。
单项任务的成绩只能证明模型能力有所改善。模型效果要变成商业价值,最终要看下一项技能的开发成本有没有下降。

真正需要降低的,是下一项技能的开发成本
完成一项工业任务,和持续开发一百项技能,是两种不同的能力。第一个项目可以集中算法和工程团队攻关,但人形机器人要进入汽车、3C和物流等大量场景,就不可能每增加一个岗位都重走完整流程。
KUAVO-VLA试图降低的,正是新增技能的边际成本。对技能开发公司而言,它们可以少做一部分本体适配和基础训练,把更多精力用于理解客户工艺和完成现场优化。不需要先变成一家小型机器人本体公司,才能参与人形机器人项目。
对工业客户而言,价值体现在更短的验证周期和更清晰的投资回报。开发周期越短,前期试错成本越低;已经跑通的能力复用得越多,机器人从示范工位复制到更多产线的可能性就越大。乐聚通过“基模—垂域模型—技能”的链路,将原本可能持续数月的开发过程缩短至一周以内。
这也改变了人形机器人规模化的含义。批量生产本体,只解决了机器人从哪里来;持续、低成本地开发技能,才决定机器人能去哪里、能够做什么。当一个平台需要覆盖几十乃至上百种岗位时,一家机器人公司显然无法独自完成所有技能开发。

开源一款模型,也是提出一种产业分工

在乐聚提出的分工中,通用基模公司负责跨本体、跨场景的基础能力;机器人平台公司负责适配自有本体,并沉淀工业共性能力;技能开发公司面向具体物料、工位和流程完成训练与部署;场景客户则提出需求,并最终判断效率和投资回报。
KUAVO-VLA的模型、数据和代码将面向开发者开源。这不是发布模型后的附加动作,而是扩大技能供给的必要选择。
此前,乐聚已经推出LeTools开发工具链,降低模型训练、推理、仿真和真机部署的工程门槛。LeTools解决开发者怎样训练和部署,KUAVO-VLA解决开发者从哪里开始训练。乐聚目前汇聚了70余家产业链伙伴和万余名开发者,希望通过开源数据和模型、提供工具链,让更多公司和个人参与工业技能开发。

从一次测试领先,到一套可以复制的能力
KUAVO-VLA的发布,并不意味着工业具身智能已经解决了所有问题。48.27%的整体成功率也说明,面对复杂、长程和开放的工业任务,模型仍有很大的提升空间。
它更重要的变化,是把原本分散在单个项目中的本体适配和工业共性能力,沉淀成可以反复使用的平台资产。判断KUAVO-VLA的价值,不能只看这一次Benchmark提高了多少分,还要看未来每增加一项技能时,开发者能少采多少数据、少走多少弯路,机器人又能提前多久进入工位。
当一次模型提升能够缩短下一项技能的开发周期,当一个项目的经验能够继续服务下一批开发者,人形机器人商业化才真正具备规模效应。KUAVO-VLA所要做的,正是让已经拥有通用“大脑”的人形机器人,更快学会工业世界里的具体工作。

-END-
Ask Me Anything|提问箱
对文章有疑惑,或想聊更深?欢迎把你的问题丢给我们:技术方案、实操踩坑、课程与资料、项目合作、职业发展,都可以问。
怎么问:在评论区留言,或私信公众号
我们会做什么:每周集中整理高质量问题并公开回复,重点问题邀请作者或嘉宾深度解答;典型问题会加入知识库并持续更新。
提问小提示:尽量说明「你的目标—当前做法—期望产出」,附上必要信息(硬件/软件版本、数据规模等),能更快获得有用答案。
一起把问题变成知识,推动社区进步 🚀