点击下方卡片,关注“具身智能之心”公众号
现在聊具身智能,很容易聊到模型名字。
VLA、世界模型、真机 RL、后训练、数据飞轮,每个词都很热,也都确实在往前走。
但机器人一上真机,问题马上会从概念变成细节。
仿真里能稳定通过地形的运控策略,换到真实地面上,可能因为电机响应慢半拍、地面摩擦不一样、机身装配有误差,开始左右晃、速度上不去,甚至反复卡在同一个台阶前。
视频里看起来已经会抓取的 VLA 模型,真正遇到透明杯、柔性衣服、反光包装袋和遮挡视角,也会暴露出完全不同的失败原因:数据没覆盖,相机看不清,夹爪策略不合适,或者任务本身拆得太粗。
真机部署的难点就在这里。
它会把一个看起来很大的“模型能力问题”,拆成一连串更具体的数据、控制、硬件、接口和任务设计问题。
叠衣服失败,表面上像模型不会,真正的问题可能出在某一步折叠角度偏了,后面所有状态都变成训练数据里没见过的样子。
分拣任务放错位置,问题也可能落在颜色、物体姿态、末端执行器夹取方式和任务组合这些更细的环节上。

强化学习想进真机,也不只是换一个算法,接口开不开放、奖励怎么定义、专家数据质量够不够,都会决定它能不能真正跑起来。
这就是我们说的“真机闭环”。
它不是把模型下载下来,在机器人上跑一次 demo。更完整的链条是:先定义真实任务,再采集数据、训练模型、部署到真机、看失败、回到数据和策略里修正,再继续上机验证。
中间任何一环断掉,系统都很难往前走。
顺着这条链路往下看,我们发现真机部署的难点会落到几个更具体的模块里:数据采集与筛选、任务拆解、运控与 sim-to-real、强化学习接入,以及真机调试。
01.
一上真机,数据质量就开始压过模型名字
VLA 一到真机,数据质量往往先压过模型名字。插花、分拣、叠衣服这些任务在视频里看着简单,真机上会拆成夹取位置、末端对准、物体姿态、颜色识别、柔性物体形变等更细问题。前一步稍微偏一点,后续状态就可能变成模型没见过的样子。
所以真实任务里的数据问题,很少只是数据量不够。更常见的是关键状态没覆盖:透明杯、反光包装袋会让视觉不稳定,衣服和塑料袋会让同一个动作产生不同结果,多物体任务里组合一变,原有数据就可能失效。
这也是为什么真机数据要经历训练、上机、失败分析、补采和筛选。数据好不好,往往要等模型失败后才能判断。真机上的数据闭环,关键是知道哪些状态值得采,哪些失败要留下,哪些动作该拆开,哪些地方要让模型和规则一起工作。
02.
运控看起来更成熟,
sim2real仍然需要注意细节
运控看起来更成熟,但从仿真到真机仍有很长工程链路。仿真里地面干净、接触理想,电机响应、传感器延迟、装配误差、摩擦系数、电池状态都会被简化;到了真机上,这些细节会一起回来。

真正考验的是 sim-to-real 的完整程度。它不能只看一个参数或仿真随机化,完整链条还包括本体参数辨识、电机模型、接触建模、动作限幅、安全保护、观测噪声、部署频率,以及策略和底层控制器之间的衔接。
很多运控改进也不一定来自更复杂的新算法,而是来自更细的工程约束:哪些关节要限制,哪些动作要补充,哪些姿态更稳定,哪些本体参数必须重新标定。只有本体、仿真、控制栈和部署链路足够顺,模型和策略层的问题才会真正浮出来。
03.
VLA + 强化学习有价值,
真机上还有几个难点。
强化学习的吸引力在于,它能把真实任务里的失败变成继续优化的信号。模仿学习和 VLA 擅长从已有数据里学动作,但叠衣服、整理这类长程任务总会遇到没见过的状态;如果系统能通过纠错、接管和奖励反馈回收失败,模型就有机会从偏差状态回到正确轨道。
VLA和RL的结合有价值,但 RL 要进入真机系统,还需要过三道关。
第一是接口:很多平台只开放遥操作、客户端推流或有限动作接口,RL 很难做细粒度探索和策略更新。第二是奖励:真机不能像仿真一样直接读状态,杯子是否放正、衣服是否叠好,往往要靠视觉、阶段识别或人工标注转成奖励。第三是数据质量:专家数据里混入失败、遮挡和低质量片段,奖励模型和后续优化都会被带偏。
真机 RL 的关键已经从价值讨论,转向真实闭环接入:接口要允许介入,奖励要可靠,失败数据要能回收,安全机制要兜住探索风险。
问题开始越来越具体,与此同时,行业里也出现一个很明显的变化。
越来越多具身智能公司开始把真机、工具链、任务场景和开发流程拿出来,通过黑客松、训练营、科创营、比赛,让学生、开发者和研究者亲手跑一遍。论文和开源模型负责把方法讲清楚,线下真机活动负责把问题暴露出来。
这些活动表面上是在做开发者生态,往深一层看,其实是在让行业集体补一课:具身智能的落地,需要更多人真的走进真机闭环里,把那些会断的环节一段段趟出来。
04.
黑客松和科创营,
开始把一套真机闭环压缩进了几天
之前一直对黑客松、训练营这类内容很感兴趣。
原因很简单:它们能让人看到普通开发者和学生入手一个真机项目到底需要多久,会碰到哪些问题,哪些环节会反复出错。
也正是带着这些问题,我们参加了最近逐际动力举办的科创营。它更像是一个被压缩过的真机闭环现场。
这次赛题主要分成两条线。

一条是 VLA 操作题 Household Manipulation,面向真实家庭操作场景,考察队伍从任务理解、数据采集、模型训练到真机执行的综合能力。任务包括插花、桌面整理和叠衣服:插花要求把花稳定插入花瓶;桌面整理要求根据 prompt 将毛绒玩具、文具分类收纳;叠衣服则要求按数据集方式完成折叠,附加题会进一步把揉成一团的衣服折好。
另一条是 Locomotion 题 :Terrain Locomotion @ Sim2Real,重点考察仿真训练后的真机迁移能力。双轮足机器人要通过平地、坎、石子路、楼梯和斜坡,并同时看完赛时间和 20 个乒乓球的保留数量;人形机器人则在 S 弯速度响应、碰杆惩罚、完赛效率和稳定性上计分。
现场看到的,是一套完整真机闭环:参赛队员要采数据、训模型、调运控、做遥操作、处理相机和设备问题,再把算法部署到真真机器人上测试。
带着开头那个问题,我们和十组参赛同学做了深入交流,看到了一些真实信息。

最集中出现的,是完整链路里任何一环都可能拖慢进度。
做locomotion的同学说,现场使用的设备是用过sim2real gap最小的。
做 VLA 操作的同学最先碰到的是数据问题。有人提到,一开始最难的环节,是判断数据到底有没有用。采完一批数据,只有放进训练、上机测试,才知道问题出在动作缺段、相机遮挡、关键状态没覆盖,还是物体摆放方式和示教不一致。

柔性物体会把这个问题继续放大。叠衣服、塑料袋、透明杯这类任务,对抓取角度和物体状态很敏感。衣服稍微偏一点,模型就可能进入没见过的分支。有队伍做叠衣服时,在官方数据之外又补采了 30 到 50 条,最后仍然要靠一次次上机测试来筛掉低质量片段。
还有一类问题来自硬件和环境。有队伍第一天换电脑、换相机,两个相机又接连出问题,至少耽误了两天;也有人遇到腕部相机过曝、光照需要重新调整。真机项目里,大量时间会先被相机、机器、推理和控制链路吃掉,新算法反而要排在后面。
到了策略层,问题又会变成任务怎么拆。有队伍选择把宏任务拆成原子级操作,再用状态机和计数器做补充判断。也有人尝试把强化学习接进叠衣服任务,但框架迁移、推理接口适配、底层接口封装和高质量专家数据不足,最后都会把资源重新拉回遥操作、数据筛选和模型训练。
这些细节放在一起,能看出这场活动的重点已经超过最终 demo。
它把真实项目里会反复出现的链路问题集中暴露了出来:数据要回到真机上验证,任务要被拆到可执行的粒度,硬件和环境要被现场修正,算法也要服从接口、资源和时间的现实约束。
这类训练营的价值,就在这里。
机器人公司做教育和开发者生态,不能只提供一台机器。真正有价值的是把机器、任务、数据、训练、部署和现场 debug 放在一起,让参与者完整走一遍真实流程。
落到参赛的同学身上,变化也很直接:很多人来之前觉得 VLA、全身控制、sim-to-real 是顶级 Lab 才敢碰的东西;真机跑过几天后,反馈变成了“原来这些都可以拆成工程问题”。
更关键的是,高密度真机时间把信心建立起来了。数据、算法、遥操作和部署每天都在机器人上验证,很多队伍从只求跑起来,到最后一晚仍在通宵联调。逐际动力把“Empower the Innovator”落到现实里,就是让很多学生从不敢碰到能拆解,从一个人做题到一群人把机器人调起来。
走之前,给其中的一组参赛队员拍了靓照,完美收官。

05.
Agent 正在赋能机器人开发
这次线下,还有一个很新的细节。
有选手提到,Codex、Claude Code 这类 AI Coding 工具出现以后,小队协作方式开始变了。
以前机器人项目往往要细分工:有人配环境,有人写脚本,有人训模型,有人排 bug。现在,一个人借助 AI Coding 工具,就能更快跑通训练脚本、运控步骤和 demo 流程。
他说,第一天他们基本把人形、运控、训练脚本都跑通了,后面三四天就一直在实操和攻关。团队后续也不再是严格按模块拆分,而是每个人按自己的想法训一套、做一套,大家一起测,谁成功就用谁。
这句话很有意思:“一个人成为一个团队的速度,正在变快”。
放到具身智能里看,AI Coding 工具并不会替代真机经验,但它会压缩很多重复性工程时间,让学生和工程师更快进入“提出假设—跑实验—看失败—再调整”的循环。
未来具身团队里,价值会更偏向判断力:知道该试什么,知道失败在哪,知道下一步怎么改。
06.
从逐际动力到整个行业,
具身智能人才培养的叙事更清晰了
把视野放大,逐际动力这类科创营不是孤立现象。
现在越来越多机器人公司,开始把真机、工具链、数据采集流程、算力和任务场景开放出来,让学生、开发者和研究者在线下参与。

但它们指向的是同一个变化:
具身智能的教研生态,正在从“看论文、跑仿真、复现代码”,走向“摸真机、采数据、训模型、调系统、跑部署”。
这会重塑人才培养,也会重塑公司和开发者之间的关系。
谁能把真机器、真实任务、真实工具链开放出来,谁才是真正在赋能创新者,谁就更容易聚集下一批懂具身智能的人。
