
编辑:吕鑫燚
出品:具身研习社
“It’s Time to Scale Up! ”
Figure 在刚刚发布的 Helix 2.5 技术博客结尾写下的这句话,把具身智能行业熟悉的规模化命题,又往前推了一步。
过去,人机迁移多少有些“薛定谔的猫”的意味。盒子合着,人类行为视频是取之不尽的宝藏,似乎足以托起机器人的基础模型;盒子打开,视角差异、身体结构、动作空间与控制方式的鸿沟便接连出现。谈数据来源,大家都相信人类经验的价值;追问这些经验究竟能让机器人进步多少,答案又变得模糊。
行业一直缺少的,是把这种期待变成可衡量收益的证据。机器人能从人类身上学到东西,已经令人振奋;随着人类数据增加,迁移后的能力还能持续改善,才足以支撑更大规模的投入。Figure 此次发布给出了这样的实验结果。
在中国,亮源新创也沿着人类动作预训练的路径,拿出了跨视角、跨本体迁移的扩展证据。
亮源新创此次发布的全身智能基础模型 Light-O1,将互联网人类行为视频纳入动作预训练,再把学到的知识适配至机器人。与 Figure 通过 Index 组织人类数据采集的路径相比,亮源把目光投向了互联网上已经存在的行为经验,也把同一基础模型的能力带向不同机器人本体。两条路径正在共同回答一个问题:人类积累的经验,能否成为机器人持续增长的能力来源?
在这个具身智能行业一边受到大语言模型 Scaling Law 威慑,一边又对自身 Scaling Law 相对迷茫的节点,Light-O1 和 Helix 2.5 的发布某种程度上给行业吃下了定心丸,振奋人心——人机之间的鸿沟开始有了具体的跨越方法,具身智能对于规模化扩展的讨论,也终于有了具体锚点。

把一双鞋放进鞋柜,对人而言几乎不值得专门描述。对机器人来说,这件事却会同时调动多种能力:理解指令、观察环境、走到合适位置、调整身体姿态,再完成开柜门和鞋子的抓取与放置。鞋子的位置稍有变化,身体的站位和动作也要随之改变。
亮源新创发布的 Light-O1,驱动着自研本体 LightBot 一镜到底地展示了干扰下的打开鞋柜、蹲下取鞋以及弯腰拾起垃圾水瓶、丢进垃圾桶等任务,以及让宇树科技 G1 机器人浇花、擦桌子呈现的正是这种连续行为。移动与操作发生在同一个过程中,身体既要把手送到正确的位置,也要为观察、接触和操作创造条件。这就是亮源新创强调的“全身智能”。
亮源新创将语言引导动作、具身推理与全身移动操作,放在同一个基础模型中承载。指令、场景与动作之间有了共同的学习基础,机器人完成任务所需要的知识,也有机会在不同能力之间复用。而支撑这层基础的,是大量人类已经做过的事情。
人类数据的吸引力,行业早已看见。机器人的遥操作和专门采集需要设备、人员与场地,扩充数据始终伴随着真实的生产投入。人类每天都在不同环境中使用工具、整理物品、移动身体,其中蕴含的行为多样性,很难靠预先设计任务完全覆盖。

Figure 为此建立了 Index,通过应用组织全球用户记录真实劳动,再对视频进行筛选、去重、分布再平衡与标注。这条路径的价值,在于把分散的人类行为变成持续生产、可控处理的数据供给。但这种人类经验进入机器人训练,背后面临较高成本搭建一整套包含人力、设备、合规等基础设施。据了解 Figure 已经向“创作者”支付了 1500 万美元,并计划未来 12 个月再将采集规模扩大 100 倍。
其实可以简单的计算一下,如果在众包采集单价不变的情况下,抛开更大规模的数据训练的人力、算力,仅创作者支付成本就高达 15 亿美元。这种成本对于初创公司来说,实在是“不能承受的数据之重”。
亮源新创选择开发互联网已有的视频。它的想象空间由此打开:基础模型的数据增长,有机会更多依靠既有行为经验的转化,降低对专门采集的依赖和成本。
此外,如亮源新创联合创始人兼 CTO范廷翔所说“相比逐项采集机器人数据,人类视频来源丰富,能够覆盖更多日常场景”。必须承认,日常生活里细碎、偶然、难以穷举的动作,在实验室类的人类行为采集下几乎是奢求,甚至在野外采集下,仍会受限于众包下发的有限的“任务”类型和数据标准框架,而这些却恰恰可能成为模型理解身体与环境关系的素材。

Light-O1 利用视频中已有的海量人类行为
拓展机器人预训练的数据来源
当然,互联网上有视频,与机器人能够从中学会行动,中间还有着相当长的工程量。镜头里的动作缺少机器人可直接执行的控制指令;人的四肢比例、关节活动范围,也无法原样搬到机器身上。数据入口打开之后,真正的技术工作才刚刚开始。
预训练团队负责人郑顺表示,“我们先还原视频中人的动作,再将动作、视觉画面、语言描述按时间对齐,组织成完整的行动过程。这样模型就能学习人在什么情境下采取什么动作,以及动作带来了什么变化”。
为此,Light-O1 首先从视频中恢复结构化的人类动作信息,再通过统一人形动作表示,将不同来源的行为编码到共同的表征体系中。在此基础上,动作与语言、视觉观察被组织成多模态时序序列,进入自回归基础模型预训练。模型由此学习动作与环境、意图及反馈之间的关系,再通过目标领域适配,把这些知识迁移至具体机器人。
这套方法重新安排了人类数据与机器人数据的分工。更广泛的人类行为负责建立动作基础,面向具体本体和任务的数据继续承担适配工作。机器人仍然需要认识自己的身体,但它开始有机会带着已有知识进入这一过程。
从这个维度看,具身智能似乎可以和大语言模型站在同一数据维度上竞争了,即吸收互联网海量的文本和海量的视频进行规模化预训练。也因此,具身智能厂商不必再对大模型厂商的“天然存在”的数据保持艳羡了。
总之,亮源新创此次发布让海量视频不再只是“可望不可及”,它把其中的人类行为转化成可以学习、可以迁移的动作知识,让互联网与机器人之间真正建立起了有效联系。

数据来源变大,只解决了规模化的一半问题。另一半更难:继续投入数据与训练,模型究竟能获得多少收益?
这也是亮源新创和 Figure 此次成果值得重视的地方。在固定模型规模与下游训练条件后,Figure 观察到,八倍跨度内的人类预训练数据增长,能够规律性地改善机器人动作预测。

它还另外给出了真实任务证据:在 30 户陌生家庭的评测中,Index 预训练将零样本成功率从 9%提高至 56%。

Light-O1 则把迁移验证铺到了不同视角和本体上。亮源在不同规模的人类动作数据上预训练,再分别适配公开第一视角人类示范数据、公开机器人数据,以及自有机器人的全身移动操作数据。它追问的是,同一类人类动作知识,换一种观察方式、换一副身体,能否继续产生收益?
在此次披露的实验范围内,Light-O1 将基于视频的人类动作预训练拓展至 10 万动作小时。随着预训练数据增加,目标领域适配后所能达到的最优留出测试损失呈幂律下降;在留出数据的开环评估中,全身与手腕轨迹的预测误差也随之降低。

首次验证人类全身动作预训练的跨本体迁移扩展规律
简言之,增加人类数据的收益,传递到了后续适配阶段,改善了不同数据分布和机器人本体上的动作预测表现。跨越视角与身体差异之后,预训练积累下来的知识仍然有效,人机迁移由此开始呈现可持续扩展的迹象。
对于基础模型研发,这意味着具身企业投入依据发生了变化。过去那种一次成功演示能证明某项能力存在,而规律性的迁移收益则能帮助企业判断,继续扩大预训练是否值得。可以说,这对于坚持预训练的具身智能公司这是十足的利好。具身智能长期期待的 Scaling up,开始触及能力增长本身。
不过,这份证据也有清晰的边界:Light-O1 当前披露的扩展规律,主要落在适配后的测试损失与开环轨迹预测上。预测改善如何转化为更高的任务成功率、更少的人工干预,需要真实部署继续回答。
沿着亮源新创路线继续往前看,互联网视频与跨本体迁移,分别打开了规模化的两端。前者扩充可以学习的经验来源,后者扩大这些经验能够服务的身体范围。一份人类经验,因而有机会成为多种机器人的共同起点。
这次亮源新创虽没有像 Figure 那样把机器人送进 30 个陌生家庭,但同样也发布了大、小两款人形机器人执行家庭任务并完成协作的全身移动操作展示,让这种可能性有了直观载体。
不同尺寸意味着不同的可达空间、站位与运动约束。共享一套基础模型,直接驱动各自身体,也证明了数据的跨本体性和模型的泛化性。而且一小一大两台机器人 LightBot 和宇树 G1 在家务中的协作展示还让人看到,多种机器人有机会在同一场景中承担不同工作。目前看,Figure 的成果展示中,仅有一款机器人的“单兵作业”,我们期待其也能加入这种前沿问题的求解之中。
总之,真正令行业振奋的,正是 Figure 和亮源新创的这种“同频共振”。人类行为的价值开始有了扩展证据,不同团队又在数据来源、迁移范围和真实任务验证上各自深入。行业由此获得了“大胆”投入的理由,也获得了更具体的检验标准。

当预训练的扩展路径逐渐清楚,竞争很快会沿着训练链路向后延伸。模型能吸收多少人类经验,决定它从哪里起步;这些经验能否稳定变成具体的行动,则决定机器人能够走多远。
真实世界不会只给机器人出它擅长的题。位置偏差、外力干扰、跌倒甚至硬件状态变化,都可能打断任务。一次任务中断看起来只是演示里的小插曲,当部署数量扩大,它便会变成持续的运维负担。机器人越依赖人工接管,稳定运行与积累交互经验就越困难。
其实我们看 Figure 的视频中会发现 Figure 03 在面临一些失败任务时,不是简单的重复抓取尝试,而是调整身子再去抓。技术博客把这种称能力称为“Whole-Body Self-Correction” 。

这种自我调整、自我适应并非孤例,回看亮源新创此前的技术发布,这条研发脉络已经显现。LightParkour 从少量人类动作出发,在仿真中扩展全身技能;LightNav-0 通过规模化 Real2Sim2Real 推进通用导航;Light REACT 则关注身体受扰、受损或行动受限时,机器人怎样恢复行动。这些方向分别回应了技能增长、环境适应和持续运行中的问题。
以 Light REACT 为例,它根据近期物理交互轨迹判断身体能力的变化,调整全身行为。身体条件发生改变,机器人需要重新利用仍然可用的运动与支撑能力。其意义落在部署端:减少中断与人工救援,才能为更大范围的真实交互创造条件。

Light REACT 全身韧性智能技术展示
如今,Light-O1 让我们看到这套布局最上游的规模化预训练如何嵌入其中。人类行为提供广泛的动作基础,对齐环节推动能力进入具体身体与环境,部署环节则让模型接受真实世界的持续检验。沿着这条路径,部署中出现的问题还应回到数据与训练端,成为下一轮能力改进的依据。
这就是具身智能所需要“闭环”,相较单纯的技术发布,更需要体系化的技术积累与前瞻性的全面布局。机器人经历过一次失败,并不会自然让模型变强。哪些交互值得保留,失败反映了什么能力缺口,新增数据怎样进入训练,更新后的模型又如何证明自己更可靠,都需要系统性的工程能力。只有这些环节持续运转,部署规模才可能变成学习优势。
目前,亮源新创已在规模化预训练(Scalable Pre-Training)、规模化对齐(Scalable Alignment)、规模化部署(Scalable Deployment)三段范式推出对应成果,为这条路径建立了技术支撑。闭环运行的实际效率,还需要后续的部署规模、反馈质量与迭代结果来证明。对企业而言,这也意味着竞争将逐渐深入数据处理、模型训练、机器人系统与真实场景之间的连接处。
将这样的思路带入物理世界,考验还会更多。大语言模型中的一次错误可以重新生成,机器人则要用真实的身体承担行动结果。仿真、控制、硬件与场景经验,需要与大规模模型训练一起向前推进。亮源连续发布的技术成果,所指向的正是这项系统工程。
结语
Light-O1 值得放进更长的产业进程中观察。
坦白说过去一段时间,通用大模型会不会“吃掉”具身智能的讨论,让行业感受到了一种紧迫,甚或几分泄气。大语言模型的能力边界不断外扩,具身智能却仍在为自己的数据来源与扩展路径寻找足够有力的证据。
Light-O1 与 Helix 2.5的相继出现,给这场讨论带来了新的底气:人类经验能够迁移到机器人身上,这种迁移的收益也能够随着预训练数据规模扩大而持续增长。而且亮源新创进一步将这条路径延伸至互联网已有的人类行为视频,为具身智能打开了吸收海量经验、积累自身能力的入口。
因此,Light-O1 的发布,也是对两重行业焦虑的有力回应。面对通用大模型的能力扩张,具身智能拿出了利用互联网数据发展动作基础模型的技术依据;放到全球竞争中,中国团队也已与 Figure 站在人机迁移与规模化预训练的同一探索前沿,并在数据来源与跨本体迁移上交出了自己的答案。
“It’s Time to Scale Up! ”Figure 这句话,或许亮源新创可以同样自豪地说出口。


