点击下方卡片,关注“具身智能之心”公众号
这周,Dyna Robotics 发了 Dyna-2。
100万小时第一视角人类视频,预训练阶段不使用机器人数据,并在机器人基础模型上展示出相当明确的 Scaling Law。
一百万小时是什么概念?大致相当于一个人连续清醒约170年的经验总量。
更值得关注的是,目前公开的 Scaling 曲线仍然单调向上,没有明显的平台期,下一步计划继续向千万小时规模推进。
所以 Dyna 2发布之后,行业讨论很快热了起来。
有人把它称作机器人的“GPT-3 时刻”,也有人进一步判断,既然人类视频可以规模化转化为机器人能力,未来对遥操作数据的依赖是不是会越来越低。
但我们把 Dyna 2的官方技术报告,以及创始人的相关分享仔细看了一遍后,反而觉得还有一个更值得讨论的问题:
Dyna 2真正验证的,可能不只是“视频有用”,而是人类行为本身,正在成为机器人预训练的重要数据源。
而一旦接受这个前提,问题自然会再往前走一步:
下一阶段的竞争,到底是继续把人类数据从100万小时堆到1000万小时,还是开始提高每一小时数据里真正包含的物理信息?
这也是为什么,我们会把 Dyna 2和大晓机器人近期发布的以人为中心的环境式数据采集方案2.0放在一起看。

两家公司走的是两条看起来并不相同的路线。
Dyna 2选择的是,把近乎无限规模的人类第一视角视频转化成机器人可以学习的数据;大晓环境式数据采集2.0则从Ego数据采集出发,试图进一步把人的视觉、动作、力触、时序以及所处的真实场景完整记录下来。
一个在证明人类数据可以 Scale,另一个在追问:什么样的人类数据,才值得被 Scale。
两条路线背后,其实正在指向同一个判断:
机器人想真正进入人类世界,最丰富、最天然的老师,很可能就是人类自己。
01
Dyna 2做到了100万小时,
也顺手画出了边界
在继续讨论之前,首先还是要承认 Dyna 2本身的价值。
它的出发点写在技术报告开头,逻辑其实非常直接:
一个通用机器人最终应该有能力完成当前由人类完成的、有经济价值的任务。
因此,正确的预训练数据来源,也应该是人类执行这些任务时留下的传感化记录,例如视频。而这样的数据,已经以接近无限的规模存在。
紧接着,是对机器人遥操作数据的判断。
遥操作当然有价值,但它有一个天然限制:每一小时数据,都要重新生产一小时。
如果机器人基础模型未来真的需要百万、千万甚至亿小时级别的数据,仅仅依靠遥操作,很难把预训练规模持续推高。
所以 Dyna 2做了一件很重要的事情:
把机器人学习的数据供给,从“机器人自己产生的数据”,进一步扩展到了“人类已经产生的数据”。
架构上,Dyna 2是一个世界-动作模型,也就是 WAM。
简单理解,就是机器人不只是机械地预测“下一步动作是什么”,而是试图把世界如何变化与自己应该采取什么动作联系起来。
这条路线是自洽的,阶段性结果也很有说服力。
Dyna 团队展示的结果里,有一个现象尤其值得注意:
即使只增加没有动作标签的纯视频,也可以让模型的迁移性能继续提升。

与此同时,官方 Blog 里还介绍,他们会从3D手部姿态轨迹中构造伪动作监督(pseudo-action supervision)。例如:
用人的手腕位姿近似机器人末端执行器的运动轨迹;
用拇指与食指之间的开合距离,推导连续的抓握信号。
这两个细节其实非常重要,因为它说明,100万小时数据并不是“随便找100万小时视频”就可以。
真正有价值的,仍然是人类正在发生丰富行为的时刻:
手腕在哪里、手如何移动、手指什么时候张开、什么时候闭合、人与物体发生了什么交互。
如果说 Dyna 2是目前“大规模人类视频预训练”路线里很有代表性的一个阶段性成果,那么大晓环境式数据采集方案2.0,则代表了另一种思路:
不是首先追求数据规模,而是先提高进入模型的物理信息密度。
而两条路线的分岔,也恰恰从这里开始。
02
只看视频,我们到底漏掉了什么?
无动作标签视频,加上手腕位姿和拇指—食指开合,已经可以提供相当丰富的行为信息。
但这里面依然缺少一些东西,比如力、触觉、多视角,以及更细粒度的物理状态。
这并不是 Dyna 2的疏忽,而是普通第一视角视频本身的边界,举一个最简单的例子。
拧一个全新的、密封很紧的瓶盖,和拧一个已经被松开的瓶盖,从视频画面上看,两者的动作可能非常接近:
手抓住瓶盖,然后旋转手腕。
但真正做过这个动作的人都知道,两件事在物理世界里完全不同。
一个可能只需要轻轻转动,另一个可能需要不断加力,甚至重新调整手指姿态、改变握法,最后才能拧开。
如果只有视频,模型很容易学到:“瓶盖是这样转开的。”但它很难直接知道:
“拧不动的时候应该增加多大的力,加到什么程度之后应该停止继续加力,又在什么情况下应该换一种姿势。”
这就是视频中的“动作信息”和真实世界里的“物理信息”之间的一层差别。
Dyna 2的 Scaling 数据,也提供了一个有意思的观察角度。
从公开结果来看,数据量从1,000小时增加到1,000,000小时,扩大了一千倍:
MSE 从0.062下降到0.053,accuracy@0.5从0.40提升到0.47。
曲线是明确向上的,而且还没有出现饱和。这是一个很重要的结果。
但反过来看,一千倍的数据规模,对应的指标增益仍然是相对渐进的。
这背后可能意味着一个值得进一步讨论的问题:
决定 Scaling 效率的,除了数据规模之外,还有没有另一根轴?
在我们的理解里,这根轴很可能就是:
数据里真正与行动结果相关的监督信息有多少。
如果只能拿到手腕轨迹和手指开合,那么很多物理细节仍然只能依靠更大规模的数据,以及后续真实机器人交互慢慢补齐。
所以 Dyna 2把“人类数据能不能 Scale”这件事向前推进了一大步之后,下一个问题自然浮现出来:
人类数据究竟应该 Scale 什么?
小时数是一条轴,信息密度,可能是另一条轴。
03
物理信息丰富的数据,
仍然离不开数采
如果说互联网视频解决的是“量”,那么专门的数据采集设备试图解决的,就是“质”。
这也是为什么,今年 Ego 数据采集设备明显开始变多。
大家嘴上都在说“第一视角人类数据”,但拆开来看,不同团队其实在解决完全不同的问题。
比如:
鹿明机器人的 FastUMI Ego,更关注“手在空间中的位置”;
德马科技的 OmniEgo,更关注如何降低成本、扩大采集规模;
清华自动化系与手亿科技的 EgoEMG,则尝试用肌电信息解决视觉遮挡之后手部状态难以恢复的问题;
大晓机器人的环境式数据采集方案2.0,更关注的是另一个问题:一段数据里,到底可以装下多少真正与物理行动相关的信息。
这也是大晓提出“信息密度定律”的背景。
它的定义并不复杂:
会改变行动结果的信息,才是有价值的信息。

这句话如果放回 Dyna 2的讨论里看,会很有意思。
数据规模回答的是:机器人看过多少。
信息密度回答的则是:机器人每看一次,到底看懂了多少。
比如正常抓取一万遍,和一次杯子即将滑落、手指调整抓力并最终恢复稳定的过程相比,后者的数据量可能只有几秒钟,但对于机器人理解真实物理交互,也许反而更加重要。
因为里面出现了:接触变化、失稳、临界状态、反馈、调整与恢复。
这些信息真正改变了动作的结果。
所以从这个角度看,下一阶段具身数据的竞争,很可能不会只是“规模之争”,而会逐渐变成“规模 × 信息密度”的竞争。
04
数量之外,
把每一帧里的物理信息做扎实
大晓把信息密度进一步拆成了三个维度:模态密度、时间密度和场景密度。
对应的采集端设备,是 ACE Ego Kit。
1
模态密度:把力和触觉补进来
ACE Ego Kit 采用“头—手—胸”的穿戴式采集结构。
其中手部的 ACE Sense Glove,把三维力触和手指动捕集成在一起,可以做到0.01N力触灵敏度,以及小于2°的关节角误差。
回到前面的瓶盖例子,这里补充的正好是普通视频缺失的信息。比如:
拧不动的一瞬间,手上的力是怎么增加的;
力继续增加之后,手指有没有发生微小位移;
什么时候原来的抓握已经不能继续完成任务;
人又是怎样重新调整手势。
这些信息并不是后期从互联网视频里随时可以恢复出来的。
它必须在真实行为发生的那一刻,被同步记录。
这一点也可以和 EgoEMG 放在一起看。
EgoEMG 用肌电信息补视觉遮挡后的手部状态,大晓则通过手套直接采集关节状态和力触。
技术路径不同,但背后都在指向同一个事实:
对于精细物理交互,仅靠视觉并不能完整描述人的动作。
2
时间密度:不是只学30秒,而是学完整任务
第二个维度是时间密度。
基于 ACE Ego Kit 采集体系,大晓后续开源了 L5 级多模态具身物理智能数据集 ACE-Data-0。
里面一个很有意思的指标是:单次连贯采集可以覆盖约25个原子动作,并在一个 one take 中完成。
这件事的意义容易被低估。
机器人行业里大量数据,仍然是几十秒级的短任务,比如拿起一个方块,把它放到盒子里。
模型看过大量这样的数据之后,确实可以越来越擅长完成一个个局部技能。
但真实的人类任务并不是由若干完全独立的30秒片段机械拼接起来的。
做一顿饭、收拾一个房间,中间会包含:
等待、顺序依赖、状态切换、失败、返工以及临时调整。
长程任务真正难的地方,就是前一个动作的结果会影响后一个动作。
所以碎片化数据训练出来的能力,与真实连续行为之间,天然还隔着一层。
时间密度试图补的,就是这一层。
3
场景密度:让采集设备跟着人进入真实世界
第三个维度是场景密度。
ACE Ego Kit 在形态上采用分体式、轻量化、无线设计,并搭配随身辅助电池。
这背后的目标不是为了“做一套更漂亮的穿戴设备”,而是尽可能降低人在真实环境中的采集负担。
因为如果一套设备只能在实验室里工作,那么不管传感器数量有多少,最后的数据分布仍然会非常有限。
ACE-Data-0就是一个比较直接的例子。

这套数据包含75,000个episodes,200 个任务类别,覆盖24个视角、6种以上模态,场景涉及做饭、打扫、饮水、环境整理等,从长程单任务、长程多任务延伸到人与场景之间的复杂交互。
如果说:模态密度决定一帧里记下多少;时间密度决定这一帧前后的行为有没有断;
那么场景密度决定的,就是这一小时的人类经验究竟发生在哪里。
三者叠加之后,“一小时数据”的含义就开始发生变化。
它不再只是一个时长单位,而是在衡量:
这一小时里到底记录下了多少真实物理世界。
05
还有一个容易被忽略的问题:
20多路传感器必须“活在同一时刻”
多模态数采还有一个不那么性感、但很能体现工程能力的问题:时空同步。
大晓公开的信息里,有一个数字是:20余种异构传感器,同步误差控制在1毫秒以内。
这个指标听上去没有100万小时那么有传播性,但真正做过多模态数据的人,会知道它为什么重要。
假设视觉与力觉之间相差了30毫秒,模型看到的图像可能已经是:“手接触杯子”,
但同一时间戳对应的力信号,还是0。
等到力觉信号真正出现时,视觉里的手可能已经开始把杯子往上提。
于是模型看到的训练样本就变成了:
先接触;隔了一段时间才受力;然后物体开始运动。
真实世界里本来同时发生的因果链,被错误地拆开了。
一条数据影响可能不大,但当训练规模从几万条来到百万、千万量级以后,这类系统性误差会越来越难靠模型自己消化。
所以多模态数据真正困难的地方,从来不只是:“我有多少种传感器”;而是:
这些传感器是不是在记录同一个物理瞬间。
从这个意义上说,模态数量是最容易展示的部分,而模态之间的对齐精度,反而更接近基础设施层面的工程门槛。
06
数据管线,
才是大晓真正想做成基础设施的地方
重新回到 Dyna 2的技术报告,还有一句很容易被忽略的话:
我们构建了一套完整的数据清洗、手部姿态提取、验证与筛选管线。
这句话写得很轻,但任何真正做过大规模数据的人都知道:
数据 pipeline 往往才是整个系统里最苦、最重,也最难长期维护的一部分。
实际上,现在越来越多具身团队都在建立自己的数据管线。
如果有自动驾驶经验,对这个问题可能会更敏感。
自动驾驶过去十年的一条重要路线,就是不断形成:
真实运行—发现问题—数据回流—模型迭代—重新部署。
真正把系统推向成熟的,不是一次性准备好一个巨大数据集,而是让真实运行本身不断产生下一轮训练需要的数据。
机器人其实也在走类似的方向,只是机器人面对的物理交互维度更多。
除了视觉上的“看错了”,还有:
抓滑了、碰撞了、力加大了、东西变形了、任务中断了、动作失败后重新恢复了。
因此,大晓希望通过环境式数采2.0,把真人数据、真机数据以及真实部署数据逐步连接起来,让部署本身也成为新的数据来源,形成:数据—模型—部署—再数据的持续飞轮。
ACE Data Engine,就是这套数据管线中的一环。
其中生成式4D手部动捕方案 ACE-ViDiHand,主要针对快速运动和遮挡情况下的手部状态恢复。
大晓披露的数据是:帧级准确率0.997,误差从8.1%下降到0.3%,动作平滑度提升4.8倍。
但把单条数据标注好,还只是前半程,另一个非常现实的问题是:
真人采的数据、不同机器人产生的数据,以及真实部署现场回流的数据,本身并不天然属于同一个世界。
它们可能拥有不同的:坐标系、本体结构、时间采样频率、数据质量与动作表达。
每条数据单独看都没有问题,放到一起却不一定能直接训练。
于是数据飞轮真正容易卡住的地方,就从“有没有数据”,变成了:
数据之间能不能互相理解。

这也是 ACE Ego Matrix 要解决的问题。目前它主要围绕四种统一:
空间坐标统一:让不同人、不同机器人动作能够进入统一的空间表达;
本体结构统一:通过 URDF 等方式统一机器人结构描述;
多维时序统一:尽可能对齐不同设备、不同数据源的时间表达;
数据质量统一:对不同来源的数据做一致的质量检测与异常处理。
它们最终指向的是同一个目标:
让真人数据、不同采集者的数据,以及不同本体的数据,逐渐进入同一套可复用的数据体系。
再往外,大晓还有 ACE-Data-Universe 与 ACE-Data-0。
前者继续把数据采集扩展到更加开放、复杂的真实环境;后者则把部分数据作为行业开放的数据接口。
所以如果把这些产品拆开来看:
ACE Ego Kit 是一套采集设备;
ACE Data Engine 是一个标注和处理引擎;
ACE Ego Matrix 是一套跨本体数据统一方法;
ACE-Data-Universe和ACE-Data-0,则分别承担数据扩展与开源数据集的角色。
但如果把它们放在一起看,大晓真正试图建立的其实不是某一个数采产品。
而是一整套:高信息密度物理智能数据基础设施。
07
写在最后
以上,是我们把 Dyna 2 和大晓环境式数据采集方案2.0放在一起看之后,得到的一些阶段性判断。
Dyna 2最重要的意义之一,是它再次打开了具身智能对于“人类数据”的想象空间。
但当数据从百万小时继续走向千万小时,一个新的问题也会越来越重要:
Scaling 的下一步,是否还只是增加小时数?
这也是大晓“信息密度定律”值得讨论的地方。
它试图把具身数据的讨论,从单纯的“有多少数据”继续往前推进到:
“数据里究竟包含多少能够改变行动结果的物理信息”。
因此,我们更愿意把 Dyna 2 和大晓看成两条正在逐渐靠近的路线。
Dyna 2从海量Human Video出发,把人类经验做大;大晓从Ego Data出发,试图把人类经验做深。
真正有意思的地方在于,两者最终很可能会在同一个地方汇合:
未来机器人的基础模型,既需要互联网级的人类经验规模,也需要足够高密度的物理世界信息。
如果这个判断成立,具身智能下一阶段真正的数据基础设施,就不会只是一个数据集,也不会只是某一款Ego数采设备。
它更可能是一整套覆盖:数据产生—物理信息记录—精细处理—跨本体统一—真实部署回流的持续循环。
从这个角度再看,大晓现在布局的 ACE Ego Kit、ACE Data Engine、ACE Ego Matrix,以及 ACE-Data-Universe 和 ACE-Data-0,真正想构成的,是一套让人类经验持续转化为机器人智能的高信息密度数据基础设施。
所以 Dyna 与大晓之间,与其说是一场路线之争,不如说是在从两个方向验证同一个未来。
Dyna 让行业看到:人类数据可以 Scale。
大晓则试图回答:当 Scale 真正开始之后,我们究竟应该把什么样的人类经验交给机器人。
这可能才是两条路线最终“顶峰相见”的地方。