机器人“吃”了100万小时,消化了多少?

盖世具身智能 2026-09-03 17:15
机器人“吃”了100万小时,消化了多少?图1

如果一家公司宣布自己拥有100万小时机器人数据,应该怎么看?


先别急着被“100万”打动。


8月31日,在觅蜂科技媒体群访现场,盖世具身智能把这个问题直接抛给了觅蜂科技董事长兼CEO姚卯青:抛开小时数,怎么判断一家公司的具身数据到底有没有价值?


他的回答反而给“百万小时”这个数字泼了一盆冷水:“盲目地采集100万小时说实话还是很容易做到的事情,重复地做工种任务就可以了,但几乎没有任何价值。”


这或许才是“百万小时”之后,具身数据产业真正需要面对的问题。


第一篇讨论过,机器人如果要进入开放世界,需要远超今天规模的数据;第二篇讨论的则是,当需求从百万小时走向千万、亿小时,数据生产正在从数采工厂扩展到社区、家庭和真实工作岗位。


可规模一旦真正上来,新的问题就会迅速出现:有数据,不等于有训练数据。


一名员工戴着设备工作3小时,硬盘里当然会多出3小时视频。


但这3小时里,人有没有真正执行任务?手有没有离开画面?动作轨迹准不准?场景是不是已经采过无数遍?模型究竟能从里面学到什么?


如果这些问题没有解决,那么具身智能可能很快从“缺数据”,走向另一个极端:拥有海量数据,却不知道哪些值得训练。


所以,百万小时之后,数据行业真正开始竞争的,很可能不是“采”,而是“炼”。


“100小时视频”和“100小时训练数据”,不是一回事

具身数据最容易产生的误区,是把摄像头运行时间直接理解成数据资产。


二者实际上相差很远。


姚卯青在群访中解释所谓“有效数据”时,给出了几个非常基础、甚至有些琐碎的例子:


如果采集过程中手根本不在画面里,不能用;人戴着设备却长时间“摸鱼”、没有动作,也不能算;哪怕人在操作,做的事情本身也必须有意义。


然后才进入更加技术性的要求。


设备声称60FPS,实际平均帧率究竟能不能达到59.98、59.99;相机标定是否准确;HandPose提取出来的手部轨迹究竟是几厘米误差,还是能够压缩到5—7毫米;更重要的是,这些精度还必须能够通过真值进行验证。


换句话说,真实发生过,不代表真实记录对了。


这是具身数据和普通互联网视频非常不同的一点。


一段做饭视频即使少了几帧,人依然能看懂厨师在切菜。


但如果机器人需要从中学习动作,几帧误差可能意味着手的位置、接触时刻乃至物体状态发生偏差。


图像里“差不多”,到了机器人的控制系统里未必还是“差不多”。


所以,具身数据真正的生产过程,在摄像头停止录制之后其实才刚刚开始。


觅蜂现场披露的MEgo Engine,就是试图解决从Raw Data到Training Dataset之间的这段距离:原始数据要经过预处理、空间感知、原子化语义标注和质量评估,同时完成时间对齐、轨迹重建、人体关键点估计、任务拆解等处理。


先不讨论这套系统本身做得是否足够好,它至少说明了一件事:所谓具身数据公司,未来很可能不能只是一家“录像公司”。


真正的门槛,是把一段人类行为翻译成模型真正能够理解和调用的训练资产。


机器人学的不是“擦桌子”,而是擦桌子里的动作

这种翻译究竟是什么意思?


假设一个保洁人员佩戴设备,连续工作两个小时。


对人来说,这是一段完整而自然的劳动过程。


他走到桌边,拿起抹布,移动杯子,擦拭桌面,把垃圾丢进垃圾桶,再走向下一张桌子。


机器人“吃”了100万小时,消化了多少?图2


但模型很难直接从一段两小时长视频里知道:


哪一刻任务开始?


哪一段是在抓取?


什么时候发生了放置?


哪个动作属于擦拭?


哪一步失败之后发生了重新调整?


所以,第一步往往是把长时间的人类行为“拆开”。


觅蜂技术负责人刘力介绍,其系统会将小时级、甚至2—3小时连续数据拆解成不同层级的语义信息,从整体任务继续拆成子任务,再拆成更细的原子动作,目前其披露可识别120余种动作类型,例如摆放、释放、放置、抓握等。


这个过程其实揭示了具身数据真正有价值的单位可能是什么。


未必是“小时”。


它可能是一次抓取。


一次插入。


一次旋转。


一次失败后的重新尝试。


甚至是一段“伸手——接触——移动——释放”形成的完整交互链条。


这也是为什么单纯比较两家公司谁有100万小时、谁有200万小时,越来越缺乏意义。


机器人“吃”了100万小时,消化了多少?图3


一个数据集里可能充斥几十万小时相似动作;另一个虽然总量更少,却包含大量不同物体、不同环境以及可以复用的原子技能。


如果最终进入模型的是后者,那么“小时”很可能只是生产统计指标,而不是价值统计指标。


姚卯青在群访中也提到,目前客户首先会看场景,其次看HandPose等空间精度,再往后是动作与标签的描述精度;最终目标是数据能够直接进入模型,同时动作表现还要符合人正常工作的状态。


这意味着,具身数据行业正在经历一个很典型的变化:从“有没有”,进入“能不能直接用”。


甚至“坏数据”,也未必真的坏

但如果只是把低质量数据全部删除,事情依然没有那么简单。


这一点反而是觅蜂此次发布中比较值得讨论的技术思路。


在ManiEval数据质检体系里,觅蜂提出的原则不是简单“过滤”,而是:“不过滤,只分级。”


按照现场介绍,数据会从数据类型、任务类型、传感器质量、语义质量和动作质量等维度评分,再进入四种不同用途:精确数据用于策略模仿学习;语义和环境信息更加丰富的数据用于预训练和表征;包含环境干扰、动作偏差或部分失败的数据,则可以用于错误检测和任务进度感知;长尾边界数据则用于泛化测试和corner case能力增强。


这背后其实有一个很值得展开的问题:什么叫“坏数据”?


如果一个人在抓杯子时手滑了一下,从模仿学习的角度看,它当然不是一个值得机器人复制的标准动作。


但机器人未来进入真实世界之后,难道永远不会手滑吗?


如果模型从来没有见过失败,又如何知道失败正在发生?


更进一步,如果机器人拿杯子拿到一半发生偏移,它应该继续执行、重新抓取,还是直接终止任务?


这时候,一段“不成功”的人类动作,反而可能比1000次完全相同的成功动作更有价值。


这与自动驾驶行业曾经经历过的数据逻辑非常相似。


早期大家热衷比较测试里程。


但随着系统能力逐渐提高,真正稀缺的往往不再是正常直行一万公里,而是那些少见、困难甚至导致系统失败的corner case。


具身智能很可能也会经历同样的转变。


机器人“吃”了100万小时,消化了多少?图4


机器人会叠1000次完全相同的衣服之后,第1001次成功可能不会增加多少新的知识。


但突然换成一件特别柔软、特别滑、形状异常的衣服,机器人失败了。


这个失败,可能反而是一条更值得留下的数据。


所以数据产业未来的价值衡量,也可能逐渐从“采了多少成功动作”,变成:发现了多少模型原本不会的问题。


最有价值的数据,可能是机器人失败的那一刻

这一逻辑继续往前走,就会来到第三篇真正重要的地方:


数据不是一次性交付给模型之后就结束了。


真正成熟的数据体系,应该与机器人部署形成闭环。


觅蜂此次展示了一套相应思路:模型利用前期数据获得初步能力之后进入真机执行,机器人执行产生的数据再回流,系统从中寻找失败场景和困难场景,重新加入训练,然后更新模型策略。


其中REMORA Value Model试图进一步判断任务进度、发现异常动作,并把失败样本重新作为高价值数据使用。


当然,这里需要保持一点距离。


这套闭环目前仍然主要是觅蜂披露的技术路线和自身测试结果,它究竟能在不同机器人、不同模型和复杂真实部署中带来多大的稳定增益,还需要更多外部项目验证。


但这个方向本身非常重要。


因为它意味着具身数据产业最终可能从一种“库存生意”变成一种“反馈生意”。


过去的逻辑是:


采100万小时,整理好,然后卖掉。


未来可能变成模型先训练——机器人去工作——找到失败——判断为什么失败——重新采对应的数据——再训练。


到了这个阶段,一个机器人企业真正需要的数据,不再是供应商货架上“还有多少小时”。


而是我的机器人现在最缺哪一条数据?


这两个问题,差别巨大。


前者是按库存组织生产。


后者则是按模型能力缺口组织生产。


如果这一转变成立,未来具身数据行业最核心的能力,很可能也会随之变化。


能够一次性采到100万小时,当然是一种能力。


但真正更难的事情,是当机器人在一个陌生场景里失败之后,能够快速定位:


它为什么失败?


缺的是视觉理解?


空间轨迹?


某种物体交互经验?


还是根本没有见过这种边界情况?


然后再回到真实世界,准确补上这一块经验。


数据飞轮真正的“飞轮”,不是数据越来越多,而是模型越来越知道自己缺什么。


数据行业最终还是要回答一个问题:效果呢?

所以回过头来,怎么判断一家具身数据公司的数据真正有价值?


姚卯青在群访中的回答其实有三层。


第一,看覆盖够不够广,不能100万小时都在重复几个工种;第二,看能不能拿出详尽的质量验证报告;第三,看数据有没有真正被客户验收、签验收单甚至形成收入,因为市场付费本身也是一种验证。


这些指标都合理。


但从产业观察的角度,还应该再加上最后一层:模型效果。


数据最终不是为了卖数据。


甚至也不是为了做出一份漂亮的质量报告。


它最终应该回答的是:


模型用了以后,机器人究竟有什么变化?


成功率有没有提高?


过去做不了的任务是不是学会了?


换一个陌生场景还能不能工作?


发生错误之后能不能恢复?


同样增加1万小时数据,A数据集让成功率增加10个百分点,B数据集只提高1个百分点,那么即使两者都满足60FPS、毫米级精度和完整标签,它们对模型的真实价值仍然不同。


这也是目前整个具身数据行业仍然缺少的一块公开证据。


觅蜂此次展示了HandPose、数据治理、ManiEval和Value Model等能力,也公布了一系列技术指标。例如按照公司测试结果,其HandPose在特定遮挡、交互和高速移动测试中,手部重建误差达到4.29毫米,时序帧间抖动误差1.11毫米。


这些数字能够证明数据处理链路的一部分能力。


但它仍然不是最终答案。


算法把手的位置重建得更准,最终有没有让机器人把任务做得更好?


后者才是数据价值真正闭环的一刻。


今天具身智能产业热衷谈Scaling,这很容易理解。


百万小时、千万小时、亿小时,都是极具冲击力、也非常容易传播的数字。


但随着数据规模越来越大,行业迟早会进入一个新的阶段:


“有多少数据”会变得越来越不重要,“每增加一份数据,机器人究竟学会了什么”会变得越来越重要。


这可能也是具身数据产业真正的分水岭。


第一阶段,比的是谁能采。


第二阶段,比的是能规模化生产。


而到了第三阶段,竞争的问题可能变成:


谁更早知道,机器人下一步最应该学什么。


当行业走到这一步,“百万小时”就不再是终点,甚至不再是最重要的指标。


真正值钱的,不是数据仓库里又多了一小时。


而是这一小时,恰好补上了机器人原本不会的那件事。


封面图来源:豆包AI


-END-


往期热点

1

2

3


活动推荐


“盖世具身智能”设为星标🌟 锁定更新



请为我点个赞再走

机器人“吃”了100万小时,消化了多少?图10

关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。
机器人
more
机器人控制系统(RCS):告别一台机器人一个控制器
比亚迪认购600万美元!国内工业机器人3D视觉龙头成功上市
宇树消防机器人亮相,能和被困人员对讲
新品直击|全球首款全自主导盲机器人:朱葛机器人AI LOOK亮相福祉博览会
量产能力,重新定义人形机器人估值?
5天卖出1万台,最火机器人凭什么是只鸭?
The Imitator Game:定义机器人视频模仿能力的完整评测框架
荣耀自研人形机器人亮相马来、沙特 海外市场整体增长稳健
Xbotics 机器人仿真工作坊 · 松应 ORCA 专场
优必选携手麦迪科技发布首款仿生医疗机器人,人形机器人加速切入真实医养场景
Copyright © 2025-成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号