点击下方卡片,关注【Xbotics具身智能实验室】公众号
你想要的这里都有~~
第二届世界人形机器人运动会 100 米大型组决赛,北京人形天驾队的天工 Ultra 人形机器人跑出 8.64 秒,快过人类百米世界纪录的 9.58 秒。
举重、舞蹈、跨障、跑步这些赛事动作,都是先在北京人形的动作捕捉场地里采成数据,再回到天工的算法里去的。这块具身数据的业务自己不上场,可天工的成绩要靠它。北京人形内部打过一个比方:它像天工的风火轮。
具身数据这件事,行业习惯比总量,谁家攒了多少万小时。可总量是存量,存量不等于能力,真正决定一小时数据值多少的,是它多久能从原料变成能训的东西、又能被多少个模型和多少种构型接着用。
北京人形给这块业务的成绩单是「1 个唯一 + 6 个第一」:全链路闭环能力行业唯一;工具链完备程度行业第一,真实采集场景数量全国第一,机器人本体构型行业第一,开源数据集下载量行业第一,合作伙伴数量与规模全国第一梯队,高质量真机数据交付规模全球第一。
这块业务的载体是具身智能机器人数据与训练基地,建成不到一年,年产能 18 万小时,已对外交付近 3 万小时高质量数据。9 月 3 日的开放日上,北京人形把整条链路对外讲了一遍。
具身数据这件事,比的是攒了多少,还是转得多快?
01|本体、大脑、数据,三位一体里的第三样
北京人形把自己的技术布局摆成三样东西:具身天工是本体,慧思开物是大脑,数据是血液,前两样有名字、有发布会、有榜单成绩,第三样没有发布会,一直在后面供数据。
机器人要在真实世界里持续变强,光有身体和智能不够,得有东西不断喂进去:身体决定它能不能上场,大脑决定它会不会想,而数据决定它见过多少种情况、下一次还会不会做错。三样里缺一样,另两样也用不起来。
数据这块业务在北京人形内部的位置就是造血系统。数据基地是它的车间,可它要管的事比一座基地宽:原料从哪来、怎么加工、交给谁、按什么标准算合格,一直到跨境流通怎么合规。
顺着这个比方,北京人形画了一张图:原料是基础燃料,加工是燃料提纯,交付让轮子转起来,标准和合规垫在轮轴的位置。

02|原料:广度靠采得齐,纯度靠洗得净
顺着那个比方,原料就是燃料。这一段有两件事:先把料采齐,再把料洗净,采得齐决定广度,洗得净决定纯度。采这一侧,北京人形的做法是真机采集为主,配上无本体的人类示教,两条轨道一起铺。
场景这一侧,6000 多平方米的实景实训空间覆盖家居、工业、商业、康养、医药、办公六大真实应用场景,30 多个真实子场景按 1:1 还原,能拆开重摆,把平时少见、真上岗一定会碰到的长尾工况摆出来重采。
构型这一侧,基地放了 150 台以上主流机器人设备、40 种不同构型的机器人,另有 100 多台无本体采集设备,配套的是头环式与夹爪式采集装置、动捕服、动捕手套和遥操驾舱。
同一个任务在好几种本体上各采一遍,同一件活换了机器该怎么做,数据里就有对照。多机型、多场景、多任务这样交叉着排,北京人形把它称为矩阵式采集,要的是数据不锁死在某一台机器上。
采法一共五种。光学动作捕捉记人体的轨迹、手部动作和姿态,基地为它专门建了约 200 平方米的场地;无本体采集自己又分两路,采集员戴着头戴相机或手持设备自己动手干活,采下第一视角的视频、惯性信号和音频,机器人不必在场,这两路分别叫 Ego 和 UMI。
剩下三种都要机器在场:真机遥操作让人隔着操作台驱动机器,拿到带深度的图像、关节角、力矩和触觉;开放环境采集把设备搬到基地外面去;远程遥操把操作端和机器端分开。
两条轨道各有短板。真机采的是机器自己的动作,直接可用,但设备贵、占地方,覆盖面铺不开。
无本体那条采的是人的动作,一副头环加一双手套就能开工,覆盖面宽得多,可它记下来的是人的关节,不是机器的关节。要把人的动作接到机器身上,靠的是北京人形自研的骨骼提取和手部姿态识别。
那块 200 平方米的动捕场地,今年夏天过了一次外部检验,天工 Ultra 在跑道上刷新的那个成绩,动作数据就是在这里采下来、再回到算法里去的。这条路走通,说明原料这一段的精度在真机上站得住。
采下来的东西不能直接用。同一条轨迹里,几路信号的时间戳要先对齐,相机要标定,坐标系要统一;画面糊了、手被挡住了、轨迹中间断了的片段要挑出来剔掉。北京人形把这一步叫清洗去噪。
03|加工:效率和成本都压在这一段
加工那一段,比方里叫燃料提纯。原料进来之后走六段工序,中间三道关卡拦着不合格的批次,每一批走到哪一步、被哪一关判过什么,都按固定格式记在账上。同样的活以前靠人一道道过,现在这套流水线把数据生产效率提高了 50% 以上,综合生产成本压下来 30% 以上。

第一段是数据接入,把进来的数据统一转成同一种标准样本。
第二段是准入校验与质检,查文件完整性和安全性,机器过一遍再由人工抽检判定,同时给每条数据打上场景属性的标签。不合格的批次在这里就被退回,并附一份说明原因的报告,拿到它才知道下次该怎么采。
第三段是 AI 预标注,预标可以来自平台上的模型推理、已有的预标导入,也可以来自历史真值回流,但三种都要过分层校验才挂得上去。
第四段是标注生产,总项目统一编排,数据包一键分发,图像、点云、位姿、语音这些不同模态的标注都在同一个工作台上做。
第五段是质量工厂。除了规则检查和一致性校验,它还做两件事:几个标注员判得不一样时交共识仲裁裁定;加权抽样配上「黄金暗测」,往批次里混进已知答案的样本,抽检时看它有没有被标错。没过这一关的出不了库,未达标的自动打回上一段返修。
第六段是出库,字段和格式怎么定就注册对应的转换工具,批次化发到指定存储,整条链路可追溯。出库的不只是数据,标注数据集、质量报告和效果评测报告一并出账。
六段走完,「验收」这两个字才落到实处:每一批出库的数据都带着它是怎么过关的证据一起走,不必只凭一句「数据质量很高」就收货。
加工这一段最难的一环,是让别人采的数据也能用。
每家自己采的数据别家往往用不了:两台机器人的关节数量不一样,一条胳膊上的动作换到另一种构型上不一定摆得出来;几路信号的时间轴对不齐,画面里手已经碰到杯子,力矩曲线却还没起来;仿真里量出来的距离和真机上量出来的,不是同一把尺子。
这些差异单看都不致命,攒到一起就让数据只能在采它的那台机器上用。
北京人形的做法是把它们一项项变成可以算的量:一条数据里真正有用的那部分占多少,靠价值密度评估算;一次训练里各类数据各占多少,靠数据配比定;几路信号的时间轴和坐标系对到一起,靠多模态时空对齐;仿真和真机用同一把尺子,靠虚实对齐。
再往下,是用全构型的数据反复打磨字段与格式那份约定,配上动作换算、迁移打分和质量度量。虚实那条线上还挂着一路合成数据,真机上少见的情况先在数字孪生里造出来,造出的轨迹再回到训练里补难例,这一路不算采集,它补的是采集覆盖不到的地方。
加工的最后一步是把结果送回采集端。模型训练和真机评测跑完,失败的样本不丢,先挖出来分类,再看缺哪一类长尾工况,然后把采集任务重新派回基地。采集、治理、交付、回流,四步转成一个圈,北京人形管这叫数据飞轮。
采集到交付是一条线,接上回流才成一个圈。这条链路能闭合,正是「1 个唯一」的实际所指:从采集、清洗、标注、质检、训练到回流,整条链路在同一个平台上打通,没有一段落在外面。

04|交付:同一批数据,三个方向
交付这一步,比方里是让轮子转起来。同一条链路加工出来的数据交去三个方向,同一批数据因此被用了三遍。
第一个方向对内,数据直接喂给具身天工这个通用机器人平台,本体跟着数据一起变强。这条路的好处是不用出门就有一个随时能上机验证的对象,模型改完当天就能在真机上试,试出来的问题当天回到采集任务里,北京人形把这叫自我造血。
第二个方向对外,全栈技术、数据产能和平台服务开放给产业伙伴,服务的是做模型训练和具身大脑研发的企业与科研机构。对外服务分四种:数据服务(DaaS,按任务按小时交数据集)、平台服务(SaaS,伙伴在平台上自己采、自己标、自己质检)、定制化产业解决方案,以及产教融合。
开放出去,别人就不必从头造一遍轮子。高质量数据本来就该是行业共用的底座。
第三个方向不收钱。开源具身数据集 RoboMIND 面向全球开发者开放,上线不到一年,全球下载量突破 2000 万次,最近一个月里还翻了一倍,放出去的是 30 万条以上双臂操作轨迹,覆盖 700 多项实操任务,全量对外。
三个方向共用同一条链路,压力也就落在同一套工序上:开源那一路带回来的是全球开发者的使用规模和反馈,对外服务那一路带回来的是真实场景的验收压力,对内那一路带回来的是一个不出门就能做真机验证的对象。同一批数据被三方同时盯着,标准就得真的用起来。
05|标准与合规:它们不产出数据,可它们决定数据能走多远
那张图把标准和合规垫在轮轴的位置,比方里的说法是标准决定转得稳、合规决定转得正。两样都不产出数据,可它们决定这些数据能不能被别人接住、能不能长期流通。
标准这一层,北京人形牵头并参与了多项国家标准、行业标准与团体标准的编制落地,从采集、标注到质检搭起一套全流程标准体系。立足数据、不逐利,把标准直接嵌进采集、质检、交付这几个环节。
标准的作用很具体:要能验收,就得先有一份双方都认的口径,什么算合格、抽检抽多少、缺陷怎么分类都写在里面。口径不统一时「高质量」只是一句形容词,统一之后它才变成一份能拿去对账的报告。
口径要立得住,靠的是把指标做成共用的一份:做评估的几个工作台共用同一套指标引擎和同一份金标,谁也没法私下改一个阈值。北京人形管这叫口径不漂移。

往外一层,标准决定了别人采的数据能不能进来。北京人形正在全国对接 100 多家数采厂共建产能,各家字段、格式和质检口径若不是同一套,汇进来的只是一堆要重新清洗的素材;把行标做进这几个环节,别人采的数据才排得进同一条链路。
合规管的是另一件事:来源要授权、全程要脱敏、流通要安全,每一批都可溯可查,整条链路的血缘能查到它是谁在什么条件下采的、经过哪几道工序。血缘立住了,往上才谈得上合规的数据集市和跨境流通。
标准和合规都不是能拿出去讲成绩的东西。但把它们做出来、让全行业照着走,本来就是一支国家队该干的活,单独一家企业没有动力去统一别人的口径,也没有立场去把跨境的那条路跑通。
下一个目标是 100 万小时高质量数据,做全球第一个百万小时级的高质量具身数据平台。分量全在「高质量」这三个字上:100 万小时这个量级本身不构成门槛,能不能让其中每一小时都过得了同一套验收口径,才是这个目标真正难的地方。
北京人形眼下在搭一个多模态数据管理服务平台,让来路不同的数据汇进来、洗干净、标好、拿去训练、再管起来,从头到尾走在一条线上。要解的就是这一层。
-END-
Ask Me Anything|提问箱
对文章有疑惑,或想聊更深?欢迎把你的问题丢给我们:技术方案、实操踩坑、课程与资料、项目合作、职业发展,都可以问。
怎么问:在评论区留言,或私信公众号
我们会做什么:每周集中整理高质量问题并公开回复,重点问题邀请作者或嘉宾深度解答;典型问题会加入知识库并持续更新。
提问小提示:尽量说明「你的目标—当前做法—期望产出」,附上必要信息(硬件/软件版本、数据规模等),能更快获得有用答案。
一起把问题变成知识,推动社区进步 🚀