具身智能走到哪一步了?数据公司最先知道

暗涌Waves 2026-08-04 15:37
具身智能走到哪一步了?数据公司最先知道图1
做智驾的去做具身了,做数据服务的被请上主桌了。

刘洋

编辑巴芮


具身智能走到哪一步了?数据公司最先知道图2


具身智能到了哪一步,问一个卖铲子的可能比问淘金的更实在。

从2025年初到2026年初,不断有投资人和具身本体公司找到恺望数据CEO于旭,问她同一个问题:“你能不能做具身智能的数据?”

恺望成立于2022年,主业是为智驾公司做道路数据的采集、标注和处理。智驾卷到现在,一部分需求转向存量数据的复用和交易,成本降了1/3,效率提高了1/3——把旧数据打包成可复用的标品再卖一遍,于旭和客户开会的主要议题变成了讨价还价。

没意思,光剩下赚钱了。2025年恺望订单额近1亿元,目前有20多名正式员工,以及1万多名众包形式的线上采集员和标注员。

新的增长曲线几乎是找上门的。很多以前做智驾数采的行业大佬切入具身智能,投资人拆开具身产业链发现,80%的构成与智能驾驶相关。做智驾的去做具身智能了,做数据服务的开始被请上主桌了。

于旭成了一个好选择。

她是Uber开城员工、坊间知名女车头,曾历任Momenta智驾数据负责人、字节大语言模型标注资源负责人——于旭的血液里流着网约车方法论:一套在行业快速扩张期,数据驱动、资源高效配置、从0到1规模化落地的底层逻辑和执行框架。现在,具身智能需要它。

恺望走的是更容易规模化的Human-centric路线:以人为中心,不依赖机器人本体,普通人佩戴PICO头显、UMI夹爪,就能采集第一视角的真实场景行为数据。然后于旭把网约车方法论复用了过来。

先采再说,快速积累原始素材,在模型反馈里迭代“好数据”的定义;把普通人变成AI生产链里的有效生产力——当年把司机变成数据采集节点,现在把服务员、学生、工人变成具身智能的采集员,把标注员升级成能做语义理解和任务逻辑标注的“AI训练师”;再像网约车那样端到端掌控数据价值链,不只做单一环节,而是把定义、采集、加工、交易做成全链路,搭一个数据供需匹配平台。

这一轮数据行业的核心变化,是对人类经验提取方式的升级。

纵向看,数据从互联网、道路这些结构化场景,走进了物理世界。自动驾驶和大语言模型时期,这行靠人力组织和流程管理赚钱,是光鲜前沿AI背后隐身的众包大人力;到了具身,一样离不开人,但多了采集硬件、标注加工、场景落地、模型验证闭环。

人类行为数据不断累积,机器能看懂、能自学,每学一次就能让下一次学得更好——于旭和她的生态圈伙伴认为,这才是真正的AI。

横向看是采集路径之争:真机遥操太贵,仿真合成、Human-centric、互联网视频各占一段,可规模化的高质量第一视角真实数据成了刚需。对应到公司,头部本体公司做真机,重资产的采集厂做公共训练平台,恺望这样的第三方服务商靠众包进真实场景。

两条线的交叉点,就是恺望和所有数据公司的风口。过去半年,各条采集路线上的数据公司都在密集融资,连做传统标注的上市公司也在调头具身。行业里一句话被反复引用:2024是硬件元年,2025是模型元年,2026,轮到数据了。

在这个风口上,恺望完成了新一轮过亿元战略融资。「暗涌Waves」独家获悉,本轮融资由北京亦庄产业升级基金、华方资本、天际资本联合领投,新鼎资本、迈睿资管、兴华鼎立等机构跟投。

同时,自变量机器人、松延动力、智元旗下觅蜂科技、鹿明机器人等多家国内头部具身智能公司成为其战略投资人——它们有的是机器人本体公司,有的偏算法,也有本体公司孵化出的具身数据平台。Human-centric已经成为它们数据布局里的一条重要路线。

过去恺望是“自动驾驶一站式数据解决方案提供商”,现在变成了“全链路AI数据基建科技公司”——这是一家传统AI数据服务公司给自己的新定位。

于旭说恺望跟美国的Scale AI很像,“我们有百分之八九十的基础业务相近,Scale AI定义自己就是一个AI基础设施公司。”Scale AI是美国数据标注和训练的龙头,它有一个足够远大的愿景:“The world's most important decisions need reliable AI systems”。

为了说明白数采在具身智能爆发的当下,发生了多大的变化,于旭嘴都起皮了。3个半小时的访谈,她一人说了168分钟,提问20分钟,一起交流的恺望合作伙伴补充了20分钟。

数据一旦量化,就会让人惊讶。

想起合作伙伴结尾时说的话:“她很愿意不厌其烦的,像布道一样地解释,她对自己选择的这件事非常有信心。有时候别人也觉得很神奇,怎么会有这么一个人,一直一直一直在讲

这从侧面证明一件事,于旭要抓住机会,让数据服务的生意在2026年得到应有的历史地位。

以下为暗涌Waves与于的对话(经辑):

Part01

PICO租金都涨了

暗涌恺望具体怎么做具身数据采集?

于旭客户跟我要的都是EGO(第一视角)的预训练数据,最近还接到三家做世界模型的公司,要第三视角的互联网视频数据。

采集分裸手和非裸手。非裸手带UMI夹爪或者手套,都带触觉传感器:UMI能记下拿起、松开那两个点上的力控,手套触觉更灵敏,能感受到不同材质的力度差别,不过都还在探索,有的设备还有点笨。纯裸手最简单,头上戴个VR头显拍视频,问题是手部关节标注不够准,还得人工再调。

暗涌:哪种数据卖得最火?

于旭:纯裸手双目数据是我们的爆款,需求量目前最大;第二是UMI,手套我们没有。基本上数据做出来就直接有人预购,需求量级基本都是10万小时。

一个人一天大概有4小时是有效的,相当于一个人一个月做100小时数据,按租100套设备算,一个月就是1万小时。现在设备这么贵,单月能做1万小时是个坎儿,跨不过去,别说自己是干数据的;单月10万,是个大坎儿。今年7月,我们已经能做到接近了10万小时。

暗涌:PICO都快不行了,让你们给整活了?

于旭:租金都涨了,原来一天300(元),现在500(元)。现在全国还没有一个足够好的双目设备。所以我们一边租PICO,一边和具身公司合作,拼五六家的设备来用。集中采完之后,数据还能再交易,形成活水。这个行业现在就是全行业都在创业。

暗涌:你们主要做什么场景的数据?

于旭:现在以商业和家庭这两个场景比较多,恺望的优势是在真的超市、真的饭店里采集,目前合作最多的是义乌和北京一家规模较大的商业体。另外是工业的诉求,工业产线的开放度、敏感性都比较强,但最近也有头部车企主动联络我们。

暗涌:现在营收怎么样?

于旭:上半年我还在想怎么从自动驾驶切到具身,现在具身数据的订单额已经超过了自动驾驶,占到60%。

2、3月份见客户基本战无不胜,本身有智驾的基础,很多具身公司相关负责人也是从智驾转过来的,信任感强;但能不能真进这个行业,那时还打问号。到了4、5月份,全忙着签协议、定合同。粗略一算,最近单月有接近2000万订单额,这个数字在公司早期基本是一整年的量。

这个量非常猛,而且是每月验收——一旦做起来,每个月迭代的速度非常快。

Part02

1单4买家

暗涌:你之前说过,很多具身公司其实并不知道自己要什么样的数据。

于旭:客户时常说不清非常具体的“我要什么数据”,但他们都很确定:没有大量物理世界数据,世界模型做不出来。不知道要什么,不代表需求是假的。

所以现在这门生意是从“定义”开始的。以前在智驾,客户拿着需求来,我们采就行了。

暗涌:你们怎么帮客户定义数据并执行的?

于旭:先定场景,再定任务。有个本体公司客户只告诉我要商业场景、越丰富越好,其他没了。那就我们来定:多大比例是餐厅的、多大比例是咖啡厅的,再按他的时间和成本给方案,方案里甚至包括,如果有共享版权,我怎么帮他卖掉。

定完才是采。一部分在小型采集厂,人在模拟场景里做;一部分在真实场景,一类是和高校合作,学生在食堂、咖啡馆模仿服务员端盘子、做咖啡;另一类就是真的服务员,戴上头显边工作边采。服务员一个月五、六千元工资,我们再补贴一部分,他们觉得赚点外快还挺好。北京有个川菜饭店主动要参与,很懵,又觉得挺好,“我们服务员参与进来,看看怎么让自己的工作变得更简单”。

再往后是标注加工,最后是交易——我们做了个平台,像数据超市。

暗涌:采集和交易,哪个更赚钱?

于旭:我们最终目的不是靠人力赚钱,更多是赚数据产品的钱,相对而言数据流通和交易的毛利更高。

预估到年底我们的订单量会破100万小时。一些本体厂商今年爆发性地全要买无本体数据,他不想自己做,因为自己做还需要很长时间。

现在我最大的1单关联着4个买家:1家要采集,另外3家的需求和这1家匹配度极高,相当于做1次卖了3份,再给第1家分成。这1单用的设备是租的,谈的是共享版权,这样大家就共赢了。

暗涌:本体公司把自己做的数据卖出去,不担心竞争问题吗?

于旭:早期是有担心的,要锁定一段时间才让卖,现在数据比较趋同,能带来商业价值的复用,大家还是开放的。而且他的数据卖得多,就代表他的标准在行业里跑得更快。

Part03

机器人最离不开人的活儿

暗涌:你说年底订单量破100万小时,这背后需要多少人工作多长时间?

于旭:平均8小时采集里,有效率可能不到50%,新人更低。而且经常耽误时间的不是人,是设备。有时候单日两班倒,因为设备不够,中间会有一段重叠时间,差不多单日有效采集时间是4小时。按一年365天估算,一年完成100万小时,大约每天需要1000多人和1000多台设备持续采集。

暗涌:可以理解为采集和标注是前沿科技公司最需要人工的部分,也是普通人离AI最近的工作吗?

于旭:是这样。我们做的是把全国人工作的经验抽出来。这肯定得跟人有交互,机器搞不定。有了经验之后,还得让机器能看懂,就需要标注。

精加工里语义理解占大头,大语言模型的预标注还搞不定,因为要标注的是一条任务逻辑链。比如桌上有个杯子,具身要求你标的是:我要喝一杯水,先找到杯子,把盖子打开,喝了水,再检查一下水是否喝完。

暗涌:现在还是做这样的任务吗?

于旭:这个任务今年1、2月份还很刚需,现在客户不喜欢了,现在要的是拿起这个杯子、越过这个东西、放到那儿。

这只是生活或商业场景的简单例子,在一些垂类行业就更复杂。比如汽车工业产线里一般是质检和评判工作,逻辑链梳理只有专业的人才懂。但我相信也有解决办法,比如做拆解分类。

暗涌:听起来无本体数采的技术门槛不高,你们的护城河是什么?

于旭:单点看,技术门槛可能没那么高,但最后比的是规模、质量和全链路能力。我们现在不缺需求,就看怎么抓住这个timing。早期滴滴和Uber的APP还挺特别的,现在要仿制很容易,但核心是有多少量在你这个平台上做,有多少人愿意用你这个平台。

暗涌:你凭什么觉得量会到你这儿来?

于旭大模型都要高质量数据,怎么给?能采、能标还不够,还得能定义、能上规模。

这套东西是在智驾练出来的。当年BEV标注,一个成熟人力要培养3到5个月,大厂花3倍价钱把全行业的生产力都挖走了。我和团队熬了两三个通宵,想出个办法:把生产线拆成几个环节,普工、学生、网约车司机都能进来,一个任务拆成4份,4个普工顶一个成熟人力。门槛一降,规模立刻上来,质量还更好——4个人每人盯一块,就是4倍的审查效率。

现在卡产能的就是设备和人。设备是租赁合作,采集的人是做智驾时就攒下的,1万多个,随时能接新任务。这两样,别人从头搭一时半会儿凑不齐。

而且同样一批数据在我这儿做完,我还能帮你卖掉、给你分成,你的成本就摊薄了。

Part04

一个大家都认的市场

暗涌:2025年初就有人找你做具身数采,当时为什么拒绝?后来为什么又决定做了?

于旭:2025年我们还在做智驾数据流通,生意很红火。那年上半年,投资人问我怎么不去做具身的数据,那时候具身还是遥操和模仿学习,非常早期。我就想起大语言模型刚出来的时候,最痛的点是模型通用能力不错,但落到哪个点能赚钱呢?我们陪伴了好几家头部企业,发现它赚不了钱,我就想,别又来一个……

2025年Q4,很多具身本体厂商又给我打电话,说现在不用遥操了,用无本体数据。这时候大家的共识已经转向做大脑、做真正的世界模型,让机器从模仿学习走到有自主意识去做事。感觉大家都觉醒了。

暗涌:有具体的事触动了你吗?

于旭:两场深谈。一个是之前智驾行业老大级的人物,我一开始对他投身到一个具身公司特别不理解。他开口就讲“一生二,二生三,三生万物”,我以为反正就是交易嘛,后来才听明白:智驾是存量,大家只能互相压价;具身还在0到1,蛋糕是往大了做的,所以他希望这个阶段行业别那么不健康地竞争,先把产业链做起来,链条上每个人都有钱赚。

以前客户开会只谈降价,觉得你就是个供应商;现在在具身,大家更平等,说的是合力、合作。

另一次是和一位具身公司创始人交流。两年前他做很小的机器人,我还想,哇,天方夜谭。两年后再见,他第一句话就是,“哎呀,我们这个非常缺数据”。

我讲了过去怎么把自动驾驶的复杂任务拆成几个环节、让普通人也能参与,他越听越兴奋,都要站起来了,“你这个智驾的东西,能复制到我这个具身上面吗?”他说想进到所有的家庭场景采集,要百万小时以上。大家对这个行业的认知是一样的。

暗涌:真正进入具身领域,有什么感受?

于旭:现在的伙伴不会让你一遍遍论证,咱们共同做的这个市场有没有钱赚?这个地方是一个大家都认的市场。

暗涌:所以具身只是入口,它成不成不一定,重要的是物理世界的数据需求?

于旭:对,具身是现在最突出的入口。我们现在服务的是更大的物理AI、世界模型赛道。具身最典型,因为它有硬件、有大脑、有场景,但未来自动驾驶的垂类世界模型、半导体、工业场景,都可能需要类似的高精度、规模化的真实场景数据。所以我们不是只做机器人公司的生意,而是做AI进入物理世界所需要的数据基础设施。


排版|郭栩君
图片来源|Unsplash

具身智能走到哪一步了?数据公司最先知道图3

推荐阅读


     的     流     向     ,          的     沉     浮

具身智能走到哪一步了?数据公司最先知道图5



关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。
more
从一颗芯片到一座算力工厂:中国 AI 芯片走到哪一步了?|WAIC 2026
从算力硬件到Token工厂,安擎解码AI算力的下一站
吉利,重磅收购福特工厂!
OLED面板大厂员工泄露LGD广州工厂机密被判刑!
国家级零碳工厂、零碳算力设施建设工作启动
AI算力竞争进入系统时代!中兴OEX超节点发布,重新定义AI工厂底座
跨集群异构PD分离WAIC首发,专访无问芯穹李秀红,探秘Token工厂「超级管线」的落地路径
涨价 45%!存储晶圆代工厂大幅调价
突发!LG中国首家工厂被曝将于10月停产
达索系统PLC虚拟联调:数字化工厂的“第一次生产”!
Copyright © 2025 成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号