具身智能的问题,是大家想得太简单了

高工机器人 2026-09-14 09:10
具身智能的问题,是大家想得太简单了图1
具身智能的问题,是大家想得太简单了图2

加入高工机器人专业行业群,加微信:17811613845,出示名片,仅限机器人及智能制造产业链相关企业。

*本文共约 5654 字,阅读完成需 10.5 分钟。


对于具身智能而言,这是最好的时代,也是最坏的时代。


资本持续涌入,今年中国具身智能融资金额已经逼近2000亿;新的模型、新的产品与新的年轻创业者接连现身;机器人开始走进商场、仓库与工厂。关于机器如何参与生产与生活的想象,正在获得越来越具体的支撑。对这个有无限前程的新生赛道而言,机会正在涌现,期待也随之抬升。


但质疑与不安也在累积。股价波动牵动着市场对估值的判断,围绕商业化成色的争论持续发酵,有关政策走向与上市节奏的消息,又为企业的发展预期增添了变数。事实、推测与流言交织,让行业情绪在期待与怀疑之间反复摆动。


技术探索有自己的节奏,外界要求答案的声音却越来越急迫。今天,仅凭一个成功的Demo,已经很难满足行业的期待。用户与投资者更急切地想知道,机器人究竟何时才能成为可以持续工作、创造实际价值的生产力工具。


对于身处其中的从业者,商业化催着交付,技术迭代又让人害怕掉队,两头的压力交织成焦虑。


9月11日,在外滩大会上,由蚂蚁灵波发起并主办的具身智能分论坛「基座之上:具身智能的场景突围与协同进化」,为行业这一年积攒的情绪与疑问,提供了一次集中表达的空间。科学家、数据服务商与机器人企业坐到一起,把各自在研发和交付中碰到的难题带上了台面。


具身智能的问题,是大家想得太简单了图3


有意思的是,在技术以前所未有的速度迭代之时,蚂蚁灵波首席科学家沈宇军却反思道,过去一段时间,包括灵波自己在内,“有时把具身智能想得过于简单”。


这个判断,也为三场圆桌提供了一条值得追索的线索:当现有模型进入物理世界,当数据需要转化为模型能力,当机器人真正面对客户,我们究竟在哪些地方,把具身智能想简单了?




通用大模型会吞噬具身大模型吗?


具身智能从业者的焦虑,有时来自非本领域的进展。


近日,GPT-6 Astra被接入机械臂控制接口后,完成了真实环境中的抓取与放置任务。一个问题随之变得更加直接:如果通用大模型越来越会操控机器人,专门研发具身模型的公司,究竟还需要做什么?


这则消息真正令人焦虑的,或许并非GPT-6已经能够完成多少任务,而是它暗示着一种令行业不安的未来:


通用大模型每一次能力跃迁,都可能重新划定具身模型公司的技术边界。昨天还需要专项研发的能力,明天或许就会成为基座模型的默认能力。


“数字世界的模型又进步了,是不是没有具身什么事了。”


蚂蚁灵波科技首席科学家沈宇军在现场复述的这句话,道出了部分从业者的不安。


具身智能的问题,是大家想得太简单了图4

蚂蚁灵波科技首席科学家沈宇军


在他的分析中,如果一家公司的工作主要建立在已有大模型之上,那么基座能力的一次跃升,很可能导致此前投入的所有努力将毫无意义。


这也是他对上半年路线之争的一次反思。当行业反复争论VLA还是WAM时,许多方案仍然沿着已有工具向外延伸:手中有视觉语言模型,就尝试让它输出动作;手中有视频生成模型,就让它预测机器人接下来会做什么。


在沈宇军看来,更需要回答的问题是:如果从头为机器人开发模型,它究竟需要具备哪些能力?


沈宇军将其归纳为三件事:首先,从持续涌入的传感器信号中,提取能够表达视觉、空间、力与触觉的有效Token;随后,将不同模态的信息放进同一个模型中完成对齐与融合;最终,根据这些观测生成可以执行的动作。


与数字模型不同,机器人面对的是持续流入的视觉、触觉、力觉与自身状态,动作发生以后,环境又会立即变化,并产生新的观测。模型因此必须在感知、理解和行动之间不断循环。


在灵波看来,通用大模型可以提高理解与规划的起点,具身模型仍需补上从数字智能走向物理行动的距离。


这并非灵波从一开始就确定的答案。蚂蚁灵波CEO朱兴在接受采访时介绍,团队早期也曾基于通用视频生成模型进行微调,让它适应机器人任务。但随着研发推进,能力提升逐渐遇到限制,进一步调整还可能损伤原模型的先验知识,影响泛化。


具身智能的问题,是大家想得太简单了图5

蚂蚁灵波CEO 朱兴


“走到后期我们真的是撞到南墙了。”


这次碰壁也推动灵波转向更原生的研发:从零训练面向机器人任务的视频生成基座,并在预训练中加入大量真实机器人数据。


朱兴举例,一个矿泉水瓶在空中跳舞后落入手中,可以成为一段好看的视频;机器人却需要预测符合物理规律的动作,还要及时处理持续变化的输入,否则根本不可能生成机器人下一步动作,而这才是模型想要完成的目标。


不过,香港中文大学助理教授薛天帆对问题提出了更进一步的怀疑:即使具身智能也能从规模增长中受益,它会沿着语言模型相同的方式扩展吗?


具身智能的问题,是大家想得太简单了图6

香港中文大学助理教授薛天


过去一轮大模型的发展,很大程度上受益于互联网。文字、图片和视频可以在网上共享,也能被整理为相对统一的训练形式。机器人数据却与身体高度相关:关节数量、结构设计、传感器配置发生变化,同一个动作的表达方式也会随之改变。


薛天帆以儿童学习走路为例。孩子很难仅凭阅读或观看学会走路,他需要亲自行动,在一次次失衡和调整中形成能力。具身学习是否需要更多来自本体自身的交互经验,由此可能形成怎样的模型和数据范式,仍有大量问题需要回答。


他也承认,使用VLA、WAM等已有模型,是现阶段合理而现实的选择。这些模型已经接受过海量数据训练,能够给具身任务提供一个能力起点。但这种路径依赖能够走多远,现在还难以下结论。


上海交通大学人工智能学院副教授李永露,则把问题推进到了训练目标:模型究竟被要求学会什么?


具身智能的问题,是大家想得太简单了图7

上海交通大学人工智能学院副教授李永露


目前常见的方法,是录制专家操作轨迹,让模型模仿完成任务。但当训练目标集中在复现有限轨迹时,模型获得的能力也会受其约束。


李永露用“吃不饱”和“挑食”形容当前的具身模型:真机数据有限且昂贵,互联网上又有海量视频和图像未被充分利用。除了按任务采集轨迹,机器人或许还需要通过自由交互和代理目标,学习更广泛的物理经验。模型能否利用这些数据,与数据数量同样关键。


三位科学家的判断,也让灵波的技术选择变得清晰:吸收通用模型的知识与训练经验,同时建立面向物理世界的模型、数据和预训练能力。


沈宇军相信规模扩展仍会带来能力提升,但具身企业需要掌握从零训练大模型的能力;他特别强调,从零开发大模型与基于现有模型微调,所需能力差异很大。真正的门槛还要落到工程能力上:能否从零完成大规模预训练,能否定义机器人需要的数据,再把数据、算力和训练基础设施组织成一套有效的系统。


面对“大模型公司入场后,具身企业是否只剩一两年窗口”的追问,朱兴承认,OpenAI、Anthropic等公司拥有很强的训练技术,GPT-6也能提升具身研发部分环节的效率。但他认为,什么数据有效、怎样处理数据、出现问题后该补什么数据,仍需要在真实任务中逐步形成经验,这是具身智能企业未来的竞争关键。


通用大模型正在抬高具身智能的起点,也在压缩简单微调的生存空间。灵波希望形成的价值,正是具身原生数据、从零预训练能力,以及让模型持续感知并作用于物理世界的技术积累。


问题随后落到了今天行业最关心的数据上:不断膨胀的数据量,究竟在教会机器人什么?




数据越多,机器人不一定越聪明


如果模型能力越来越依赖数据,一个自然的直觉是:采得越多越好。但“数据不够”,正在变成一句过于笼统的共识。


在数据圆桌,三位嘉宾给出的答案并不相同。


光轮智能副总裁张建伟把“质量标准”排在数据量之前。在他看来,高质量数据至少要经过几层检验:数据本身是否完整,分布与标注是否合理,训练后能否通过评测证明模型真的提升,最终还要进入真实场景验证。


具身智能的问题,是大家想得太简单了图8

光轮智能副总裁张建伟


数据像教材,评测像考卷,只提供教材却没有考试,闭环并没有形成。仿真因此承担了一个重要角色:低成本、大规模暴露模型的能力边界,再指导定向补采;而真机部署则继续发现实验环境遗漏的Corner case。 


觅蜂科技副总裁李茂青则更强调场景和任务的多样性。他把当前瓶颈概括为“数据墙”:真实交互数据仍然稀缺且昂贵。随着Ego、Human-centric等无本体采集方案逐渐成熟,采集设备正在铺开,下一步更重要的是让这些设备进入足够多的真实场景。


具身智能的问题,是大家想得太简单了图9

觅蜂科技副总裁李茂青


对李茂青而言,“高质量”也不存在唯一标准:高精度数据可以服务模仿学习,语义和场景更丰富的数据可以帮助学习世界表征,不同数据需要分级使用。相比单一追求精度,他更看重多模态、高保真和时空统一,以及能否覆盖更丰富的任务分布。


蚂蚁灵波首席数据科学家黄用韬关注的则是另一半飞轮:今天真正进入生产和服务场景的机器人还太少,大量数据依然来自定制采集,缺少部署后的持续反馈。也因此,他认为数据飞轮真正转起来的标志,是行业开始“做减法”——不再只问还能采多少,而开始知道哪些数据没有价值、哪些应该被删掉。 


具身智能的问题,是大家想得太简单了图10

蚂蚁灵波首席数据科学家黄用韬


三种判断指向了同一个变化:数据的竞争点远非粗糙的小时数,而是收集有用的数据。


这也意味着,什么是高质量数据,很难脱离模型单独定义。


朱兴介绍,灵波会先由模型训练反向确定需要什么数据,包括场景、任务与分布;对于采集难度较高的数据,先小规模试采形成SOP,再交给供应商扩大规模。过去一年多,灵波称已将原始数据进入模型训练的可用率从约15%提高到90%以上。


在这套逻辑中,数据只是一种原料,真正决定模型能力的,是企业如何选择、组合和处理这些数据。同一批数据进入不同模型,也可能产生完全不同的结果。


更大的问题在于,今天机器人还没有真正形成持续的数据来源。


朱兴把当前阶段形容为靠数采“强制喂”,而理想中的数据飞轮,应当来自机器人进入真实工作以后不断回流的异常与失败。理论上,每个人每天的工作和生活都在产生物理世界的数据,只是今天的机器人还没有能力充分利用。


按照蚂蚁灵波的逻辑,数据飞轮真正的起点,最终还要回到机器人开始工作。这也把问题推向了下一步:机器人究竟要到什么时候,才能真正走进去干活?




机器人,该去“打童工”了


如果真实场景才能产生真正有价值的数据,具身智能就会遇到一个有些矛盾的问题:机器人能力还不成熟,到底应该继续留在实验室训练,还是先进入场景?


第三场CEO圆桌上,朱兴给出的答案很直接:“哪怕还在童年,也该干活了。”


这句话背后,其实是具身智能正在发生的一次重心变化。


过去很长一段时间,行业习惯先把模型训练得更强,再寻找可以落地的任务。但行业显然慢慢接受一个现实:机器人需要先工作,失败和异常才有机会变成下一轮训练的数据。


真正的问题随即变成:今天的机器人,究竟能干什么活?


朱兴给出了两个条件。首先是能力,现阶段适合落地的环境不能过于开放,任务也不能太长,否则异常情况快速增加;其次是成本,即便技术能够完成任务,如果创造的价值覆盖不了机器人和部署成本,商业模式依然无法持续。


这也解释了为什么率先落地的任务,可能并不“性感”。


乐聚机器人CEO常琳介绍,目前机器人真正做得相对成熟的,仍集中在工厂中的拿取、放置等任务。例如汽车零部件小件上料、生产物流中的纸箱拆垛,任务本身并不复杂,但已经能够在真实生产中解决部分用工和柔性需求。


具身智能的问题,是大家想得太简单了图11

乐聚机器人CEO常琳


地瓜机器人CEO王丛对此更谨慎。他认为,今天的泛化更多发生在单场景、单任务甚至单一末端内部,跨任务能力仍然有限。这样的方案已经能够创造价值,但很多时候仍像上一代专机的升级版,距离真正跨任务的通用能力还有明显距离。


具身智能的问题,是大家想得太简单了图12

地瓜机器人CEO王丛


商业化也给出了另一套更现实的评价标准。


大晓机器人董事长王晓刚希望看到的,是机器人能够在单一场景形成数千台规模,并且客户真正算得过账、达到盈亏平衡。顾捷则从医疗和养老场景提出,最终用户并不关心任务由大模型还是传统程序完成,他们更在意疗效、安全性和投入产出。 


灵波自己的场景选择也沿着类似逻辑展开。在外滩大会展示的药房场景中,机器人已经进入真实零售药房门店分担夜间分拣;相比做一个更炫目的Demo,朱兴更看重真实应用,能否持续暴露模型不足,并产生可以回流的数据。


对模型公司而言,商业化因此也是一次更残酷的测试:客户不会因为技术路线先进而容忍失败,真实场景会把成功率、异常处理、部署成本和硬件稳定性一起摆到桌面上。


而这场测试,也很难由模型公司独自完成。


朱兴认为,机器人本身仍是一个高度非标的产品,从本体、模型、后训练到集成交付和后期维护,需要不同企业共同完成。灵波给自己的定位,是把主要精力放在基座模型与工具链上,同时与本体厂商、数据服务商和场景方共同完成后训练与落地,让真实场景中的异常数据能够持续回流。


产业的协同进化,这是第三场圆桌反复出现的另一个共识。


王晓刚将具身智能归纳为硬件、模型、数据和场景四个要素,任何一环单独推进,都很难形成足够快的研发闭环。


具身智能的问题,是大家想得太简单了图13

大晓机器人董事长王晓刚


对今天的具身智能而言,产业协同的价值,最终要用落地效率来证明。


朱兴称,他希望一年后看到两个变化:真正由模型驱动、在工业和物流等场景工作的机器人数量显著增加;同一真实任务所需的后训练成本,尤其数据成本,能够大幅下降。


从这个角度来看,具身智能或许不存在一个戏剧性的ChatGPT时刻。它更可能发生在某个普通的仓库、药房或工厂:机器人第一次开始长期工作,而每一次失败,都不再只是一次失败,而成为下一版模型的训练材料。


到那时,机器人开始创造的不仅是生产力,也开始创造更先进的自己。




结语


回头看三场讨论,一个越来越清晰的事实是:具身智能正在告别那些过于简单的答案。


更大的模型,并不会自动解决机器人面对的物理世界;更多的数据,也不会自然转化为更强的能力;一次成功的Demo,更无法证明机器人能够干活。


真正困难的部分,恰恰藏在这些答案之后:模型如何理解连续变化的世界,企业如何知道下一条数据该采什么,机器人又如何在真实场景里持续工作、暴露问题,再把失败重新变成学习材料。


过去一年,具身智能获得了前所未有的资本、人才与关注,也迎来了前所未有严格的审视。


行业依然需要新的模型、新的技术路线和新的故事,但真正决定初创企业们生死的,恐怕是那些困难、细碎,甚至有些“脏”的工作:一遍遍收集高质量数据,一次次在真实场景中,把每一个异常与失败逐个解决。


伟大的产业,往往就在这些不够耀眼的工作中慢慢长出来。


具身智能也一样。真正的时代拐点,或许会发生在某个普通的一天:一台机器人通上电,进入真实世界,自主面对变化、失败和意外,最终安然工作到天黑。


然后,我们就可以说:具身智能的时代,真的来了。



END


具身智能的问题,是大家想得太简单了图14


具身智能的问题,是大家想得太简单了图15
活动推荐
具身智能的问题,是大家想得太简单了图16
往期推荐:








具身智能的问题,是大家想得太简单了图17
了解具体商务合作详情

关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。
more
Anthropic CEO: 前沿 AI 必须「设速」|马斯克喊对,奥特曼跟进
硅谷AI巨头集体“急刹车”:从智能体越狱到全球减速博弈
OpenAI明确2026年不上市,奥特曼强调安全重于资本节奏
AI越普及,这2个特质越值钱!Canva首席人事官亲口爆料
一文看懂 AIDC 产业链:从算力芯片到液冷系统
OpenAI CEO 萨姆·阿尔特曼确认:今年不上市,2026年亦非目标
造物 100 #06|自动驾驶「上」轮椅了,口袋相机学会飞行,AI 教练上了雪场
AI真的跑太快?刚刚,Dario最新长文喊话AI限速,OpenAI今年也不IPO了
15999元!绿联发布旗舰AI NAS,AI Agent等来「新家」
Anthropic CEO 呼吁“踩刹车”:引入第三方驻场审计,试图在AI狂飙中重建信任
Copyright © 2025-成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号