
热热热热热!今年 WAIC 现场,大家对 AI 的热情,像上海的气温一样持续攀升。
去年逛 WAIC,机器人就已经很忙了。它们在展馆里写书法、舞龙、击鼓、打拳、踢球,也会调酒、按摩、拆快递、叠衣服,或是从货架上取下指定商品。
到了今年,机器人又解锁了一批新节目:组乐队、变魔术,在擂台中上演双机综合格斗,在迷你球场上争夺「WAIC 杯」。另外,一张张仿生面孔能够眨眼、微笑、转头,还能与观众实时对话——走上一圈,甚至还能和「秦始皇」打个照面。

逛完整个会场,可以看到,不同的机器人产品也正在沿着各自的方向加速生长:有的继续挑战奔跑、跳跃、格斗等高难度动作,不断抬高本体性能的上限;有的通过外形、情绪反馈和长期互动,寻找进入家庭的可能;还有更多机器人走向产线、仓库和商店,接受速度、精度、稳定性与连续作业能力的真实检验。
这也让今年的 WAIC 呈现出一个明显的变化:大家更关注机器人究竟能解决什么问题。对消费级产品来说,可能是足够有趣,让人愿意把它带回家;对产业机器人来说,则要足够有用,能够适应复杂环境,把任务稳定、高效、持续地完成。
梅卡曼德展台上的机器人们也忙得热火朝天,现场人气拉满。
展台一侧,人形机器人接到观众下达的订单,转身走向货架,在一排饮料、零食和玩偶中找到目标,再把手伸进有限的空间里,稳稳取出商品。
另一边,两台人形机器人正在协同作业,配合完成工件上下料、装配和料筐搬运等任务。
再往里走,画风切换到工业现场。机械臂从一筐无序堆叠的五角螺母中快速选中目标,单件时间小于 2.4 秒;塑料包装、柔性线束插头和透明瓶体,也在考验机器人的感知与操作能力。另一张台面上,数百种日常物品随机散落,等着人形机器人识别和分类。

看起来,大家各有各的活。
围着展台看一圈,能发现它们背后都连着同一套能力——梅卡曼德具身智能「眼脑手」。
高精度 3D 视觉负责看清物体和环境;以 Mech-GPT 多模态大模型为核心的具身大脑负责理解指令、推理和规划;世界动作模型用于预判不同动作方案的结果,运动规划与灵巧操作能力再把方案转化为抓取、搬运、分类和装配等现实动作。
现场的一块互动屏幕,直接展示了具身大脑怎样工作。观众可以通过自然语言向 Mech-GPT 下达任务指令,系统理解指令和任务意图,结合眼前的物体与环境进行推理和决策,再控制机器人拿取指定物体。
作为这套体系中负责执行操作的「手」,梅卡曼德新一代多指灵巧手也在此次 WAIC 首次公开亮相。官方资料显示,其动作寿命超过百万次,兼顾灵活性、响应速度和工业级耐用性,可完成复杂物体操作与精密装配。
从理解任务到完成动作,系统还要根据执行结果持续调整,最终形成「感知—决策—规划—执行—反馈」的闭环。
这些热闹的演示,也在回应具身智能行业眼下最关心的两个问题:
机器人换一种身体、换一种物体、换一个现场后,原有能力还能留下多少?
当机器人真正走进工厂、仓库和商店,它能不能做得足够快、足够准,并持续进入更多行业和地区?
先别只看机器人长什么样
人形机器人依然是 WAIC 现场的人气选手。
类人的身体结构,让它更容易进入按照人类尺度设计的环境,接近现有货架、工作台和工具。观众也能迅速读懂它伸手、转身、搬运等动作。
但把视线从单台机器人移开,具身智能面对的本体远不止人形机器人,还包括工业机械臂、双臂轮式机器人、半身人形机器人等多种形态。它们面向不同的工作空间、负载和效率要求,很难用一种身体包办所有任务。
工业生产线通常关注速度、精度和长时间稳定运行;物流场景需要考虑移动范围和负载;商超货架空间有限,商品又软硬不一,对环境感知和精细操作提出了另一套要求。
机器人进入哪个场景,往往就会长成更适合那个场景的样子。
梅卡曼德提出「智能大于形态」,关注点随之落到机器人真正干活时调用的底层能力上。
无论机器人采用怎样的本体结构,真正开始工作后,它们都要完成几件相似的事:看清环境,理解任务,判断下一步做什么,规划移动和操作方式,再驱动机械臂、夹具或灵巧手完成动作。
在展台上,无论是双人形机器人协同作业、货架取货,还是高速小零件上料,本体形态和目标物虽然不同,但都要调用环境感知、任务理解、动作规划与执行控制等底层能力。
这就是梅卡曼德提出的「一脑多形」:身体根据场景变化,以通用具身大脑为核心的「眼脑手」体系,则通过标准化组件适配不同机器人本体。
沿着动线走一圈,就能看到同一组智能能力怎样装进不同的身体里。
换了身体还不够,
换个现场也不能从头开始
适配不同机器人本体,只完成了第一步。真正进入物理世界后,机器人还要面对源源不断的变化。物品可能换包装、换材质,摆放姿态没有固定规律;货架深度和隔层结构各不相同;一句任务指令,也可能临时增加新的条件和分类规则。
在海量物体分拣单元中,数百种食品、日用品、文具、玩具和工具被随机摆放。人形机器人首先要从海量真实物体中识别出不同物品、理解它们所属的类别,再按照自然语言指令完成分类;当盒子标签被临时更新后,还要理解新的分类规则并继续分拣。

这里考验的并不只是能否理解一条分类指令,还包括能否泛化识别海量真实物体,并把自然语言、物体类别和场景标签转化为可执行的分拣策略。
机器人面对的变化,还包括一些更难感知的物体。
透明物体泛化抓取单元里,目标换成了透明瓶体、透明或半透明包装等物品。玻璃和透明塑料在商超、医疗、实验室和日常生活中十分常见,但透明材质容易给视觉成像和目标定位带来困难。
通过透明物体 AI 成像与泛化抓取算法,机器人要识别高度透明的物体,判断位置和姿态,并生成抓取方案。适用对象还包括盐水袋、透明试管、喷雾瓶和水瓶等形状、包装和透明程度各不相同的物品。
货架取货单元又加入了空间结构的变化。
观众完成下单后,人形机器人 Mech-Movix 自主移动至货架前。现场模拟了真实商超环境,货架和货柜类型多样,商品的摆放方式也并不固定,商品包括饮料、零食和玩偶等不同类型。
机器人首先需要理解订单,确认需要拿取的商品;到达货架后,通过 3D 视觉感知货架结构、商品位置和周围空间;具身大脑进一步规划取货路径与操作方式,再由灵巧手伸入有限的货架空间,完成精细操作和稳定拿取。
一袋柔软的零食、一个玩偶和一瓶饮料,对手部姿态和抓取方式的要求并不相同。货架隔层、商品朝向和周围障碍发生变化,机器人的操作路径也要跟着调整。
三个单元把任务、物体和环境的变化摆到机器人面前。海量物体分拣既考验机器人对海量真实物体的泛化识别能力,也考验其对新指令和分类规则的理解;透明物体抓取考验复杂材质下的感知与操作;货架取货则要求系统在有限空间中完成环境理解、路径规划和精细动作。
这些变化共同指向具身智能中的泛化:换一个物体、换一种摆法、换一句指令,已有能力还能不能继续工作。
机器人进入新现场时,需要重新开发的部分越少,通用能力才越有机会转化为部署效率。
从会做到能用,
还隔着工业硬指标
WAIC 展台上,机器人的每次演示,都可能引来一圈观众举起手机。进入工厂后,围观的人少了,节拍表却会一直盯着它。
高速小零件无序上料单元中,一筐五角螺母尺寸小、姿态随机,彼此堆叠和遮挡。机器人需要从杂乱料筐中识别每一个零件,判断哪些目标当前适合抓取,再自主规划抓取姿态和运动路径。
选定目标之后,系统还要控制机械臂准确到达抓取位置,稳定取出零件,并放到指定位置。整个流程包括视觉感知、目标选择、抓取规划、运动执行和放置,单件时间小于 2.4 秒。
现场看到的是五角螺母,实际应用中还会涉及螺栓、螺钉、金属圆环等不同工业零件。工件尺寸、形状和堆叠状态发生变化,机器人仍要在高节拍下持续工作。
梅卡曼德表示,这类应用已经在汽车零部件、工程机械、家电和新能源等行业批量部署。
另一处单元把目标换成了多规格超薄钣金件。工件极薄、结构精密,系统既要完成精准定位和稳定抓取,还要针对不同规格调整操作方式,在满足效率要求的同时,实现亚毫米级装配精度。

线束插头柔性抓取与精密装配单元,考验的是另一套功夫。线束属于柔性物料。它在料框中的形态不固定,被机器人抓起后还会继续下垂、弯曲和变形。插头插接又要求机器人准确对位,并控制接触过程中的力度。
位置出现偏差,插头可能无法顺利进入;施力过大,也可能损伤元器件。
演示过程中,机器人需要完成线束抓取、插头对位和柔顺插接。高精度视觉持续提供位置数据,自适应运动控制则处理线束形变、对位偏差和接触力度等细微变化。
整套任务最终实现亚毫米级精准柔顺插接。相比一次抓取,这是一段更长的自动化闭环。前一步的执行结果会直接影响后一步,机器人需要在任务进行过程中持续感知和调整,直到完成插接。
据梅卡曼德透露,这套高精度柔性装配方案已在汽车电子、3C 电子、半导体和家电等精密制造行业实现批量复制与规模化应用。
开放场景和工业现场由此给出了两张不同的考卷。商超等环境中,商品、货架和指令持续变化,机器人需要处理物体泛化、空间适应和任务理解;工业现场则把这些能力放进明确的硬指标中,要求系统达到生产所需的速度、精度、稳定性和连续运行能力。两类场景共同检验「眼脑手」能否形成完整、可用的能力闭环。
展台上的演示,也因此多了两种观看方式。既可以看机器人会不会做,也可以看它能否在工业指标和环境变化中持续完成任务。
27000+ 套产品,
标准化要经过多少种现场检验
展台上的一次演示,大多在几分钟内完成。机器人进入真实工厂后,要面对的是以月和年计算的连续运行。工件批次、环境光、物料姿态、生产节奏和工艺流程都会变化,现场还会不断出现实验室中难以穷举的长尾问题。
梅卡曼德披露,其具身智能「眼脑手」相关产品已经在全球累计落地超过 27000 套,服务超过 100 家《财富》500 强客户,覆盖汽车制造、物流快递、新能源锂电、3C、半导体、钢铁、工程机械和医药等行业。公司还在美国、日本、韩国和德国等地设有子公司和团队,产品持续进入不同国家和地区的产业现场。
进入不同国家,系统接受的检验也不只来自算法。不同市场的产品认证、生产工艺、设备接口、交付流程和服务要求并不相同。梅卡曼德的产品已进入近 50 个国家和地区,并在慕尼黑、东京、芝加哥、首尔等地建设本地团队,覆盖销售、交付、培训和售后服务。对标准化产品而言,全球化意味着同一套底层技术架构要在更多产业体系中接受认证、交付、运行和服务能力的综合检验:它既要能够工作,也要能够合规交付、快速部署并被长期维护。
规模一上来,现场问题也会迅速变多。
汽车零部件可能存在金属反光、无序堆叠和规格变化;物流现场需要处理不同尺寸、材质和包装的物品;精密装配关注位置误差、接触力度和工艺节拍;重工业环境还可能伴随粉尘、高温等复杂条件。
一套标准产品要在这些条件下反复接受检验。哪些能力可以直接跨客户、跨行业复用,哪些环节可以通过配置完成适配,哪些长尾问题还需要继续优化,都会在部署过程中逐渐变清楚。
标准化也在一次次真实应用中逐渐形成:稳定、重复出现的能力被沉淀为产品组件,软硬件接口和交付方式逐步统一,一个现场积累的经验,也能被复用到下一次部署中。换一家客户、进入另一个行业时,团队可以从已有产品能力出发,处理新的工艺要求。这个过程既考验前沿技术,也考验产品量产、工程交付和全球服务能力。
规模化部署解决的是产品如何走进更多现场;要让这些现场反过来提升通用能力,还需要统一的模型底座和迭代机制。
面向物理世界的具身原生通用基座模型,用于在统一底座上沉淀不同物体、任务、本体和行业之间的共性能力。在具体项目中,则可以从已有能力出发,通过配置和适配满足差异化需求,减少进入新场景时重复开发的成本。
基座模型解决的是能力如何复用,真实场景的数据飞轮解决的则是能力如何持续变强。部署规模越大,系统遇到的反光、遮挡、形变、油污和随机堆叠等长尾问题越丰富;这些现场反馈推动模型、算法和产品迭代,能力提升后又支撑产品进入更多场景。
梅卡曼德将这一过程概括为数据飞轮:场景反馈推动 AI 模型和产品优化,产品能力提升,再支撑更多落地。
支撑这 27000+ 套产品的,是统一的「眼脑手」底层技术架构和标准化产品体系;而它们在不同国家、行业和工艺环境中的长期运行,也持续为这套体系提供现场检验。它的通用边界,正是在这些现场中被一遍遍测试和拓宽。
结语:
身体各不相同,
但智能正在走向通用
人形机器人、轮式机器人、工业机械臂和其他本体,还会继续进入各自适合的场景。工厂、仓库、商店和家庭提出的任务,也不会变得完全一致。
具身智能规模化面对的关键问题,由此逐渐清晰:当机器人换一副身体、换一种物体、换一个环境和任务时,感知、理解、决策、规划和操作能力能够保留多少。
一次演示可以呈现机器人学会了什么。大规模部署更关心的是,这些能力能否被沉淀为标准产品,进入新现场后继续使用,并在真实效率和精度要求下稳定运行。需要重新开发、重新调试和重新积累的部分不断缩小,机器人进入更多行业的速度才有机会不断加快。
今年 WAIC,梅卡曼德展示的正是这样一条路径:以一套通用的「眼脑手」能力,赋能多种机器人形态进入不同场景。
© THE END
转载请联系本公众号获得授权
投稿或寻求报道:liyazhou@jiqizhixin.com