允中 发自 凹非寺
量子位 | 公众号 QbitAI
一家正在营业的超市里,一台轮式机器人正沿着货架缓慢移动。
它要躲开顾客和购物车,核对电子价签和商品价格,还得调整摄像头角度,看清被前排商品挡住的库存。到了补货环节,机械臂要伸进只有三四十厘米高的货架层,把软塌塌的膨化食品袋抓起来,再整齐放回排面。
每一个动作,以及识别精度、运行安全和设备成本,都直接影响零售商的经营结果。
ROI回报,是具身智能走进真实门店绕不开的一步。

现在,两家公司——汉朔科技与X-Era Lab(拓元智慧)——正在共同把这些能力带进真实门店。
汉朔科技是零售数字化的老玩家。公开资料显示,汉朔科技服务全球超过550家零售客户,产品覆盖80多个国家,铺进了将近7万家门店。
这些门店的货架上布满电子价签,每张价签都实时连接着商品,价格和货位信息,相当于提前为机器人铺好了一套可读取的物理坐标系。
后者是一家深圳公司,专注自研世界动作模型,打造具身智能软硬一体方案,面向零售、人居、制造等场景落地智能机器人。
它基于4D时空表征的原生世界动作模型VWA,让机器人能够理解遮挡、光照变化和商品状态,预测环境变化并完成动作。
一家出场景,一家出大脑,两家企业共同面对的命题是:
当顶尖AI模型接入覆盖全球门店的真实场景网络,具身智能能否摆脱一次性演示Demo,转化为可在货架间持续稳定运行的生产级系统?
具身智能如何在全球零售门店货架跑通商业闭环?
汉朔科技内部近几年一直在押注Physical AI。
Physical AI指的是一整套让AI能够读到物理世界、也能改变物理世界的基础设施。机器人,则是其中最新、也最难的一环。
作为泛零售数字化领域的头部企业,汉朔科技服务了全球超过550家零售客户,签约了接近四成的全球零售百强客户,其产品覆盖了全球80多个国家,将近7万家真实门店。
基于这样庞大的业务底盘和对零售场景的深度理解,汉朔将零售门店里的具身智能需求收敛成三件事:
巡检
盘点
补货
目前,汉朔的巡检机器人已经进入国内和海外商场开始POC测试。

△汉朔巡检机器人
在当下具身智能的讨论中,主流落地场景主要集中在两极。
一极是工厂(高度结构化,传统自动化已解决大半),另一极是家庭(完全非结构化,泛化能力要求极高,距离商业化还有很长的路要走)。
恰好介于二者之间的零售门店,其实是一块被严重低估的具身智能“试金石”。
零售行业最核心的痛点在于盘点频率存在天然瓶颈。
大型零售门店的全店盘点,只能安排在闭店时段,也就是夜间或周末凌晨开展。因为营业期间顾客、商品持续变动,盘点数据会严重失真。
这种高度依赖人力的模式,导致多数零售商一年仅能完成一到两次全店盘点。
行业数据显示,账实不符是零售业普遍难题;倘若盘点频次能够提升,库存实时性与货损管控水平都将得到显著改善。
若巡检机器人可以按区域排班,在门店营业时段稳定完成巡检与盘点工作,把盘点频次提升至周度甚至每日级别,这将为整个供应链管理带来质的飞跃。
用电子价签构建“物理世界坐标系”
作为全球零售数字化领域的头部企业、全球第二大电子价签供应商,汉朔已在近7万家门店搭建起电子价签网络,建成深入货架、打通SKU与物理货位的数字化底座。
在此基础上,汉朔进一步搭建门店数字孪生系统,把商品、货架、设备、库存和门店运营状态映射至统一的数字空间。
这意味着当AI与机器人进入门店时,无需单纯依靠视觉从零感知环境,可以调用持续更新的商品与空间先验信息。
这套由“真实门店网络+数字孪生+智能终端”组成的基础设施,构成了汉朔布局具身智能乃至Physical AI领域难以复制的场景壁垒。
而电子价签本身就是附着在每一个货架点位、可实时更新的结构化商品元数据载体。
货架点位应该陈列哪个SKU、对应售价,都能与ERP系统实时同步。
基于这一底层能力,机器人将获得三大差异化优势:
第一,端侧算力压力显著下降。
价签预先告知货位预期商品,模型仅需做闭集确认,端侧小模型即可胜任,减少云端算力开销与延迟。
第二,原生货架语义坐标。
无需机器人用SLAM重建地图并人工标注;海量价签节点,可直接提供门店空间与商品分布信息。
第三,本地计算满足合规要求。
在欧洲等合规监管格外严格的区域,依托价签先验信息+端侧小模型实现本地数据处理,将合规约束转化为技术优势。
为真实货架而生的原生世界动作模型
要为这套庞大的物理门店网络搭载智能“大脑”,汉朔选择与深耕零售场景的AI团队X-Era Lab(拓元智慧)达成合作。
X-Era Lab(拓元智慧)聚焦具身智能与世界动作模型研发,目标打造下一代智能机器人基础设施;团队由中山大学人机物智能融合(HCP)实验室与鹏城国家实验室联合孵化。
核心创始团队包含王广润博士、王可泽博士、蒲韬博士等顶尖青年科研人才,成员兼具牛津大学、香港理工大学、UCLA以及华为等机构的科研与产业落地经验。
团队原创并落地原生世界动作模型(VWA),在基于4D时空表征的模型架构内统一完成环境世界理解与机器人动作生成。
仅使用10亿参数,VWA就在十余项权威评测中取得领先,性能超越多款数十亿参数的主流模型,该技术路线也获得Google DeepMind、NVIDIA等团队的认可。
科研层面,团队累计发表顶会、顶刊论文500余篇,总引用量超10万次,九次斩获国际顶会最佳论文奖,三位核心成员入选全球前0.05%顶尖科学家榜单。
产业化层面,X-Era Lab组建了来自腾讯、华为的全栈工程团队,搭建日均服务500万次调用的世界模型MaaS平台;同时搭建真实交互视频数据管线,每日可生产约2万小时毫米级4D训练数据。
团队把百亿参数模型的能力压缩至10亿–30亿参数区间,能够在32 TOPS算力的硬件上完成端侧部署;还与星宸科技联合研发面向世界模型的专用芯片,将模型推理时延压缩至毫秒级别。
除此之外,团队开源了全球首个具身智能操作系统PhyAgentOS,以此持续推动具身智能机器人走向规模化落地。
正如X-Era Lab CTO陈添水博士所言,零售赛道很难靠概念讲故事,场景细节高度细碎,仅盘点一项任务就可以拆解成多个评价等级,技术能力很容易被实际业务证伪。
汉朔机器人产品线总经理童亮认为,零售卖场是典型的半结构化场景:货架布局、基础作业规则相对固定,但同时存在商品变动、顾客走动等人流干扰这类动态变量。这类真实场景数据恰好适合训练具身机器人,能够规避实验室仿真数据泛化能力弱、开放环境变量过载的短板。机器人在真实门店执行理货、盘点任务的过程中采集数据,并且同步接受业务指标校验,能够有效降低落地试错成本。因此真正愿意沉下心深耕这个方向的团队,并不多。

△AI生成场景图
场景底座+世界模型,驱动零售具身智能持续迭代
具身智能走向产业落地,胜负手或许并不只在于模型本身的能力。尤其是当前模型能力正快速走向商品化,仅依靠参数规模很难长期形成代际差距。
真正稀缺的资产,是来自物理世界的现场知识,如门店内实时发生的变化、每个货架点位应陈列的商品、通道宽度与层高,以及哪些商品容易出现遮挡、形变或被顾客临时挪动。
这类信息是汉朔科技十四年深耕全球零售场景逐步积累而来,无法仅凭算力与模型训练凭空生成。
汉朔所沉淀的正是零售领域Physical AI落地所稀缺的底层基础——真实门店场景、商品与货架数据,以及持续搭建的门店数字孪生能力。
依托电子价签、IoT网络与智能终端,门店里的商品、货架、设备和运营状态能够持续映射至数字空间,为AI理解物理环境提供可读取、可动态更新的场景底座。
但拥有场景底座并不代表机器人就能自主完成作业,汉朔还提供了一套可供机器解析的物理坐标系,它让模型能够识别点位现状、预期标准以及现场变化,为任务理解与执行提供先验信息。
在此基础上,汉朔与X-Era Lab需要共同解决的核心问题,是让模型在这套坐标系下理解空间、预判环境变化并输出可行动作。
X-Era Lab原生世界动作模型VWA借助4D时空表征,打通环境理解、行为预测与机器人控制,使价签、货架、商品以及人员动态不再是孤立数据,而是模型可以理解并据此执行任务的世界状态。
更关键的是,这套方案并非简单将通用大模型直接部署到商超环境,而是让模型在真实业务任务中持续校准。
每一次巡检、盘点,甚至识别、操作中出现的失误,都可以转化为模型迭代的反馈信号。
依托汉朔覆盖全球的门店场景网络、商品货架数据与数字孪生底座,双方能够持续沉淀真实业务里的识别、盘点、操作反馈,形成可验证、可复用的模型与场景能力,并在真实门店环境中持续迭代优化。
让智能走进真实物理场景,依托真实场景持续迭代智能。
只有将高性能AI模型接入承载海量真实场景与商业数据的网络,具身智能才有望脱离一次性演示Demo,演进为一套可持续运行、持续迭代,且具备商业可行性的生产系统。
*本文系量子位获授权刊载,观点仅为原作者所有。
一键三连「点赞」「转发」「小心心」
欢迎在评论区留下你的想法!
— 完 —
🌟 点亮星标 🌟