便利店货架之间,通道狭窄,SKU数量多且摆放密集,消费者、店员一直处于移动状态。同时,补货、盘点、搬运等工作本身又具有较高重复性,尤其对于24小时营业门店,部分工作还需要在夜间持续进行。正行创新发布面向零售行业的 Physical AI 解决方案,面向“人机协作”的开放环境:客流低峰期,机器人可以接手搬运、补货、盘点、巡检等高频任务,让员工可以聚焦其他服务优化工作;夜间持续作业时,机器人接手重复性体力劳动,让员工免于熬夜劳作。该方案首先聚焦的,是货架补货、店面巡检及相关搬运任务,机器人从任务获取、环境感知、移动、识别、抓取到作业执行形成完整任务闭环,通过统一运营平台进行任务分配、状态监控和必要的人工接管。正行创新称,目前系统能够实现数百种SKU分拣任务自主完成,完成任务成功率达99%。支撑这些任务执行的,是正行创新打造的“具身大脑”,这是一套由具身模型、算法、数据与基础设施(infra)组成的物理智能系统。1、世界动作模型SLM-0.5:让机器人理解环境与行动之间的关系传统世界动作模型往往直接在像素空间预测未来画面,模型规模和推理开销都比较大。正行创新则将未来预测进一步迁移到视觉隐空间中,以更小模型完成动作预测。其推出的世界动作模型SLM-0.5,参数量为23亿,按照该公司公布的测试结果,其在LIBERO机器人操作基准上的平均任务成功率达到98.6%,单次推理时间低于187ms,相较其对比的像素级世界动作模型方案,推理速度提升超过24倍。2、强化学习STEAM:将真实任务中的经验转化为能力提升强化学习后训练主要解决的是,机器人进入真实场景后,如何根据执行结果继续调整策略。正行创新基于RLinf搭建了STEAM后训练体系,在已有基座模型的基础上,系统会将机器人执行任务时产生的成功、失败以及人工纠正等反馈重新用于训练,从而针对具体零售任务优化操作策略。以指定商品上货为例,正行创新称,通过少量任务数据和人工反馈进行后训练后,机器人执行成功率达到95%。这一过程中,新的问题与反馈被纳入后续训练,优化后的模型经验证再部署,形成“执行—反馈—学习—再部署”的闭环,推动机器人在真实任务中做得更稳、更快。3、智能体Rpent:让机器人理解、规划、统筹复杂任务的执行Rpent由正行创新与清华大学、无问芯穹联合发起,其将通用大模型的任务理解和规划能力,与VLA等操作模型,以及记忆、工具调用和机器人接口等模块结合起来,用于处理机器人在复杂任务中的任务拆解、执行调度和异常处理等。例如,面对“补齐这排货架”这一指令,机器人并不是完成一次抓取就结束,而是需要先判断哪些位置缺货,再确定商品位置、规划补货顺序,并依次调用导航、视觉识别和操作能力完成任务。在执行过程中,如果出现商品位置变化、抓取失败等情况,Rpent可以根据当前状态调整后续步骤,必要时重新规划。因此,在这套具身大脑架构中,Rpent主要负责高层任务理解和流程规划,世界动作模型等则负责具体动作执行。 02.打造多款不同形态机器人本体,涉及通用服务、搬运理货、精细操作