
看近两年的机器人演示,物理 AI 似乎已经越过临界点。
视觉语言动作模型可以把图像和指令转成动作,世界模型可以在仿真环境中生成训练数据,人形机器人也开始完成分拣、搬运和多步骤操作。但从一次成功的演示走到每天稳定工作八小时,中间仍隔着一条很宽的工程鸿沟。
Arm 在 2026 年 9 月的 Arm Everywhere China推出的是 Arm Total Design for Physical AI,并联合超过 80 家企业发起机器人能力分级框架,点中了行业的真实难题。
机器人现在最缺的,是把模型、软件、计算、传感器和执行器装进同一套可靠系统的方法。会做动作的样机已经不少了。
Arm 将物理 AI 描述为让机器感知、推理并行动的完整系统,大模型在屏幕上给出错误答案,用户可以追问或重试;机器人在真实空间里做出错误动作,可能撞坏设备、停掉产线,甚至伤人。
智能一旦获得质量、速度和力量,模型的概率性输出就必须受到实时控制、安全边界和责任机制的约束。
物理 AI 的难点是把概率智能接入确定世界
一台复杂机器人同时运行多种节奏完全不同的任务。
摄像头和激光雷达持续产生数据,感知模型识别环境,规划模块决定下一步,电机控制环以更短周期调整关节,安全模块还要随时拥有更高优先级。
AI 推理追求吞吐量,运动控制要求确定的响应时间,安全任务要求隔离,整机又受到电池、散热、内存带宽和成本约束。
这也是物理 AI 与云端生成式 AI 的关键差别。云端应用可以把更多计算交给数据中心,也可以容忍一定网络波动;运动中的机器不能把所有决策都交给远端。
刹车、避障、平衡和抓取必须在本地闭环完成,部分高层规划可以在边缘或云端运行。每增加一个更大的模型,系统设计者都要重新回答模型放在哪里、数据怎样移动、哪些任务必须抢占资源,以及 AI 失效时由谁接管。
因此,模型分数高低,和机器人能力强弱有差异。
Google DeepMind 的 Gemini Robotics 2 已经展示视觉语言动作模型对不同形态机器人和全身控制的适配,英伟达的 Isaac GR00T 则把数据管线、基础模型、Omniverse 与 Cosmos 仿真、中间件和 Jetson Thor 组合成参考平台。
模型和仿真正在快速进步,但它们仍要进入一个由实时系统、传感器、控制器与安全软件共同构成的机器。产业的竞争边界已经从单一模型扩展到整套系统。
汽车是机器人的工程起点
Arm 在沟通会上多次把汽车和机器人放在一起讨论,都要处理来自摄像头、雷达或激光雷达的实时数据,都需要感知、规划、控制和安全能力。
Arm 物理 AI 业务拓展副总裁 Dermot O'Driscoll 还提到,目前专门面向机器人的芯片仍然有限,许多机器人企业实际采用的是现有汽车芯片方案。
这种复用,复用的是工程方法。机器人要进入工厂、仓库乃至家庭,面对的物体、任务和人比汽车复杂,把它看成装了机械臂的汽车会漏掉关键差别。
汽车的运行空间和责任边界相对清晰,机器人可能进入工厂、仓库乃至家庭,接触的物体、任务和人更复杂。
一个机器人可以在固定工位高度自动化,却在换到另一条产线后失去能力。它既需要汽车产业积累的实时计算和功能安全,也需要更灵活的动作、交互与环境泛化。
汽车产业提供一套经过长期量产打磨的工程方法。芯片要满足功能安全与确定性要求,软件要经历长期验证,供应商要围绕明确接口协作,整车厂还要管理多年生命周期。
机器人若想从项目制交付进入平台化复制,就必须建立类似的开发纪律。
汽车计算平台可以成为机器人专用芯片成熟前的起点,而机器人市场扩大后会催生更多定制芯片。
Arm 争夺的是物理 AI 的共同底座
从这个角度看,Arm 选择的是更符合自身商业模式的位置,发布会没有亮出机器人芯片新品。Arm 不生产整机,也不需要判断哪一家人形机器人最终胜出。
它希望自己的指令集、处理器 IP、计算子系统和软件生态成为不同形态机器可以复用的底座。只要物理 AI 的计算需求持续增长,平台层就能分享行业扩张。
Arm Total Design for Physical AI 是把模型、软件栈、传感器、芯片、虚拟平台、数字孪生、Tier 1 和整机厂拉进更早的协作阶段,重点在伙伴之间的协作方式,把原本串行的开发变成并行。
软件团队不必等实体芯片和样机全部就绪,便可借助虚拟原型移植、测试和验证。
Arm 以汽车数字座舱参考方案为例,说明开发者可以在 Arm Zena CSS 实体芯片完成之前启动软件工作。
这套方法解决的是机器人公司反复集成和重新验证的成本。
今天不少机器人项目仍像系统集成工程,每换一颗芯片、一个传感器或一版模型,都可能触发新的性能调优和安全测试。若计算平台、接口与开发环境能够稳定下来,企业才有机会把一次性交付变成可复制产品。
Arm 走的是和英伟达不同的路线。
◎ 英伟达围绕 GPU、Jetson、CUDA、仿真和机器人模型构建更纵向的一体化栈;
◎ Arm 更接近横向的架构提供者,通过广泛授权和伙伴网络进入多种芯片及终端。
前者强调完整工具链带来的开发效率,后者强调选择空间、功耗覆盖和生态复用。
未来的物理 AI 很可能同时需要两者。加速器负责高吞吐 AI 推理,CPU 和实时系统负责协调传感、调度、通信、控制与安全。
能力分级可能影响采购 但离行业标准还有距离
Arm 提出从 RL0 到 RL5 的六级机器人能力框架,从反应式系统逐步走向具备上下文理解、认知和自我改进能力的机器。
它借鉴了 SAE 驾驶自动化分级的思路,希望把机器人行为和时延、计算位置、内存、功耗、确定性与安全要求连接起来。
共同语言的价值不只在传播。
研发团队可以据此拆解系统需求,芯片和软件供应商可以据此定义接口,客户可以更准确地采购,保险机构和监管者也更容易讨论风险。
如果一个能力等级最终能对应可测试的运行边界、成功率和安全要求,它就可能影响一部分产业利润的分配,因为定义需求的一方往往更接近平台入口。
机器人也比汽车更难压缩成一个数字。
仓库搬运、家庭整理、矿区巡检和手术辅助的任务边界完全不同;同一台机器在熟悉工位与开放环境中的自主程度可能相差很大。
一个成熟框架至少要说明适用场景、人工接管率、异常恢复、技能迁移、任务成功率和安全证据,还需要第三方测试或认证机制。否则 RL 标签也可能沦为新的营销词。
Arm目标是推动协作,把制定规则的事交给行业伙伴,框架能不能成为共同语言,看的是整机厂、零部件商、客户和标准组织是否愿意用同一套指标设计、验收和追责,决定权在这些伙伴手里。
中国的优势在真实部署形成的数据闭环
国际机器人联合会数据显示,2024 年全球新安装工业机器人 54.2 万台,其中中国安装 29.5 万台,占全球 54%;中国工业机器人保有量已经超过 200 万台。
庞大的制造业、密集的供应链和快速迭代能力,为机器人提供了最稀缺的资源,也就是长期、重复、可计量的真实任务。
机器人在真实工位运行,企业才能发现模型在长尾场景中的失效方式,测出执行器寿命、维护成本和人工接管频率,再把这些数据反馈到模型、软件和硬件设计。
部署越多,反馈越快;反馈越快,单位任务成本才可能持续下降。中国企业的潜在优势,正是把制造现场转化为工程反馈回路。
但快速迭代也会放大碎片化。
如果每家企业都维护自己的硬件接口、软件栈和能力口径,研发资源会大量消耗在重复适配上,客户也难以比较产品。Arm 希望用统一架构、虚拟开发和能力语言降低这些摩擦。
对中国伙伴而言,加入全球生态的价值不只是曝光,也包括让本地方案更容易进入海外供应链和验证体系。能否实现这一点,仍要看后续是否出现可复用的参考设计、公开测试方法和量产案例。
物理 AI 的早期叙事由模型突破和人形外观推动,下一阶段会由交付指标重新定义。
客户最终购买的是一项能持续完成任务的生产能力,会思考的模型只是这套能力的一部分,机器一天可以工作多久,需要多少次人工接管,发生异常后多久恢复,每完成一次搬运或分拣要花多少钱。
分水岭在机器人能否于明确边界内把同一个动作可靠地完成十万次。