
一、垂直整合闭环与开放标准联盟的对决
物理AI与具身智能(Embodied Intelligence)的崛起,标志着半导体需求正从单纯的“通用计算”向“感知-推理-控制闭环”演进。不同于传统数据中心,具身智能体要求芯片在处理海量多模态数据的同时,必须提供极高确定性的物理反馈。

在这种范式转移中,NVIDIA(英伟达)与AMD(超威半导体)的战略哲学呈现出根本性分化:
NVIDIA 的“资本-垂直一体化”护城河:NVIDIA不仅通过构建从DGX(训练)、Omniverse(仿真)到Jetson(执行)的闭环生态来锁定开发者,更实施了“资本即护城河”(Capital-as-a-Moat)战略。仅2026财年,NVIDIA便向具身智能初创企业注资达175亿美元,通过股权深度绑定供应链。其核心逻辑是将物理AI视为“主权AI”的基础设施,致力于构建不可替代的“AI工厂”。
AMD 的“开放自适应”同盟:AMD通过主导UALink与Ultra Ethernet Consortium(UEC)开放标准,联合博通(Broadcom)、微软(Microsoft)等巨头对抗NVIDIA的封闭系统。其战略重心在于通过x86架构的通用性与FPGA的灵活性,降低工业客户的“供应商锁定”风险,并提供更具长生命周期(15年供应承诺)的工业级可靠性。
这两种哲学直接决定了开发者的初始选型逻辑:初创企业偏好NVIDIA的“一站式”效率以缩短产品上市周期;而追求主权安全、确定性控制及供应链自主的传统工业巨头,则将AMD的开放平台视为战略避风港。
二、核心硬件架构:边缘侧“大脑”与“脊髓”的计算分化
在生物进化中,当我们试图抓取一个弹跳的球时,身体动用了双重逻辑:
“大脑”(高层决策/感知): 负责处理多模态感知(视觉、触觉、雷达)。它利用大模型进行语义理解与任务规划。这属于“非确定性”计算,追求算力吞吐量(TFLOPS)。
“脊髓”(底层控制/反馈): 负责电机伺服与传感器同步。当球触碰指尖,脊髓必须在微秒级完成指令闭环,无需经过大脑思考。这属于“硬实时”计算,追求确定性与极低抖动(Jitter)。
仅仅算得快是不够的。如果底层控制存在延迟,即便大脑算出了完美的避障路径,机器人在物理世界中仍会因“小脑萎缩”导致的指令抖动而摔倒。
具身智能的核心硬件挑战在于平衡“感知的广度”与“控制的精度”。
2.1 架构深度对比:感知霸权 vs. 确定性执行
NVIDIA Jetson AGX Thor (Blackwell 架构):该芯片集成了14核 Arm Neoverse-V3AE 企业级CPU,核心亮点在于其变精度Transformer引擎(MVFP4)。在FP4稀疏精度下,其AI算力高达2,070 TFLOPS。尽管感知算力惊人,但受限于Arm架构在极高频串行时序逻辑处理上的限制,在面对极高频轨迹重规划时,其控制回路丢帧率平均达 1.6次/秒。
AMD Ryzen AI Embedded X100 系列: 采取“脑、髓、体”一体化路线。集成了 Zen 5 CPU(多线程吞吐比竞品高1.5倍)、RDNA 3.5 GPU与 XDNA 2 NPU(50 TOPS)。其独特优势在于通过 FPGA 织物(可编程逻辑) 处理传感器物理对齐。基于x86核心的单线程高吞吐,其控制回路丢帧率仅为 0.45次/秒,且保留了82%的空闲带宽用于用户逻辑,支持 125μs 的硬实时控制循环。

下表深入对比了 NVIDIA 与 AMD 从大规模数据中心 AI 加速器到边缘机器人计算平台的核心硬件规格参数。


2.2 核心性能参数量化对比

NVIDIA凭借MVFP4引擎在多模态视觉感知(大脑)端具备绝对霸权,是人形机器人处理复杂环境的首选;而AMD在确定性伺服控制(脊髓)上的物理优势,使其在高精密工业装配与防爆、抗冲击等极端工况场景(如Foundation Robotics)中不可替代。
三、软件栈与工具链:CUDA 护城河与 ROCm 的 AI 编程革命
软件生态通过“开发者惯性”构建了最高的迁移成本。
3.1 NVIDIA:端到端的“三台计算机”重力场
NVIDIA 通过 Omniverse(物理仿真)、Isaac Sim(机器人训练)和 Project GR00T(基础模型)构建了闭环重力场。
技术路径: 侧重 “域随机化”(Domain Randomization),利用 ovphysx 库和 Cosmos世界模型 在仿真中生成海量带偏差的训练数据,以收窄 Sim-to-Real 的鸿沟。
生态锁死: 750万 CUDA 开发者的红利使得所有最新的具身大模型均优先适配 NVIDIA 架构。
3.2 AMD:AI Agent 赋能的去中心化路径
AMD 正在利用 AI 改变游戏规则,以弥补软件生态的短板:
· AMD-Anthropic 战略同盟: AMD 对 Anthropic 进行50亿美元投资,最核心的“黑天鹅”举措是:Anthropic 利用 Claude 模型重构 ROCm 的编译器链路。通过 AI 自动优化算子与指令分配,AMD 试图以指数级速度消除 CUDA 的领先优势。
· ROCm 7.x & AMD Skills: 提供了 70%-80% 的自动代码转换率(HIPIFY)。AMD Skills 允许 Claude/Cursor 等编程 Agent 原生理解 AMD 硬件架构,大幅降低了 CTO 的研发人力成本。
3.3“Sim-to-Real”迁移路径对比
软件生态的成熟度决定了计算平台的“重力场”强度。
Sim-to-Real 技术路径对比
算法路径 (NVIDIA):通过大规模并行仿真生成的海量合成数据,训练模型对物理偏差的鲁棒性。
硬件路径 (AMD):强调“硬件级物理对齐”,通过极致的确定性控制,确保机器人在现实中的动作节拍与仿真模型在数学层面完全一致。

四、合作伙伴与行业护城河:帝国体系与生态同盟
根据最新的市场分析,计算芯片厂商正通过绑定行业巨头建立深层护城河。
NVIDIA (产业灯塔阵营):在具身智能边缘“大脑”侧占据约 50% 的份额。合作伙伴包括 Figure AI、Agility Robotics 及波士顿动力。其在自动驾驶领域拥有 80% 的 OEM 份额,并通过 NVLink 专有互联(1.8 TB/s)将云端仿真与终端部署紧密锁定。
AMD (工业自适应阵营):在边缘“脊髓/关节控制”领域占据约 25-30% 的份额。其在工业自动化(SICK、ADI)、国防及极端工况机器人(Foundation Robotics)领域具有绝对优势。AMD 联合 Broadcom、Meta 等推动 UALink 开放标准,试图打破 NVIDIA 的内存墙垄断。
4.1 价值链分布
· NVIDIA (前沿标杆):深度绑定人形机器人顶流(Figure AI, Agility, Boston Dynamics)与智驾巨头(奔驰, 比亚迪)。通过 NVLink/NVSwitch 专有协议构建“芯片即系统”的垄断,适合追求极致性能的研究型实验室。
· AMD (工业硬核): 渗透至工业“脊髓”环节。合作伙伴包括感知巨头(SICK, ADI)和国防先驱 Foundation Robotics。后者的 Phantom 系列机器人利用 AMD 方案实现了“IP67防水、抗100G冲击”的物理性能,证明了 AMD 在极端工况下的鲁棒性。
4.2 标准战争:UALink vs. NVLink
NVIDIA 的护城河正在面临 Ultra Ethernet Consortium (UEC) 的挑战。AMD 联合博通、微软、Intel 推动 UALink over Ethernet,旨在消除 InfiniBand 的延迟优势,实现多厂商兼容的自由组网。
五、中国市场格局与自主化对峙
出口管制正迫使中国具身智能产业进入“底层重构”期。
5.1 竞争态势与“Volume Cap”限制
2026年出口规则引入了 “总量配额限制”(Volume Cap):TPP(总处理性能)低于21,000或带宽低于6,500 GB/s 的芯片(如合规版 H200/MI325X)虽获准出口,但数量不得超过美国本土客户销量的 50%。
份额变化: NVIDIA 在华加速器份额收缩至 47%,而 华为昇腾 (Ascend) 凭借 Atlas 950 SuperPod 系统(1 EFLOPS FP8 集群性能)斩获 35.5% 的市场。
5.2 关键厂商对比:智驾与具身智能的领军者
华为“乾崑” (ADS 3.0):依托昇腾910C/950系列,华为构建了闭环帝国。其车载MDC系统在2025年NOA市场占有率达15.2%。
地平线“征程6 (Journey 6)”:作为智驾前装市场的霸主,地平线在中国L2/L2+市场份额高达28%。其Journey 6P单芯片提供560 TOPS算力,专为端到端Transformer硬化设计。
5.3 智驾主机厂的“去中介化”威胁
蔚来、理想、小鹏等 OEM 的芯片自研风暴已成规模。理想 Mach M100 芯片通过针对 BEV/Occupancy 算法的指令硬化,实现了 82% 的硬件利用率。这种“垂直一体化”趋势正将美系巨头挤向“软件即服务”(SaaS)的转型路口。
六、战略选型策略
具身智能的下半场竞争在于“算力冗余”与“控制确定性”的合龙。
1.前沿人形机器人初创企业:建议首选 NVIDIA 路径。充分利用 Cosmos 世界模型和 Isaac Sim 仿真管线,快速突破从文本到动作的泛化算法壁垒。
2.工业重载与安全敏感型厂商:建议首选 AMD 路径。利用 Versal Gen 2 的 ASIL-D 认证、x86 高吞吐 CPU 及 FPGA 的亚微秒级时钟抖动控制,确保极端工况下的鲁棒性。
3.中国本土主机厂:建议采取 “国产+合规”双轨制。在对标国际先进 VLA 模型的同时,深度并入华为或地平线生态,并加速自研定制化算子芯片以实现 PPC 的最大化利用。

未来具身智能计算平台的胜负手,将不在于单纯的 TFLOPS 堆叠,而在于谁能通过异构架构的深度收敛,将云端的“无限仿真”完美映射到边缘侧的“绝对物理确定性”之中。


