芝能智芯出品一辆自动驾驶汽车每秒接收多路高清摄像头、激光雷达和雷达数据。进入规划算法之前,这些原始信号要经历校正、去噪、压缩、特征提取、时间同步和多传感器融合。
这些工作数据量巨大,却与数据中心常见的大批量 AI 推理很不相同。汽车必须在极小批量下立即响应,延迟需要稳定,功耗受车辆散热和续航限制,系统还要在颠簸、高温和长期运行中保持可靠。

Waymo 因而设计了一颗 Sensor Fusion Processor。
ServeTheHome 记录显示,这颗芯片采用台积电 N5 工艺,面积约 208 平方毫米,封装为 45×45 毫米,功耗低于 75W,提供 160 TOPS INT8 或 80 TFLOPS FP16 计算能力,并集成 64MB SRAM、8MB 寄存器文件和封装内 LPDDR5X。
单看峰值性能,它不会击败高端数据中心 GPU。但它从出生起就只做一件事:把车上原始传感器数据及时变成可供驾驶系统使用的信息。

一颗芯片如何同时理解三种传感器
摄像头提供丰富颜色与纹理,却容易受黑暗、眩光和天气影响;激光雷达直接测量三维距离,点云数据稀疏;雷达对速度和恶劣天气更敏感,空间分辨率却不同。
如果每种传感器在不同芯片上独立处理,再把结果通过外部接口汇合,数据会重复搬运,也可能增加延迟和同步误差。Waymo 的芯片把摄像头 ISP、视频编解码、MIPI 接口,以及面向激光雷达和雷达的专用处理,与 carTPU 推理单元放在一起。
传感器数据进入芯片后,可以先完成时间去噪、格式处理与特征提取,再在片上运行稀疏卷积、稠密 Transformer 等模型。64MB SRAM 与巨大的寄存器文件用于把关键中间数据留在芯片内,减少外部内存访问。
Waymo 官方称,其最新系统中的多颗自研 ASIC 合计可提供超过 1000 TOPS 的前端机器学习能力,并实时处理 13 路高分辨率摄像头。这里需要区分"单颗芯片规格"和"整车多芯片系统",不能把两组数字直接混为一谈。

自动驾驶为何偏爱低批量和确定性
云端推理可以积累一批用户请求,一次送入 GPU,提高利用率。汽车却不能为了攒够一批数据,让刹车判断多等几十毫秒。
它需要 batch 1 或很小批量下仍然高效,并保证最坏情况下的响应时间。Waymo 使用预先编译(AOT)和 mega-kernel 思路,把一串算子提前组合,减少运行时调度与内存往返。这样牺牲部分通用性,换取低延迟和可预测性。
这是专用芯片相对通用 GPU 的核心价值。它不是在所有模型上都更快,而是在固定传感器、固定软件栈和明确延迟目标下,把不必要的灵活性删掉。
Waymo并没有把所有IP都自己重做
自研芯片并不等于闭门造芯。ServeTheHome 的报道提到,Waymo 自研了 carTPU、ISP、编解码和部分传感器接口,同时采用第三方 GPU、互连和内存 IP,并由台积电制造。
Waymo 官方列出的合作伙伴还包括 AMD、Micron、NVIDIA、Samsung、Sandisk 和 Socionext。
这是一种越来越典型的系统公司路线:把最能体现自身算法和产品差异的模块掌握在手里,其他成熟模块通过合作获得。
壁垒不是"所有晶体管都自己画",而是知道哪些数据路径决定产品体验,并有能力把算法、传感器和芯片共同优化。

自研芯片的判断标准
中国车企和自动驾驶公司同样在讨论自研芯片。Waymo 提供了一个判断标准:自研不应该只是为了拥有一颗印着自己名字的 SoC,而应该有明确的系统收益。
如果公司拥有稳定的大规模车型、独特传感器组合、长期演进的算法,并能摊薄数亿美元级研发与验证成本,定制芯片可能降低功耗和物料成本,也能把算法迭代牢牢掌握在自己手里。反之,如果车型规模有限、算法快速变化,采购成熟芯片可能更灵活、更安全。
中国市场还需要考虑车规认证、供应连续性、功能安全和软件工具链。数据中心芯片失败可以重启任务,汽车芯片面对的是物理世界,任何节省都不能牺牲安全冗余与可验证性。
自动驾驶竞争已经深入到传感器数据,并且深入的思考。