难道课本里教了几十年的计算机基础理论真的要迎来重大更新了?
就在9月17日,华为在全联接大会上正式发布全新AI计算架构“Peerium”,这套架构可实现百万级处理器作为一台计算机协同工作,以应对不断攀升的AI算力需求,并宣称在编程模型、系统架构和互联拓扑三个层面,同时突破图灵范式与冯·诺依曼单机架构的限制。
华为轮值董事长徐直军表示:“AI时代,华为基于开创的Peerium计算架构,持续打造满足客户训练和推理需求的超节点和集群,让算力无处不在,让智能无所不及。”
这个目标的背景是一个行业公认的困境:集群规模越大,效率反而越低。华为常务董事杨超斌在演讲中披露了一组关键数据——在传统计算架构下,十万卡集群的实际模型算力利用率仅约20%,大量算力处于等待通信完成的状态。
Peerium试图从根本上解决这个问题。它不是对冯·诺依曼架构的修补,而是在系统拓扑层面重新定义了“一台计算机”的边界。

作为现代计算机的核心基石,冯·诺依曼单机架构确立了“运算、存储分离、串行执行、主从调度”的核心逻辑,支撑了半个多世纪的计算机产业发展。
但随着大参数AI模型、长序列智能体、超大规模并行计算场景快速普及,传统架构的瓶颈日益凸显:单机算力上限固化、多芯片集群存在层级壁垒、数据交互延迟高、并行扩展效率持续衰减,单纯依靠堆叠芯片、扩充集群规模已无法突破算力增长天花板,成为通用人工智能发展的核心制约因素。
针对行业核心痛点,华为全新研发的Peerium架构以嵌套并行、统一内存寻址、平等互联三大核心技术为支撑,彻底重构算力调度与硬件协同逻辑,打破了冯·诺依曼单机架构的边界限制,将百万级独立处理器整合为一台调度统一、算力贯通、资源共享的超级计算机,实现了超大规模算力的无损强扩展。
技术层面,Peerium架构创新性提出Nested BSP(嵌套批量同步并行)计算模型,突破传统图灵范式的局限,解决了大规模并行计算中的任务分层调度、同步协同、资源适配难题。
不同于传统集群“主节点管控、从节点执行”的层级主从架构,Peerium架构实现所有处理器节点平等互联、对等调度,消除了算力层级壁垒与调度瓶颈。搭配核心的UnifiedBus统一互联总线技术,架构实现全域统一内存寻址,彻底打通不同芯片、不同节点间的数据交互通道,大幅降低数据搬运延迟,规避了传统架构“算力闲置、数据拥堵”的核心痛点。
相较于传统冯·诺依曼集群架构,Peerium架构的核心优势集中体现在极致扩展能力与协同效率。传统多机集群本质是多台单机的简单拼接,存在严重的跨机通信损耗与算力割裂问题,集群规模越大,算力损耗越明显。
而Peerium架构通过底层架构革新,让百万级处理器实现硬件资源共享、任务协同并行、算力统一输出,真正达成“多芯合一、万芯同源”的计算效果,算力利用率、并行拓展效率实现量级提升。
华为也同步公开了支撑Peerium计算架构落地的核心互联技术“灵衢”,这是一套完全基于开放协议打造的高速互联总线,可以不受限制地扩展联接CPU、NPU、内存、SSD、网卡和交换机等所有算力相关硬件,有了灵衢技术的加持,整个算力集群体系里的计算、存储和网络资源就能实现完全的平等互联,不再有传统架构下的资源层级壁垒。
据华为官方披露,Peerium架构已完成商业化落地适配,依托昇腾算力体系实现场景落地,目前搭载该架构技术能力的25.6万卡Atlas 950算力集群已正式上线,可全面支撑超大参数大模型训练、AI Agent长序列推理、高并发智能计算等高端场景。在主流大模型、通用智能体等实际业务测试中,新架构有效降低首Token时延、提升模型吞吐效率,为复杂AI任务提供稳定、高效的算力支撑。

有人说这是华为在芯片封锁下的被迫创新。这话只对了一半。封锁确实逼着华为没办法在高制程上跟人卷,只能往架构层面找突破。但Peerium架构的方向,恰恰是AI计算本身的必然——模型越来越大,单卡再强也装不下,唯一的出路就是让更多芯片像一颗芯片那样工作。华为不是被逼上了这条路的唯一玩家,只是跑得最快、喊得最响、产品已经落地的那一个。
END

往期精选:

请点下【♡】给小编加鸡腿
