超节点成AI基建新宠:从“军备竞赛”到落地算账,算力密度之争白热化

科技区角 2026-07-27 15:30

【科技纵览】中国大型互联网巨头正计划在下半年大规模部署超节点方案,这一趋势标志着AI基础设施建设的重心已从单纯的卡数堆叠转向系统级效能优化。尽管超节点整机成本通常高于同等配置的传统服务器,但其凭借更高的算力密度和更小的空间占用,在寸土寸金的数据中心里显得极具性价比。新华三相关人士直言,对于必须在有限物理空间内承载海量算力的企业而言,超节点堪称“大杀器”。值得注意的是,此前未采用该方案的DeepSeek近期也明确表达了采购意向并进入议价阶段,这一动向被云计算大厂人士视为具有风向标意义的信号。

这股热潮在2026世界人工智能大会上体现得淋漓尽致。华为展出了由20个机柜组成的1024卡昇腾950超节点真机,中科曙光则展示了浸没在冷却液中的640卡超节点。此外,百度天池、阿里云灵骏真武M890、浪潮信息元脑以及沐曦曦景S600等产品均被置于各自展台的核心位置。所谓超节点,本质是通过高速互联技术将大量GPU或加速卡深度整合,使其在逻辑上如同一台超级计算机,从而突破传统集群跨机器通信的带宽与延迟瓶颈,大幅提升硬件利用率并降低单位Token成本。华为资深人士指出,超节点已确立为当前AI Infra建设的主流趋势。短短一年间,它从少数厂商展示实力的旗舰产品,演变为算力企业必须参与的“军备赛”。百度昆仑芯人士透露,国产超节点自去年推出以来,目前已发展至可批量落地阶段,预计今年底各家算力企业都将具备交付能力。

追溯其发展脉络,超节点并非全新概念。2024年英伟达发布GB200 NVL72,将72颗Blackwell GPU纳入同一高速互联域,虽初时需求不旺,但随着2025年大模型参数暴涨,该技术迅速成为热点。国内厂商早在2024年前后便启动预研,首批产品于2025年上市,华为、百度智能云、浪潮信息、新华三、中兴等纷纷入局。目前赛道内形成了三条主要路线:一是追求单节点规模最大化,二是强调部署效率与经济性,三是尝试以新芯片和互联架构重新定义标准。

在“大节点”阵营中,华为、中科曙光和百度表现突出。华为展示的1024卡超节点将在四季度实现8192卡满配交付,这是其技术上限;其去年推出的384卡版本已在金融、能源等行业商用落地750多套。中科曙光依托浸没式液冷技术,单机柜容纳640张加速卡,构建的十万卡AI超集群已落地国家超算互联网郑州核心节点,主要服务于模型训练及AI for Science场景。百度智能云天池超节点正从256卡向512卡演进,强调全栈自研,其文心5.1重要版本的训练即在全国产集群上完成,并支撑了电力行业多个场景的推理与训练。

另一派厂商则认为“越大越好”并非真理。阿里云灵骏真武M890以64卡为Scale-up单元,通过Scale-out网络扩展,并将此形态推向公共云,让客户按需调用而非购买设备。浪潮信息继去年推出64卡产品后,今年又发布了32卡超节点,旨在让万亿参数大模型的推理更普惠。浪潮副总裁赵帅表示,内部使用万亿大模型进行AI Coding的效率远超千亿模型,因此推出更小规格以降低门槛。沐曦则以单柜64卡为基础,主打CUDA生态兼容及横向扩展能力。

第三条路径试图跳出传统GPU或加速卡框架。清微智能采用可重构数据流架构,芯片间直连无需交换机,已推出峰值算力500PFLOPS的4096卡超节点,并在北京、内蒙等地落地。东方算芯及摩尔线程也计划跟进,寒武纪下一代芯片亦被业界预测将支持超节点。至此,国内主流算力芯片与服务器企业几乎全员入场。

为何爆发在今年?业内归纳出三大动因。首先是训推需求激增。Kimi发布的2.8万亿参数模型K3预示着参数规模的指数级增长,海外中等规模模型已达5万亿。业界估算,训练3万亿参数模型需约1万张卡,6万亿需2万张卡,一体化运作成为最优解。同时,AI Coding等场景中单次任务触发数十万次操作,对并发和长上下文处理提出极高要求,这正是超节点大内存池的优势所在。阿里云人士指出,线上推理与训练比例已接近5:1至10:1,绝大多数算力用于推理。

其次是经济账算得通。虽然超节点单价高,但综合考虑风火水电等基础设施成本,其集约化优势明显。新华三人士认为大企业部署必是经过精密计算。浪潮赵帅举例称,若推理性能提升10倍而耗电仅增2倍,收益可观。昆仑芯人士补充,传统模式下10台机器算力叠加损耗大,实际效能可能仅相当于6台,而超节点通过高速互联可将损耗降至最低,PD分离推理性能比普通同卡数机器提升30%至50%。

最后是工程化成熟度达到临界点。超节点涉及芯片、存储、通信、散热等多环节协同,非单一厂商能独立完成。目前产业链已具备批量交付整机的能力,无论性能优劣,至少能保证供货。

关于超节点更适合训练还是推理,各方观点不一。华为认为两者皆有价值,Agent推理需要海量上下文并发;摩尔线程聚焦万亿参数训练及高速推理;沐曦则认为在推理的Decode阶段价值最突出;清微智能指出目前微调训练较多,但推理性能更佳。

技术路线上的分歧同样显著。首先是规模之争,“小节点派”认为64至128卡足以满足TP/EP并行需求,过大反而增加延迟风险,适合中小规模微调;“大节点派”如华为、曙光、百度则主张万亿参数时代需要更大统一内存池以应对Agent并发。其次是生态之争,阿里平头哥、沐曦等坚持CUDA兼容以降低迁移成本,而华为昇腾、昆仑芯走自研路线。有大厂人士分析,随着Agentic coding普及,人工编程心智负担降低,CUDA的重要性可能减弱。华为方面强调其在mxfP8精度上的领先,并指出双方均在向矩阵与向量综合型方向演进。此外,铜缆与光纤、风冷与液冷的选择也因运维成本和故障率存在争议。

共识在于软硬协同。国内模型架构分化为Linear Attention(如千问GDN、Kimi KDA)和Smart Attention(如DeepSeek MLA)两派,这将直接影响硬件适配。浪潮董事长彭震指出,软硬件联合创新带来显著收益,美国企业也在探索类似路径。沐曦杨建博士预言,这条赛道未来二三十年都不会停歇,AI正从Coding渗透至道路、房屋设计等知识生产领域。一位管理者期望2027年底实现“白天定规范,晚上大模型求解”,但这取决于企业对数字员工的定岗决策。

当前,美国算力约为中国的9倍,超节点正成为产业链向下延伸的关键底座。随着交付能力提升,竞争焦点已转向批量稳定性及每Token成本的降低。供应链安全仍是最大挑战,锁定供应才能确保发展的确定性。

关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。
AI
more
AI虚拟恋人遭严查,平台集体下架功能,到底禁了什么?
马斯克对话《经济学人》:AI十年夺权与人类“园艺”隐喻
华大九天亮相DAC 2026|多方案复合布局,AI赋能求索产业全新路径
AI换脸冒充马斯克网恋诈骗,日本警方揪出跨国洗钱链条
LPDDR,成为AI新贵
2026年,为什么资本更青睐「会赚钱」的AI应用?
物理 AI:自动驾驶技术的新范式
效率提升50倍!新思科技推出芯片自主设计验证及模拟混合信号设计 AI智能体!
从WAIC展台到产业现场,道通科技开放日全面展示具身智能巡检技术体系
小米澎湃OS 4九大特性曝光:AI悬浮岛与光场渲染领衔视觉重构
Copyright © 2025 成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号