中科曙光打造10万卡超集群,AI算力进入系统级竞争时代

半导体芯闻 2026-07-24 17:15
👆如果您希望可以时常见面,欢迎标星🌟收藏哦~

正如中科曙光北京公司高端算力系统首席架构师刘冠川在日前由观察者网、WAICCONNECT主办、半导体行业观察协办的“重构算力”产业链接会演讲中所说:


“随着大模型能力持续提升,AI Agent推动人工智能向更多行业渗透,AI for Science和物理AI等新兴应用不断发展,算力需求正在快速增长。与此同时,人工智能应用对于计算能力的要求也正在发生变化,单一类型的算力供给已经越来越难以满足未来需求。”


在这一背景下,刘冠川认为,算力基础设施需要从过去依靠单芯片性能提升,到如今需要通过芯片、存储、互连、软件以及系统架构的协同创新提升整体能力。





打造一个大集群:难难难




其实从今年的WAIC现场展品我们可以看到,如何打造一个更强且更具成本优势的超节点,已经成为了各大算力供应商近年来工作的重中之重。但要让那么多算力卡在一个超节点内以“一个算力卡”的样式服务客户,是一个门槛极高的世界性难题。


“总结而言,主要包括访存墙和扩展两大核心挑战”,刘冠川说。


首先看访存墙方面。众所周知,在过去几十年里,计算性能一直呈现指数级的增长;但显存内存以及互联的带宽的增长,则相对比较缓慢,这就让两者性能中间的这个剪刀差一直处于不断放大的过程当中。进而使得计算系统在一些访存密集型场景中,面临的巨大和瓶颈和压力。


其次,来到扩展方面。如大家所见,因为算力需求的增加,算力集群正在从早期的千卡向10万卡演进。在这个过程中,无论是scale up堆叠、还是scale out扩展,所面对扩展性、可靠性、能耗的问题就会逐渐凸显。传统的集群的网络架构也很难去应对这些问题。有见及此,刘冠川总结道“AI时代的计算竞争正在从单点技术竞争走向系统级能力竞争。”


在此背景下,中科曙光推出了曙光8000 (登峰)——全国产十万卡AI超集群。据刘冠川介绍,曙光8000并不是普通AI集群,而是一套面向未来人工智能发展的战略性算力基础设施,其单体规模达到10万卡级别。


“十万卡集群绝非万卡集群简单线性扩容,规模每提升一个量级,网络、散热、供电、存储、调度、软硬件等适配环节的工程难度呈指数级增长,我们面临诸多挑战,也对应形成全栈自研的解决方案。”刘冠川告诉半导体行业观察。




10万卡集群的进击




刘冠川指出,这个集群的价值主要体现在以下几个方面:


一方面,它能够面向国家重大科技任务提供算力支撑;另一方面,可以支持科学计算、工程计算、人工智能训练以及推理等多种应用场景;同时,通过云化方式向千行百业提供普惠通用的算力服务;此外,曙光8000项目本身也带动了相关芯片产业落地。据介绍,系统中的多款突破性芯片项目,通过该项目首次实现了生产系统的大规模应用部署。


其中,对标英伟达Nvlink的高速互连芯片,可以实现卡间的高速互连。同时,系统还部署了400G、800G交换芯片以及400G网卡芯片,用于支持大规模网络扩展;


“曙光8000构建了国产高速网络系统,从底层核心IP到芯片、网卡、交换机,实现全面国产化,并针对超大规模Scale out场景进行了优化。”刘冠川总结说。


除了计算和网络,存储也是超大规模算力系统的重要组成部分。据介绍,曙光8000采用了曙光自主研发的ParaStor分布式存储系统。该系统在全球存储性能权威测评IO500的生产型榜单中包揽双冠,在全节点和十节点两种典型配置下,性能分别达到此前世界纪录水平的2.46倍和2.76倍。“生产型榜单与研究型榜单不同,更强调生产系统环境和实际运行约束,因此该突破代表国产分布式存储系统在真实应用场景中的性能提升。”刘冠川特别指出。


正如我们在前面所说,要实现这样一个超级集群本来就不是一件容易的事情。在与半导体行业观察交流的过程中,刘冠川也通过列举这个全栈自研解决方案需要面临的几个核心挑战,给我们详细解读中科曙光是如如何突破瓶颈。


首先在大规模无损互连方面。据介绍,传统商用网络依赖外置光模块,十万卡规模下延迟、丢包、带宽拥堵问题会急剧放大,并行效率断崖式下跌。于是,中科曙光自研了scaleFabric类IB原生RDMA无损高速互连技术,使其无需额外光通讯设备即可完成十万卡稳定互联,端到端延迟低至0.93μs,搭配信用基流控与毫秒级故障自愈,保障万卡/十万卡并行效率线性扩展,从底层规避大规模集群通信瓶颈。


超高密度散热与供电压力是超大规模集群需要面临的又一个挑战。针对这个问题,曙光8000采用高密架构设计,单计算单元算力密度较常规超节点提升20倍。曙光8000采用相变浸没液冷技术,可支撑单机柜功率密度达MW级,并实现全年自然冷却,结合余热回收等因地制宜的设计,可实现PUE小于1。搭配高压直流直供架构,解决高密度算力持续稳定运行的能耗散热难题。


除此之外,这个系统还需要面对十万卡级全链路可靠性与调度复杂度、节点数量巨大带来单点故障概率指数上升、混合精度(FP64/INT8)、多学科多用户并发任务调度难度极高等难题。


有见及此,中科曙光一方面全链路自研芯片、整机、存储、调度平台,从部件层面提升单点可靠性;另一方面依托 Gridview7.0超智融合算力管理与服务平台,融合智能调度引擎、数据亲和性算法、多元融合调度策略,搭配科研/运维双智能体,实现百万级用户并发智能分流,做到“高负载不拥堵、多任务不排队”,满载状态下系统稳定可用度达99.99%。




集群的未来,何去何从




正如刘冠川所讲,对于超大规模算力系统而言,性能并不是最终目的,如何服务实际应用才是核心价值。关于这方面,刘冠川表示,中科曙光也正在和合作伙伴推进这方面的发展。迄今为止,曙光8000已经面向300多个重点应用进行深度优化,覆盖20多个行业领域。


在科学与工程计算方面,该系统支持大规模科学计算。例如,完成3.16万亿原子级模拟,为材料研究提供新的计算能力。在人工智能领域,曙光8000也成为大规模模型训练和高通量推理的平台。目前,该系统已经与国内大模型研发团队开展深度适配和优化,包括语言模型、语音模型以及视觉模型等。


据透露,曙光8000于2024年基本完成研制,2025年完成工程建设,并在2026年逐步完成10万卡规模的系统交付。目前,整个系统已经稳定运行,各项指标达到设计目标。


“曙光8000的建设完成并不是终点,而是一个新的里程碑。未来,相关技术成果将进一步以产品形式赋能更多行业。”刘冠川表示。在他看来,AI算力集群在未来也许会沿着三层路径持续演进:硬件架构超智融合深化、运营模式算力服务化、应用范式智能体原生,最终形成全国一体化普惠算力网络。


在底层硬件硬件方面,会从单一AI /超算分离集群走向全域超智融合,同时向高密度、绿色低碳、全栈国产化迭代。十万卡将从示范工程走向标准化复制,推出千卡、万卡、十万卡分层算力方案匹配不同规模企业。


在运营模式,集群也将从“硬件销售”转向“算力即服务”。以曙光8000为例,依托国家超算互联网“数算模用”一体化体系,通过三大生态共创计划降低算力门槛,算力可以像水电一样全域调度、按需取用,分层普惠大中小企业与科研团队。


来到上层应用范式方面,集群也将从单纯算力供给,升级为超级科学计算智能体原生底座。用户通过自然语言即可拆解仿真、大模型训练任务,AI智能体自主完成调度、计算、结果分析,推动AI4S 成为科研主流范式;同时打通“四个面向、四极”重大科研场景,支撑新材料、生物医药、气象、航空航天万亿级仿真任务。


“长期来看,算力集群将深度融入全国一体化算力网,跨区域、跨厂商异构算力统一调度,结合液冷低碳、分布式算力节点,形成泛在、自主、普惠的国产算力基础设施底座。”刘冠川说。


点这里👆加关注,锁定更多原创内容


*免责声明:文章内容系作者个人观点,半导体芯闻转载仅为了传达一种不同的观点,不代表半导体芯闻对该观点赞同或支持,如果有任何异议,欢迎联系我们。


推荐阅读

中科曙光打造10万卡超集群,AI算力进入系统级竞争时代图1

喜欢我们的内容就点“在看分享给小伙伴哦~中科曙光打造10万卡超集群,AI算力进入系统级竞争时代图2

中科曙光打造10万卡超集群,AI算力进入系统级竞争时代图3

声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。 
AI
more
AMD 嵌入式计算峰会--自适应SoC|FPGA|边缘 AI|NPU|DSP|x86 嵌入式 等
华夏基金的AI投资“掘金术”
三个哈佛辍学生做AI芯片,估值700亿,SK海力士投了
世界级编程大师:AI写的代码,我一行都不看
能实时改变的剧情、会行动的 AI 角色,Vivix 灵动时刻正式发布首个实时互动模型
对话格式塔彭雷:AI 的下一站,是解读人的大脑
袁晓辉:AI让每个人都变强了,但为什么公司没跑得更快?
合肥又押中AI独角兽:多模态赛道,3个月融了21亿
最新议程!长安/理想/吉利/博泰/车联天下/QNX/易特驰,亮出全域AI落地底牌
SK海力士启动端侧AI“3D堆叠DRAM”研发
Copyright © 2025 成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号