业内首款超算+智算的大规模计算底座,在WAIC上我们找到了

量子位 2026-07-21 15:55
允中 发自 凹非寺
量子位 | 公众号 QbitAI

这几天,全网被WAIC“霸屏”,从具身智能到国产算力,这场一年一度的AI盛典,同样吸引了科技圈所有目光。

今年WAIC堪称是国产芯片和算力企业的斗秀舞台,108款芯片、超200款智算产品齐聚上海。除了全员大集合外,我们还看的一个明显的变化:

过去各家比的是”我这颗芯片算力多少”,单卡性能多么牛;而今年,提到最多的是“系统创新”与“高效协同”。换言之,单卡比拼的时代已落下帷幕,大规模计算系统性能的较量即将开启。

算力芯片群星闪耀,我们也发现了一颗“不走寻常路”的新星(芯)。

浦东张江,太初(杭州)集成电路有限公司(“太初元碁”)展位里外围满了人,抛开展位处于主通道上的地理位置不谈,更吸引目光的,是一台大型超节点集群,号称“超智融合”的计算系统,旁边刚揭幕的自研芯片——标签写着:异构众核,双模设计。

业内首款超算+智算的大规模计算底座,在WAIC上我们找到了图1

先拼架构,再谈单卡

“算力产业已从单卡性能比拼进入系统级竞争阶段。”太初元碁CEO杨晋喆如是说。

这话不是场面话。模型参数突破万亿级,Agent和AI4S对CPU-GPU协同的要求越来越高,单纯堆算力的边际收益正在递减。降低单位算力成本,才是当下真正的核心命题。

这个判断与整个行业的演进方向一致。今年WAIC上,华为展出了Atlas 950 SuperPoD超节点,沐曦发布“曦景”S系列超节点,阿里平头哥也拿出了真武M890×磐久AL128超节点。

国盛证券在近期研报中直接点明:国产超节点迎来量产元年,算力竞争范式正从单点峰值性能全面转向系统级全栈效率的比拼。

业内首款超算+智算的大规模计算底座,在WAIC上我们找到了图2

太初元碁给出的技术答案是HCU异构融合计算架构。核心思路是把CPU和AI算力核放在同一条高速总线上,支持M:N可重构配比——CPU负责Agent调度和数据预处理,XPA算力阵列专注大模型推理计算,再配合共享分级存储,实现冷热数据动态调度。

翻译成大白话:一块芯片里塞了两类“大脑”,一个管调度协调,一个管高强度计算,两者还能按需调配比例。这种设计的好处在于,面对不同负载时不用“大炮打蚊子”,也不用“小马拉大车”,算力分配可以动态匹配。

为什么异构众核成了必选项?

这得从Agentic AI时代的算力需求变化说起。

传统AI训练和推理集群通常采用“单路CPU搭配4至8颗GPU”的固定配置,CPU长期充当算力宿主,仅负责任务下发、数据调度与GPU资源托管。

进入Agentic AI智能体时代,智能体需要自主完成任务拆解、工作流编排、外部工具调用、长期记忆管理全闭环运行,CPU在规划、决策、交互类通用计算中的算力权重与负载占比出现结构性显著提升。

AMD CEO苏姿丰在2026年Q1财报电话会上透露,单个计算节点中CPU与GPU的数量正从过去的一对多,逐步趋近一比一,未来甚至可能出现CPU数量多于GPU的情况。

阿里云的判断也类似:Agent“有状态调度+无状态执行”的混合模式,对资源精细化管控提出了更高要求,算力系统的优化重心正全面由单卡峰值性能转向CPU-GPU的高效协同。

太初元碁的HCU架构,本质上是在芯片层面提前响应了这个趋势。把CPU和AI核放在同一条高速总线上,相比传统“CPU+独立加速卡”的分离架构,I/O损耗更低,协同效率更高。

一颗芯片可打两份工

基于HCU架构,太初元碁发布了新一代国产AI自研芯片T2 Ultra。最值得看的正是它的双模式设计。

T2 Ultra有两种工作模式:自主计算模式下,芯片可以独立承担完整计算任务;加速模式下,则配合主机协同工作。

这意味着同一颗芯片,既能作为独立算力节点部署在边缘或中小规模场景,也能作为加速卡插进大型集群里当”算力引擎”。

具体再看T2 Ultra的性能参数,HPC算力(FP64)为38 TFLOPS,可满足科学计算需求;FP4算力则高达4800 TFLOPS(稀疏算力),FP16算力1200 TFLOPS(稀疏算力)应对各种AI训推场景,原生支持FP64至FP4、实现全精度覆盖。

对于客户来说,这种灵活性的实际价值在于:不用为不同场景采购不同硬件,一套芯片体系覆盖多种部署需求,采购和运维成本都能压下来。

在国产AI芯片普遍面临“量产难、落地更难”的当下,能不能让客户用得起来、用得起,比纸面参数重要得多。

不只是跑大模型

如果说T2 Ultra是“心脏”,那元碁HyperIntelliX超智融合计算系统就是整个“身体”,定位为面向 AI+AI4S 的全国产智算+超算融合计算平台。

业内首款超算+智算的大规模计算底座,在WAIC上我们找到了图3

值得注意的是,HyperIntelliX不只是跑大模型,同样也能在AI4S领域发挥价值。针对AI4S领域,太初元碁同步披露了相关落地成果:

全球气象预测可视化系统、TecoQSim量子经典模拟器、大规模虚拟药物筛选——覆盖气象、量子计算、生物医药三个方向。

多数国产AI芯片目前还停留在“跑通大模型推理”的阶段,能同时支撑AI和AI4S双线任务的平台并不多见。

业内首款超算+智算的大规模计算底座,在WAIC上我们找到了图4

这个定位有其行业背景。AI4S(AI for Science)对算力的需求与纯AI推理不同:科学计算通常需要高并发、大吞吐、长时任务,且对双精度计算能力有硬性要求。

太初元碁团队有三次获得高性能计算领域国际最高奖项“戈登·贝尔奖”的积淀,在超算领域的经验为其切入AI4S提供了技术底气。

生态迁移:国产芯片真正的硬骨头

俗话说“是骡子是马,拉出来遛一遛”,硬件再强,也得有人用,才能谈得上“可用”,进而超“好用”转变。

太初元碁WAIC期间发布了两款生态产品,直指国产芯片最头疼的“迁移成本”问题。

人工智能开发者社区2.0完成了对Megatron-LM、DeepSpeed、飞桨PaddleHelix、PyTorch、vLLM等主流训练与推理框架的适配,提供从模型分析、迁移、算子开发到性能优化、精度调试的全流程工具链。

业内首款超算+智算的大规模计算底座,在WAIC上我们找到了图5

新一代国产AI4S计算平台,针对科学计算高并发、大吞吐、长时任务的特点做了专项优化。

这个自主研发的一站式科研创新平台,面向气象预测、生物医药、量子力学、化学材料、流体力学等前沿科学领域,全面兼容龙芯、申威、飞腾、x86等国内外主流CPU,提供自研编程模型和涵盖通用算子与科学计算专用加速库。

同时深度适配 PyTorch、JAX、飞桨、MindSpore 等主流框架,并配套 DevKit 开发套件,支持算子生成、编译优化与性能分析,有效降低算子开发门槛与性能调优难度。

业内首款超算+智算的大规模计算底座,在WAIC上我们找到了图6

依托平台软硬协同的全栈能力,太初元碁与清华大学、湖南大学、山东大学、百度、东润等高校和行业伙伴展开深度合作,在气象预报、量子模拟、基因分析、材料仿真、流体计算等领域打造一系列高效、精准的科研解决方案,助力科研与产业级科学计算高效落地,实现以中国芯,解科学题。

太初元碁的逻辑很清楚:芯片是入场券,生态才是护城河。

这个判断切中了国产芯片的共性痛点。当前主流框架和算子库深度绑定CUDA生态,模型向国产算力迁移流程复杂、开发成本高、周期长。行业调研显示,完整适配周期约需3-6个月,其中约60%的工作量集中在性能调优阶段。

国产芯片生态建设目前分为两大路线:一条是主打GPGPU路线,追求与英伟达的CUDA兼容,如寒武纪通过自研Bangware软件栈实现CUDA兼容,迁移成本降低约70%;另一条是以华为MindSpore为代表的自主生态,试图在英伟达生态圈外建立独立生态圈。

太初元碁的路线更接近前者,通过多元化开发范式支持PyTorch、vLLM等主流框架快速迁移,满足80%-90%主流场景适配需求。

进一步深挖其长期以来在国产化生态搭建方面的尝试,我们发现,不管是公开信息显示的累计超40款AI大模型的即发即适配,还是太初元碁联合百余所高校、科研机构、企业等推动算力落地——

例如与清华大学研发Teco-QSim量子经典模拟器;携手量旋科技,打造“量子-超算-智算”超智融合平台;率先完成清醒异RiverONE模型适配及龙芯平台验证;为清华大学智能产业研究院AtomWorld 原子世界模型提供512节点全液冷架构的硬件基础;与百度螺旋桨、神威数智团队成功复现AlphaFold3模型;联合湖南大学发布首个显式建模DNA双链动态交互的基因组语言模型CrossDNA;与山东大学高性能计算团队完成分子对接方法优化,构建大规模药物筛选全流程方案;联合百度飞桨为百家企业提供 AI for Science端到端方案;联合百度科学计算团队打造国产气象一体机,支持逐时动态推演与台风路径轨迹精准识别;与东润环能达成战略合作,实现训练吞吐与推理QPS的双提升;深度适配上海人工智能实验室的书生Intern-S1 AI4S多模态大模型,并联合开展AI4S生态赛事等等。

都直接指向一个核心问题:生态不断加码扩容。

业内首款超算+智算的大规模计算底座,在WAIC上我们找到了图7

聊完技术底层讲安全

由河南空港智算中心、瑞莱智慧、太初元碁、安势信息、清源智契、典枢科技、数安信七家单位联合打造的全域大模型安全系统,同步在WAIC发布。

业内首款超算+智算的大规模计算底座,在WAIC上我们找到了图8

瑞莱智慧CTO徐世真现场拆解了整套框架:底层是国产可信算力底座,核心是一体化大模型安全评测治理平台,上层构建大模型安全测评、数据合规、数据安全、软件供应链安全等多种安全系统,顶层配套独立AI安全教育实训中心。

这看起来像是“补丁式”的安全附件,但在当前的行业语境下,它可能是整场发布会中最务实的一环。大模型正在加速进入政务、金融、医疗等敏感领域,安全问题不是“要不要做”的问题,而是“不做就没法落地”的硬门槛。

看似斗秀 实为国产算力的一次大考

WAIC 2026与其说是一次国产算力“百花斗艳”舞台,不如将其看成面向国产算力的一次大考。而当我们把太初元碁的发布放在整个国产芯片版图里看,会更清晰一些。

华为昇腾950PR已经量产,FP4精度算力达1.56PFLOPS,2026年出货目标上调至150-200万颗;寒武纪思元590在DeepSeek推理场景中效率已超越H20,2025年全年营收64.97亿元,同比增长453%;沐曦股份登陆科创板,市值一度突破2800亿元;海光信息深算DCU已与365款主流大模型适配。

太初元碁的差异化在于:它想做的不是某一颗芯片的替代者,而是一整套AI基础设施的构建者。

从底层HCU架构支撑的T2 Ultra芯片与HyperIntelliX系统,到中层开发者社区2.0与AI4S计算平台,再到上层七家联合的全域大模型安全体系——三层之间不是简单叠加,而是相互支撑的体系。

业内首款超算+智算的大规模计算底座,在WAIC上我们找到了图9

但挑战同样明显。国产AI芯片市场正从“政策驱动”向“市场驱动”深层转型,头部3-5家占据80%+份额的洗牌窗口即将开启。

对于太初元碁而言,能否在万卡集群、十万卡集群的规模化部署中证明系统稳定性,能否在生态迁移成本上持续降低开发者门槛,将是决定其能否从“可用”走向“好用”的关键。

国产算力走到今天,早已过了靠单点参数刷存在感的阶段。真正的较量,是体系化能力与生态协同效率的综合比拼。

WAIC 2026的展台已经说明:大家比的不再是“我有多强”,而是“我的系统有多完整”、“我能不能落地更多场景”。毕竟,只有真正走完产业闭环落地,未来才能接着“活下去”。

*本文系量子位获授权刊载,观点仅为原作者所有。


一键三连「点赞」「转发」「小心心」

欢迎在评论区留下你的想法!

—  —

🌟 点亮星标 🌟

科技前沿进展每日见

声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。 
AI
more
业内首款超算+智算的大规模计算底座,在WAIC上我们找到了
院士揭秘,谁是容易被低估的AI性能胜负手?
万佑智算WAIC发布VanorOS,“零门槛”Agent替你跑流程
WAIC现场直击|端侧算力竞赛爆发,聆思手握下一代AI终端落地关键筹码
AI影视的胜负手,不止于工具
阿里发布RynnBrain1.1,从122B具身基模到跨本体操作,一套模型打通“看懂-定位-行动”
WAIC 洞察|从Gento轮式机器人到自研模型,天机亮出了完整能力闭环
SIGGRAPH 主题演讲:NVIDIA 勾勒图形与物理 AI 的新时代蓝图
在WAIC,聊聊具身智能的“量产元年”与“中国式拐点”|甲子光年
为了教大伙用AI,这家公司写了40万字的攻略。
Copyright © 2025 成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号