新智元报道 大模型提速,原来还有这条路!上一周,vLLM原班人马创办的Inferact,开源了一套TPU Megakernels(巨型算子)。他们把Kimi K3的92个MoE层一层不落地写进同一个程序,扔到16颗谷歌TPU v7上跑:开着投机解码,单用户输出速度达到709 tokens/s;同样16块英伟达GB200,用vLLM跑,是452 tokens/s。关掉投机解码,在1到8的并发下,它也都是GB200的1.4到2倍。最扎心的是,按纸面参数,TPU v7的显存带宽(7380GB/s)还比GB200(8000GB/s)低一截。硬件没占到便宜,赢在了写法上。还有个彩蛋,这套巨型算子从零编译只要不到90秒。以前在TPU上编译一个同量级的大模型,动辄半小时起步。同一周,国内也传来进展。在AICC2026上,浪潮信息发布元脑SD200 Ultra超节点AI服务器,用128芯的本土AI芯片,单机跑起同一个K3,Token生成时延压到5.85毫秒。他们的招数叫「超级算子」。一个用谷歌TPU,一个用本土AI芯片,同一周、同一个模型,都在拆算子之间的那堵墙。更有意思的是,浪潮信息的超级算子,有一大块是让K3自己写的。大模型吐字慢到底卡在哪儿很多人以为大模型吐字慢是算力不够。其实芯片大部分时间闲着,在等数据。模型每生成一个token,都要把用到的参数从显存(HBM)里搬一遍。算得再快,货没到也只能干等。所以推理速度的天花板,很多时候由显存带宽说了算。很多时候,麻烦出在「算子」上。算子可以理解成一个个小程序,做一次矩阵乘、做一次归一化,各管一摊。传统推理框架里,生成一个token要依次启动一长串算子,每个都走一遍「搬数据—计算—写回去」。据统计,K3单步推理要调用数千次算子。打个比方,这就像坐老式绿皮火车从北京到广州,一路几百个小站,每站都要停车、卸货、装货、再启动,两天两夜才到。车停着的那几分钟,铁轨是空的。换到芯片上,就是显存带宽在算子切换的空档里被白白浪费。一个空档不起眼,几千个攒起来,就是理论速度和实际速度之间那道大坑。英伟达这些年也在补坑,CUDA Graphs、PDL这些技术能让车停得短一点。可站还在,车就得停。那就把站撤了,改高铁,一站直达。这就是算子融合。整个模型,就是一个算子Inferact的做法最狠:既然边界是浪费的源头,那就一个边界都不留。92层全装进一个kernel,程序按层号自己判断这一层该走KDA还是MLA(K3用的两种注意力机制)。所有层都在同一个程序里,上一层还在算,下一层的权重就已经在搬运的路上了。等轮到它,货早就码在芯片手边。这招能成,得感谢TPU的一个设计。TPU v7每个核心自带64MiB的片上高速内存(VMEM),数据搬进来放多久、什么时候腾地方,全由程序说了算。GPU的片上内存要分给一百多个计算单元,每个单元只摊到两百多KB,想提前囤货都没地方放。TPU给了一个大仓库,还把钥匙交给了写程序的人。至于编译为什么快得离谱,Inferact的解释很实在:原来编译器每次都要在成百上千个操作里反复摸索怎么排顺序、怎么重叠,现在这些活儿,工程师一次性手工做完了。注意这个「手工」一词,四位作者都是顶尖的推理工程师,写这样一个巨型算子,门槛高得吓人。Inferact在博文里也留了一句:以后会有更多这样的kernel,由编程智能体(coding agent)来写。写算子这门手艺AI正在接手这句话可不是客套。9月14日,DeepSeek的算子工程师刘胜与发了一篇长文,跟自己「手写算子的时光」告别。他给DeepSeek V4.1写过主注意力算子,是真正在一线拧螺丝的人。他在文中预计,半年到一年内,AI写的算子就会追上甚至超过他。一年前,他的AI助手还只能帮忙找bug;现在已经能自己读CUDA、PTX、SASS这些底层代码,动手调优。他还写了一句很扎心的话:自己算子写得越好,新模型训练和推理就越快,他被替代得也越快。大洋彼岸也在跑同一条路。今年4月,Cursor和英伟达合作,用一套多智能体系统优化了235个CUDA算子,三周跑下来,平均提速38%。为什么偏偏是算子最先被AI接手?因为它有标准答案:结果对不对,一跑就知道;快了多少,秒表说了算。AI可以没日没夜地写、测、改,人熬不过它。浪潮信息,已经把这件事用在了K3身上。让K3优化K3,系统级破局面对同样的Kimi K3,国内的浪潮信息也在做算子融合,同时把优化延伸到整个超节点系统。两家的共同点很明确:把细粒度的小算子融合成大算子,减少启动和数据搬运的开销。区别就在于粒度。Inferact把整个解码过程融合成一个算子;浪潮信息的粒度相对较小,围绕KDA、Gated MLA、MoE等模块做融合,形成超级算子。也就是说,两家都在减少中间停靠,只是合并的范围不同。在不久前的AICC 2026上,浪潮信息直接亮出了元脑SD200 Ultra超节点AI服务器。它的底层逻辑很务实:在单卡显存和制造工艺存在现实约束的客观环境下,想要承载2.8万亿参数、还要把时延降下来,必须走系统级创新。元脑SD200 Ultra采用3D Hyper Mesh架构,将128颗AI芯片组织成协同计算的整体,提供8TB统一编址显存,并配合64TB内存,为模型权重和不断增长的KV Cache提供承载空间。这样,前沿模型就能够充分利用多颗芯片的计算和显存资源,支持10万亿参数模型在单机上部署和运行。紧接着,他们在这个底座上干了三件非常狠的事:搞定「对称内存」,实现显存直接串门在传统集群里,GPU之间互通数据,必须由CPU充当中介打报告、做调度,层层转手。这就像同一个小区的邻居互相串门,过去非得先跑一趟物业,办个进门条才能去隔壁单元。而SD200 Ultra通过对称内存技术,彻底踢开了中间层,显存统一编址,GPU直接点对点访问远端显存,相当于推门就进邻居家。这一招,直接把跨卡通信时延压到0.69微秒,AllReduce通信时间骤降3.5倍!通算融合,把绿皮车升级成直达高铁数据通路打通后,接下来超级算子的优化分三步展开。第一步,把小算子变成大算子,减少中间停靠。具体做法是,把KDA、Gated MLA、MoE等模块中的细粒度算子融合成超级算子。结果,算子数量减少到原来的约十分之一。关键在于,合并之后,数据怎么留在芯片手边。工程师会根据片上存储容量,把数据切成合适大小的块。前一步算出的结果,尽量直接留在寄存器或片上缓存中,交给后一步接着用。就像几个工位连在一起,半成品顺手递过去,省掉了每做一道工序都送回仓库、再取出来的折腾。这样既减少了kernel的启动次数,也减少了中间结果反复写入、读取HBM的开销。第二步,把通信和计算融合,让搬数据与做计算同步进行。大算子内部也要「排好班」。团队按Tile(数据块)组织流水线,通过异步搬运和多缓冲机制,让不同数据处在不同的处理阶段——当前块正在计算,下一块提前搬进来,已经算完的块则写回结果。缓冲区轮流接力,芯片就能少一些等数据的空档。用K3优化K3,超级算子智能体的诞生第三步,就是让K3参与优化K3,把调优做成持续迭代的闭环。人工手写深度融合的Kernel,复杂度高到非普通人所能承受。浪潮信息的办法,是让K3自己上手。他们用K3搭了一个「超级算子智能体」,让它在一个「生成—验证—测量—迭代」的闭环里一圈圈转:K3先看运行画像,哪一步在等数据、哪块缓存没用满,心里有数;再据此提出怎么并算子、怎么切数据块、怎么排流水线,自动写出一批候选超级算子。候选版本先过正确性校验,再拉到真实负载上跑分。延迟多少、显存读写了多少、占了多少资源,这些数字再喂回给K3,当作下一轮改进的依据。只有算得对、又确实更快的版本,才会被部署上线。在闭环迭代的最后阶段,算子性能直接进入正向循环,性能硬生生再拉升了50%,综合推理效能提升了3倍以上! 最终成绩单出炉,单机稳稳吃下2.8万亿参数的Kimi K3,Token生成时延首度杀进5.85毫秒,单用户吞吐突破170 tokens/s,跑出了业界平均水平的5倍速度。大家都在盯的,是Token速度芯片的纸面参数越来越接近,拉开差距的是软件和系统:算子边界在消失,通信和计算在合流,写算子的活儿,越来越多交给AI。对国产算力来说,这条路尤其实在。SD200 Ultra这回摆出来的是另一种解法:靠系统级的紧耦合,加上算子层的深度优化,基于本土AI芯片的超节点照样能把2.8万亿参数的模型跑进毫秒级时延。模型一个字不改,光靠算子融合和内存管理就能拿到几倍提升,比干等下一代芯片快,也便宜。更深的变化,发生在买算力的人身上。以前来买AI服务器的多是专业用户,开口就是要多少卡、多少网络、多少存储。现在客户上来先问一句:这个模型,在你机器上能跑多快?背后的推手是Agent。聊天的时候,回答慢两秒无所谓。可一个Agent任务要经历上百轮「推理—调工具—看结果—重新规划」,每一轮慢一点,整条链路就能慢出好几分钟。这种时候,卡有多少张、峰值算力多高,普通用户根本摸不着。每秒吐多少token、一个token要等多久,才是直接落在体验上的东西。浪潮信息把这类需求叫「能力型智算」:让最前沿、最大的模型跑得起来,还得跑得快,去啃过去啃不动的问题。SD200 Ultra给10万亿参数的模型留足了空间,按浪潮信息首席AI战略官刘军的判断,一两年内顶尖开源模型就会走到这个量级。K3只是第一个被它跑快的模型。所以下回再有人拿「多少张卡、多少P算力」跟你介绍一台AI服务器,不妨多问一句:最前沿的模型,在上面Token生成速度有多快?SD200 Ultra交出的答案是:K3,5.85毫秒一个。AI下一站:拼系统,拼AI写算子这一场围绕K3的推理极速战,折射出整个AI计算产业正在发生的剧烈质变。提速的主战场,从芯片挪到了系统。过去两年,推理加速主要靠算法:量化、投机解码、压缩KV Cache。这一轮的提速,模型一个字没改。Inferact手里的TPU,显存带宽比GB200还低,照样跑赢;浪潮信息靠超级算子,在同一套硬件上把K3的推理性能拉高3倍以上。同样的芯片,组织得好不好,能差出好几倍。墙会一堵一堵地被拆掉。推理说到底是在搬数据,时间都耗在各种「边界」上。算子和算子之间有墙,于是有了算子融合;计算和通信之间有墙,于是有了通算融合;芯片和芯片之间有墙,于是有了统一编址和显存直连。写算子这门手艺,正在交给Agent。Inferact的巨型算子还是人手写的,但他们自己也说,以后这活儿更多归编程智能体。浪潮信息走得更靠前,已经让K3给K3写了超级算子。算子交给AI,最大的变化是定制化变便宜了。以前给一个模型专门手写一套算子太贵,模型一换代就白干,大家只能做通用优化。刘军说,Agent时代反倒给了机会:针对具体模型,从芯片、系统、通信到算子进行协同调优,让Kimi K3模型的推理效率不断逼近系统的极限。更有意思的是,现在新模型一发布,就能让它带着智能体给自己写一套专属算子,跑一遍,测一遍,再改一遍。模型越强,写出的算子越好;推理越快,下一轮迭代也越快。大模型时代的下半场,拼的早就不再是一两句惊艳的对话,而是实打实解决问题、完成任务的执行力。 每一次Agent的任务拆解、每一次工具的自动调用、每一个长程逻辑的自我纠偏,背后都在疯狂燃烧着推理Token。在这场关乎生产力重构的竞赛中,时延和吞吐已经不仅是体验问题,而是直接决定了Agent能否在现实世界中完成闭环。从硅谷的Megakernels,到中国超节点上的超级算子,全球顶尖工程师们正在沿着相似的路径,解决同一个问题:怎样让每一个Token更快地产生,让有限的算力转化为更多可用的智能。推理的效率革命才刚刚拉开大幕,这场好戏,正越来越精彩。编辑:桃子秒追ASI⭐点赞、转发、在看一键三连⭐点亮星标,锁定新智元极速推送!