【区角快讯】当算力瓶颈成为大模型落地的最大掣肘,一种打破常规硬件边界的混合架构正在河北廊坊悄然登场。在2026中国算力大会的“算力首创首发”专场上,国内首个基于国产GPU与类脑芯片的大模型异构混合推理系统正式亮相,这标志着国产芯片在支撑复杂AI任务上迈出了关键一步。
这套系统的背后,是一支由移动云(中移苏州软件技术有限公司)牵头,联合中国电子科技南湖研究院、北京灵汐科技、上海天数智芯以及清华、北大等顶尖高校组成的豪华研发团队。他们的核心思路颇为巧妙:不再让单一芯片硬扛所有计算压力,而是对Transformer结构进行PD/AF分离。具体而言,Prefill预处理阶段和Attention注意力计算交由国产GPU处理,而FFN模块则交给类脑芯片。得益于类脑芯片存算一体及片上大容量SRAM架构,那些对带宽极度敏感的计算环节得到了完美承接。
为了打通这两类截然不同的算力,团队自研了模型编译器、高速互联协议及统一推理引擎,实现了任务的精准拆解、协同调度与结果聚合。值得注意的是,这一方案直接对标英伟达下一代Vera Rubin with Groq的异构推理架构,野心可见一斑。
实测数据更是令人振奋。在3台天数智芯GPU服务器搭配3台类脑机柜的配置下,运行DeepSeek V4 Flash模型时,其推理输出速度与能效均较同等规模的纯GPU集群提升1倍以上,业务运营成本更是骤降40%以上。目前,该项目已积累15项授权发明专利和6项软件著作权,涵盖异构调度、芯片架构及编译工具链等核心环节,并已进入小批量试产阶段。未来,无论是Token工厂、AI代码生成,还是金融、安防等安全敏感行业,都将受益于这一创新成果。
国产异构算力破局:GPU与类脑芯片协同,推理能效翻倍
科技区角
2026-09-13 16:00
关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。