
2018年,当国内绝大多数AI芯片创业公司选择对标GPU路线时,中昊芯英创始人及CEO杨龚轶凡做出了一个截然不同的判断:基于Attention机制的Transformer架构大模型将成为AGI技术的核心载体,而面向大模型专用设计的TPU架构,将是行业长期刚需。
八年后,在“2026世界人工智能大会(WAIC)”期间,中昊芯英主办的“智算跃迁 芯有新篇”分论坛在上海举行。新一代全自研TPU架构AI芯片“须臾®”首次公开亮相,华东地区(杭州)首个国产TPU智算千卡集群正式落成,两场覆盖全域产业链的生态合作签约同步完成。
从2018年的产业预判,到2023年一代芯片“刹那®”量产,再到2026年“须臾®”发布与千卡集群落地,这家总部位于杭州的芯片企业,用八年时间验证了一条差异化的突围路径。
“须臾®”登场
算力翻三倍,成本砍一半
“须臾®”是中昊芯英继“刹那®”之后推出的第二代TPU芯片,于6月30日正式发布。单芯片混合精度浮点算力达896TFLOPS,性能是“刹那®”的3倍;8-bit推理算力达1792TOPS。单芯片额定功耗600W,相较于算力性能持平的传统算力芯片,功耗降低50%。单个超节点最高可实现2048片“须臾®”全光互联,能够承载万亿参数大模型分布式训练等重负载业务。
杨龚轶凡表示,二代芯片的迭代逻辑并非单纯追求硬件指标堆砌,而是“全部来源于第一代芯片过去一年多市场化落地的真实反馈”。“我们在和各类合作伙伴、大模型客户持续对接、迭代配套软件栈的全过程里,收集到大量算力利用率、多卡通信、存储吞吐的优化痛点,基于这些真实业务需求完成芯片底层硬件重构。”
“须臾®”综合性能达到一代的3倍。联合创始人兼CTO郑瀚寻详细解释了其三重创新:计算流水线架构优化、先进芯粒封装技术、片上存储架构扩容——三层软硬件协同,且整体功耗未明显上涨。

千卡落地
从“试验田”到国产标杆
论坛现场还举行了华东地区(杭州)首个国产TPU智算千卡集群落成仪式。该项目由杭州电信、中兴通讯与中昊芯英联合打造,是中国电信体系内首个大规模国产TPU集群部署项目。
集群一期采用1024片“刹那®”芯片,算力规模达400P,实现了从AI芯片、服务器硬件、集群组网到算力调度平台的全链路国产化。“刹那®”芯片由中昊芯英历时近5年研发,拥有完全自主可控的IP核、全自研指令集与计算平台,计算性能超过海外同期著名芯片产品的近1.5倍,能耗降低30%,单位算力成本约为同类海外芯片的一半。
杭州电信智算及IDC中心总经理王良指出,TPU芯片天生聚焦推理场景、具备突出低功耗优势,十分契合运营商打造普惠Token算力服务的发展方向。双方联合打磨的千卡集群经过半年深度调优,Token输出效率提升超十倍,百万Token调用成本从百元降至十元以内。
二期工程已同步规划,将搭载“须臾®”芯片,规划总算力规模突破10000P。中兴通讯为项目提供全栈通信方案,通过标准化加速产业链成熟、降低成本。

华东地区(杭州)首个国产TPU千卡智算集群现场
路线之争
2018年的预判,2026年的验证
在国内AI算力芯片厂商集体涌向通用GPU路线的当下,中昊芯英选择TPU专用架构,源于创始团队的独特基因。杨龚轶凡在硅谷深耕高端大芯片研发设计领域10余年,曾在谷歌作为核心研发人员深度参与TPU v2、v3、v4的设计与研发。2018年末,他带领一批来自谷歌、微软、三星等海外科技公司的AI软硬件设计专家回国创业。
“创业核心目标不是复刻GPU架构,而是打造具备底层架构颠覆性创新的算力芯片。”杨龚轶凡认为。TPU与GPU的本质差异在于设计初衷,GPU架构是为单卡独立运行图形渲染而设计;TPU从底层立项之初,就专门面向大规模深度学习分布式并行运算打造,天然适配万卡级超节点集群。在算力密度上,TPU脉动阵列计算单元密度高于GPU,控制开销更小,能将更多资源集中在计算与通讯上。
全球算力市场中,英伟达早年超80%的垄断格局已被打破,TPU成为除GPU之外全球唯一实现大规模量产和市场认可的成熟算力架构。
尤其关键的是对PD分离(Prefill-Decode分离调度)的原生支持。当前Agent智能体应用爆发,输入Token规模远超输出Token,差距最高可达一万倍。传统GPU实现PD分离需要大量上层软件改造,而TPU底层架构原生适配,落地门槛更低、调度效率更高。

2026WAIC 中昊芯英展台
生态破局
从“可用”到“好用”还有多远?
国产算力芯片突围,绕不开三座大山:软硬件生态薄弱、大模型适配开发难、客户使用门槛高。杨龚轶凡给出明确判断:“过去三年,我们完成了软件从0到1的国产化搭建,下一步目标,是从‘可用’走向‘好用’。”
这一跃迁,需要软硬件双线并进。当前,中昊芯英已完成Qwen全系列、DeepSeek、GLM等主流大模型的深度适配;“须臾®”从指令集、底层IP到全栈软件链路,全部自主研发,核心逻辑层实现100%国产化,自研程度位居国内第一梯队。
同时,杨龚轶凡并不回避短板:“海外头部厂商用二三十年、每年几十亿美元砸出的配套生态,我们只花了一年半搭起基础框架。”他认为,国产算力芯片软件生态走向成熟,至少还需两到三年的持续打磨。这不是追赶,是长期主义的承诺。

2026WAIC 中昊芯英展台
产业变量
做AI界的X86
“我们希望把TPU做成AI界的X86。”这是杨龚轶凡反复提及的愿景。
算力降价,不仅是技术问题,更是产业普及的前提。每一代TPU迭代都能实现2至4倍综合性价比提升。他算了一笔账:当前海外Agent智能体单用户每日算力开销5至10美元,月度成本可达3000美元;若依托国产TPU将单日成本压缩至0.5美元,大量中小企业才有能力规模化使用AI,加速AI向全社会生产力渗透。
对于竞争格局,杨龚轶凡判断未来三至五年国内不会出现大规模价格战,各家核心目标是完善软件生态、迭代芯片、提升性价比。行业核心考验集中在未来两到三年:打磨成熟易用的软件栈,实现先进制程流片量产和按时交付。
从2018年创业到2023年“刹那®”量产,再到2026年“须臾®”发布与华东地区首个国产TPU智算千卡集群落成,八年时间,中昊芯英让TPU这条技术路线在中国从"没人相信"走到"有人跟随"。杨龚轶凡并不担心后来者:"如果国内TPU赛道永远只有我们一家,这个赛道就永远做不起来。"
他真正在意的,是下一代芯片能不能适配好国产模型、再下一代能不能在世界一流玩家中拔得头筹。至于TPU最终是成为一种芯片架构,还是成为像X86那样深入产业肌理的基础设施。这个答案,在接下来每一行代码的优化里,每一次流片的良率中,每一个客户机房的真实负载上。
-END-
本文整合自公开信息,不为商业用途,如有任何问题,敬请与我们联系(微信:global360iot01)。


