十年坚持自研GPU IP,速显微杀进具身智能GPU赛道

半导体行业观察 2026-07-31 08:25

导语:


“上层保守,是为了让客户敢用;底层激进,是为了让产品有机会赢。”——项天。


2015年,当速显微电子创始人、董事长兼CTO项天与联合创始人、总经理王攀离开校园创业时,国内GPU产业还远没有今天这样喧嚣与热闹。


两人是中国科学技术大学2005级同班同学,又在2014年同一年博士毕业。项天早在2012年就对GPU产生兴趣,但彼时摆在这支年轻团队面前的现实是:相关人才和产业基础都较为薄弱,市场对GPU的认知主要停留在游戏显卡,资本也很难理解一家初创企业研发GPU的商业价值。


真正让这支团队找到切入口的,是汽车电子产业的一次结构性变化。


那时,新能源汽车刚刚兴起,传统机械仪表开始被液晶屏取代,市场需要一种既能承担控制任务、又具备图形渲染能力的芯片。于是,他们便把GPU放进MCU,从汽车仪表的液晶化和图形化需求切入。这个足够细分、又尚未被完全占据的市场,成为速显微进入GPU产业的第一块落脚点。


从2015年到2019年,团队用了四年时间从GPU IP底层研发开始做起,进行第一代GPU技术研发。2019年,速显微量产了GC9003,这是全球首款集成GPU功能且能跑3D图形的车规级MCU芯片。此后几年,公司围绕这条路线持续迭代,将产品逐步拓展到汽车、家电、工业控制和医疗设备等市场,并形成了以图形渲染为核心的GPU MCU产品体系。


而就在2026 年 7 月 25 日,速显微电子正式对外宣布了一项重大的战略转型——重磅发布面向边缘AI和具身智能的首款GPGPU SoC——TH1100,以及自主研发的TUCA统一计算架构。


那么,在英伟达定义的计算世界之外,国内GPU究竟应该依靠什么,赢得下一场竞争?在速显微新启用的天津津南区总部,近两个小时的深度对话中,这对从同窗走向创业伙伴的硬核搭档,给出了一份充满工程智慧与务实哲学的答卷。


十年坚持自研GPU IP,速显微杀进具身智能GPU赛道图1

速显微电子创始人、董事长兼CTO项天


1

从汽车仪表到机器人,

技术“上楼”,组织补强


从嵌入式渲染类GPU跨向具身智能GPGPU,乍看之下像是一次幅度巨大的业务转型。


但在两位创始人的技术规划里,渲染从来不是终点。王攀把这条路线比作盖楼:图形渲染是“一楼”,通用计算和AI是“二楼”。GPU最初服务于图形渲染,随后才逐步扩展到通用计算和AI。只有自己把一楼从地基开始盖起来,才有能力继续向上搭建。


十年坚持自研GPU IP,速显微杀进具身智能GPU赛道图2

速显微联合创始人、总经理王攀博士


过去十年速显微一直在正向自研全栈GPU技术的路线上前进。项天将公司过去十年的工作概括为两个阶段:第一阶段在物联网场景的渲染GPU赛道上完成0到1的「技术-产品-市场」闭环;第二阶段继续推进全栈GPU技术研发,并在具身智能等端侧AI领域实现第二曲线。技术预研一代、产品定义一代、市场量产成熟一代。


变化出现在2020年前后。随着Transformer架构和大模型技术逐渐成熟,GPU的应用重心开始从图形渲染进一步转向AI训练和推理。对于速显微而言,经过多年技术积累新一代产品正好能匹配当前的市场需求,也由此获得了明确的第二曲线应用方向——将自研GPU能力用于端侧大模型推理。


从2021年至2022年前后开始,速显微在已有技术基础上开始GPGPU技术研发,包括计算架构、软件栈和产品方案的研发。到2025年,公司完成这一代GPGPU IP和CUDA兼容的研发,并开始推动相关技术从验证走向芯片产品。


对于一家从零开发GPU IP的企业而言,第一代产品GC系列不仅打通了车规级芯片的供应链与品质管控体系,更让速显微实现了从“GPU IP”到“图形开发生态”的自研闭环,为后续研发大算力 GPGPU 积累了关键的系统工程经验。从汽车仪表到智能家电,再到今天的端侧大模型,变化的是产品的应用对象,不变的是底层GPU技术路线。


十年坚持自研GPU IP,速显微杀进具身智能GPU赛道图3


2

具身智能场景越复杂,

通用GPU的价值反而越突出



今天的AI芯片市场并不缺少技术路线。GPU之外,还有NPU、ASIC、可重构架构、存算一体芯片以及针对特定模型设计的专用加速器。专用架构通常可以减少冗余硬件,在确定的算法和算子上获得更高的面积效率和能效比。


那么,在具身智能时代,为什么还要继续做通用GPU?


王攀给出的判断是:专用芯片能够成立,需要两个前提——算法足够稳定,市场规模足够大。CNN时代,人脸识别、语音识别等算法结构曾经相对稳定。芯片企业可以围绕卷积计算等设计固定的数据流和计算单元,在特定场景中取得优于通用处理器的性价比。假如未来大模型的框架、算子和计算模式在某个领域的应用也完全稳定下来,ASIC同样可能在部分市场取代GPU。


问题在于,当前的大模型仍处于高速演进期。模型架构、注意力机制、量化方式、稀疏策略和推理框架不断变化。一个为特定模型打造的架构,可能在推出时非常高效,也可能在模型范式发生变化后迅速失去优势。


具身智能又进一步放大了这种不确定性。“具身智能”看似是一个统一概念,实际上覆盖了人形机器人、四足机器人、轮式机器人、医疗设备、工业机械臂、无人机、3D打印设备等大量差异悬殊的产品。它们使用的传感器不同,自由度不同,控制周期不同,模型结构和任务链条也不同。


一个只有十个自由度的设备,与一个拥有数十个自由度、同时处理视觉、声音、点云和运动控制的人形机器人,几乎不可能采用完全相同的计算负载。


更关键的是,具身智能市场尚未形成汽车那样高度标准化的百万级单一品类。一种机器人即便累计销售数百万台,也可能被拆分成十几个细分型号。假如一颗先进制程专用芯片需要数亿元研发投入,而单一品类只有十万至一百万台销量,研发费用摊到每台设备上,可能已经超过芯片本身的制造成本。


因此,在算法持续变化、场景高度碎片化、单一品类规模有限的阶段,GPU的通用性本身就是一种风险对冲。它允许客户在同一套硬件上切换模型、更新算子、组合不同任务,也允许芯片厂商以一套基础架构覆盖更多市场。


由此可以得到一个看似反常识的结论:具身智能在“早期算法迭代快”与“中后期应用场景分散、缺乏统一标准”的阶段,通用计算平台的价值反而越大;只有当模型、场景和出货量同时趋于稳定,专用芯片的成本优势才可能充分释放。


3

“生态就是人性”,

国产GPU首先要让客户敢用



在国产GPU讨论中,“兼容CUDA”是当下大多数国内GPU企业的主流选择,但这经常引发两种截然不同的评价:一种观点认为,CUDA已经成为全球AI计算的事实标准,兼容它是国产芯片进入市场的最短路径;另一种观点则认为,过度依赖CUDA习惯,可能限制自主软件生态的发展。


速显微也是兼容CUDA的选择者之一,项天将这种选择概括为对客户的敬畏。


十年坚持自研GPU IP,速显微杀进具身智能GPU赛道图4


在他看来,端侧产品首先要解决的不是“架构是否足够新”,而是“客户是否愿意用”。开发者已经在CUDA环境中积累了模型、代码、算子、调试方法和工程经验,要求客户为了更换一颗芯片,重新学习语言、改写代码、重建工具链,本质上是在把芯片公司的创新成本转嫁给用户。


他有一句非常直白的判断:“生态是什么?生态就是人性,尽量不要挑战人性。”


这句话背后的含义是,软件生态不是一张静态的功能清单,而是一套由开发习惯、工程经验、人才供给和第三方工具共同形成的网络效应。使用者越多,问题越容易被发现;工具越成熟,迁移成本越低;迁移成本越低,又会吸引更多开发者。芯片企业即使在单项性能上取得优势,也很难仅凭硬件打破这一循环。


但兼容CUDA并不意味着直接使用英伟达的指令集。根据项天的介绍,速显微自研了GPU底层指令架构,并在其上开发编译器、运行时、计算库和框架适配层,通过软件映射实现对CUDA编程接口和主流计算库的兼容。其TUCA统一计算架构覆盖编程接口、编译优化、运行时调度和加速库,并适配PyTorch、TensorFlow、vLLM和Triton等工具。


速显微的原则是“绝不牺牲易用性,让开发者实现零门槛迁移。”为了践行这一理念,速显微的工程团队前后隐忍投入了长达五年的时间,打造出了一套全栈自主可控的底层计算架构——雷神统一计算架构(TUCA, Thorsianway Universal Computing Architecture)。


十年坚持自研GPU IP,速显微杀进具身智能GPU赛道图5


TUCA 在底层实现了 CUDA API 的完整映射。开发者此前在 CUDA 生态下撰写的代码、训练好的模型参数以及调优完毕的工具链,迁移至速显微的芯片上时无需重写,编译一次即可直接运行。


目前,速显微已完成了主流核心计算库的完整兼容适配,包括但不限于:cuBLAS(基础线性代数子程序)、cuDNN(深度神经网络加速库)、cuFFT(快速傅里叶变换库)。在主流 AI 框架与推理引擎方面,TUCA 实现了对 PyTorch、TensorFlow、vLLM 推理引擎以及 Triton 编译框架的原生支持。这意味着无论是经典卷积神经网络(CNN),还是如今主流的 Transformer 架构、点云检测及双目深度算法,均可实现无缝平滑部署。


为了打破国产芯片“开发环境搭建复杂、驱动配置繁琐”的痛点,速显微还推出了TUCA Playground 在线编译运行平台。开发者无需在本地安装任何 SDK 或驱动,直接打开浏览器即可在线编写、编译并运行 TUCA 内核代码,极大地降低了试用与评估的门槛。


此外,在商业合规与生态拓展层面,TUCA 的核心组件采用了极为开放的 MIT License 开源协议。这种极致开放的策略,允许下游客户与开发者自由进行二次开发、修改及商业化分发,试图以高度的开放性去瓦解封闭生态的壁垒。


速显微所说的“保守”,并不是放弃自主,而是尽量不让自主创新以改变客户习惯为代价。


4

“上层保守、底层激进”,

是国产GPU的一种现实解法


如果在体系结构和软件接口上保持兼容,国产GPU又靠什么形成差异化?


项天的回答是,把创新继续向下压,深入到晶体管、器件、互连、存储和数据搬运层,在有限工艺条件下尽可能释放算力潜力。


在先进制程持续演进的时期,芯片性能提升很大程度上可以依赖晶体管密度增加:在相同面积中集成更多计算单元,或者在相同功耗下获得更高频率。但当国内企业无法自由使用最先进制程时,单纯复制海外厂商的体系结构,很难得到相同的性能和能效。


速显微的思路不是大幅改变开发者看到的GPU模型,而是在兼容通用GPU体系结构的基础上,重新优化底层器件与上层计算之间的关系:缩短信号传输时间,减少数据搬运,提升单位晶体管的有效工作比例。


这构成了速显微公司的技术哲学:上层保守,底层激进。在开发者能够看到的软件接口和编程习惯上尽可能“保守”——兼容成熟生态,减少模型迁移和客户学习成本;而在开发者看不到的GPU IP、存储器件、互连和数据搬运层面,则选择更为激进的创新。


上层保守,是为了让客户敢用;底层激进,是为了让产品有机会赢。


而在这条底层创新路径中,最关键、也最难绕开的战场,是存储


5

端侧大模型最昂贵,

不一定是计算,而是搬数据



不久前的 Dell World 上,NVIDIA CEO黄仁勋曾直言不讳地指出:“当前AI产业最大的制约因素根本不是GPU算力本身,而是存储与数据流动。”GPU在大部分时间里,其实都在漫长地等待数据传输。


大模型推理也具有明显的存储密集特征。计算单元需要不断从存储系统读取模型权重、中间结果和KV Cache。即便芯片具备很高的峰值算力,如果数据无法及时送达,计算单元仍会处于等待状态。与此同时,片外DDR、HBM与计算芯片之间的数据传输也会消耗大量能量。对于受电池、散热和体积约束的机器人,这些数据搬运成本往往比云端服务器更加敏感。


因此,王攀认为,端侧AI芯片的关键矛盾,正在从单纯的计算够不够快,转向计算和存储是否平衡。


速显微提出的第一种思路,是把存算技术融合进GPU IP内部,称为“算中存、存中算”。


与在GPU之外增加独立存算加速器不同,其目标是在GPU内部的数据路径和存储层级中引入存算能力,减少数据跨芯片、跨模块往返搬运。由于GPU IP为正向自研,设计团队可以从底层调整架构,而不是在既有IP外部叠加一个新的计算模块。


这一方案试图同时保留两种能力:在上层继续运行通用GPU和CUDA生态,在底层获得存算技术的能效优势。


第二种更激进的设想,是将大模型中长期不变的参数固化到与GPU深度集成的高密度ROM中。


十年坚持自研GPU IP,速显微杀进具身智能GPU赛道图6


传统系统会把模型权重放在外部DDR或HBM中。速显微的思路,是把一部分相对固定的模型参数直接放进主芯片内部,从而降低片外存储容量、封装和互连带来的成本与功耗。其研发方向还包括提高ROM的三维存储密度,使其能够容纳远大于传统启动程序的参数规模。


当然,这种方式的优势和缺点都十分鲜明。优势是密度、成本和读取效率;缺点是参数固化后难以修改。因此,它不适合需要频繁更新全部权重的模型,却可能适合模型版本稳定、设备功能固定、生命周期较长的工业设备。另一种方式则是把长期不变的基础参数固化,只把需要动态更新的参数保留在DDR或HBM中,形成混合存储结构。


这就给我们提出了一个非常重要的产业问题:当大模型进入端侧,是否还应该沿用“所有参数都放在昂贵的可改写存储中”这一默认架构?


云端模型强调灵活更新,端侧设备则可能运行多年,承担高度固定的任务。如果模型趋于稳定,部分参数的“不可变”可能不再只是缺点,而会成为降低成本的工程条件。这也说明,端侧AI不会只是云端GPU的缩小版。它可能催生完全不同的计算、存储和封装组合。


6

速显微的硬核“答卷”:TH1100



在这样的技术判断下,速显微推出了在具身智能领域的第一颗GPGPU芯片——天衡(TH)系列TH1100。


TH1100是一颗面向边缘AI推理的异构GPGPU SoC,TH1100 集成了6 个SXGPU核心。CPU侧采用8核Cortex-A55。片上同时集成了ISP图像信号处理器和安全加密引擎,构建了完整的SoC功能体系。


芯片支持FP32、FP16、FP8、INT8、INT4和FP4等多种计算精度,在FP4稀疏模式下峰值达到 98.2 TOPS,FP16稠密算力12.3 TFLOPS,全面覆盖从低精度量化推理到中高精度计算的任务需求。内存子系统最高可配置128 GB容量,峰值带宽85.3 GB/s。这使得单芯片即可承载35B-A3B参数级大语言模型的全量推理,同时满足长序列KV Cache和多任务并发的内存需求。


十年坚持自研GPU IP,速显微杀进具身智能GPU赛道图7


针对具身智能与机器人对多传感器接入的苛刻需求,TH1100提供了极为充沛的物理接口:4 路 4-lane MIPI CSI 接口,1路 4-lane MIPI DSI 显示接口。多达 6 路千兆以太网接口,能够直接挂载激光雷达、毫米波雷达、超声波传感器及各类工业总线设备,省去了额外的交换机芯片成本。


项天将其定义为第二个十年的“打基础产品”。按照公司披露的规划,TH1100计划于2027年推进大规模量产及交付。


在天衡系列规划中,TH1100之后还包括面向高性能机器人和自动驾驶域控的TH1800,以及面向更高算力场景的TH24K0。整体算力规划覆盖100T至4000T。公司的策略并不是第一步就追求最大算力,而是“小算力先量产、大算力随后跟进”:先通过相对成熟的产品跑通供应链、客户导入和软件生态,再逐步把存算融合、参数固化等底层技术导入更高算力产品。这是一种典型的工程化思维。


十年坚持自研GPU IP,速显微杀进具身智能GPU赛道图8


7

重塑IC认知:“芯片公司是服务业”



在整场交流中,项天和王攀提出了一个颇具冲击力的观点:IC公司不是单纯的制造业,而是服务业。这句话看似弱化了芯片技术,实际上重新定义了芯片公司的交付边界。


传统成熟芯片市场往往已经拥有完整方案。客户拿到数据手册、参考设计和开发板,就可以在原有产品中完成替换。但端侧大模型和具身智能仍处于拓荒期,很多工业企业有明确的智能化需求,却没有模型团队,也没有能力自行完成数据整理、算法开发、推理优化和硬件适配。


这时,芯片企业只交付一颗芯片,往往意味着没有真正完成交付。


王攀认为,AI芯片公司在早期必须“自带方案”。它甚至会暂时看起来像一家方案公司:帮助客户定义问题、构建模型、开发软件、适配硬件,再把软硬件作为完整系统交付。这种工作很重,却也是芯片定义、生态建设和客户壁垒形成的过程。


速显微过去十年主要面对汽车、家电、医疗和工业客户。其第一代渲染产品并不是等待客户自行开发,而是配套图形工具、参考方案和应用支持。这种to B经验也被带入到了AI业务:团队提前进入垂直行业,把算法、模型和硬件调通,再向客户交付相对完整的系统。


在发布会上,项天介绍了TH1100这类处理器在通用算力的一个实践——智能口腔一体机。该设备面向口腔诊疗,可借助AI对患者相关数据进行测量和分析,并直接生成量化结论。从患者建档、资料上传,到AI报告生成,再到向工厂发送耗材订单,整个流程可以实现自动化闭环。而且这类模块并不局限于牙科,还可以通过在线升级和模型迭代,进一步延伸至其他科室的诊疗与病患场景。


十年坚持自研GPU IP,速显微杀进具身智能GPU赛道图9


两位创始人判断,端侧AI最先落地的场景,未必是能够在开放世界自由行动的人形机器人,而可能是三类边界更加清晰的任务:一类是流程能够被文字、图纸或程序完整描述的工作,例如数控设备操作;一类是依赖专业经验、但输入输出相对标准化的医疗和检测任务;还有一类是在固定空间内运行、突发情况较少的物理设备,例如封闭产线、机械爪和3D打印系统。




写在最后




从2015年在GPU赛道悄然起跑,到2026年落地天津津南、走向聚光灯下,速显微电子十年默默坚守。在全球先进制程壁垒耸立、行业急需寻找系统能效突破口的今天,速显微选择了一条更加务实且深刻的道路:将创新扎实在物理层(器件级突破),开放于生态中(TUCA 与兼容 CUDA),落脚在体验上(具身智能与端侧大模型)。


随着TH1100的落地与后续大算力天衡芯片的推向市场,这家国产GPU老兵不仅为具身智能产业构建了一个新的端侧算力底座,也为国产芯片如何在制程、生态与商业化的多重约束下寻找差异化突破,提供了一条值得持续观察的探索路径。


(本文封面由AI生成

*免责声明:本文由作者原创。文章内容系作者个人观点,半导体行业观察转载仅为了传达一种不同的观点,不代表半导体行业观察对该观点赞同或支持,如果有任何异议,欢迎联系半导体行业观察。


END


今天是《半导体行业观察》为您分享的第4484内容,欢迎关注。


推荐阅读


十年坚持自研GPU IP,速显微杀进具身智能GPU赛道图10


加星标⭐️第一时间看推送


求点赞


十年坚持自研GPU IP,速显微杀进具身智能GPU赛道图11

求分享


十年坚持自研GPU IP,速显微杀进具身智能GPU赛道图12

求推荐


十年坚持自研GPU IP,速显微杀进具身智能GPU赛道图13

关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。
GPU IP
more
GPU为什么总在等最慢的请求?BlockServe 把扩散 LLM 吞吐拉高 10.6 倍
AI 的下一场竞争,不再只是 GPU,而是数据流与内存架构
GPU之外,清微智能押注一条硬路
国产GPU随力箭一号入轨,太空智算迈出关键一步
吴新宙谈英伟达B面:GPU并非无限供应,智驾团队靠优先级争算力
AI 的下一道瓶颈可能不是 GPU 和存储,而是半导体设备
RISC-V的全功能GPU突围!风华创智重新定义国产AI算力边界
这款芯片,比英伟达A100 GPU快478倍
WAIC对话星环科技CEO:把数据库“户口”迁到GPU上,AI Agent推理不再干等
跳出GPU路线,清微智能的可重构“破局”之路
Copyright © 2025 成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号