

超威半导体董事长兼首席执行官苏姿丰。图片来源:DIGITIMES
超威半导体(AMD)正通过收购Taalas扩大其AI推理技术版图。AMD于8月6日宣布已与这家加拿大AI芯片初创公司达成最终收购协议,计划把Taalas的模型专用推理技术纳入自身加速器路线,并与Instinct GPU形成系统级组合。Taalas的核心思路与主流GPU明显不同:它试图把模型结构、参数和权重直接固化到硅片中,以减少模型运行时对外部高带宽存储器(HBM)、复杂先进封装、3D堆叠和液冷系统的依赖。这并不意味着AMD将放弃GPU或HBM路线,而是反映AI推理市场正在从单一通用计算架构,转向针对不同负载并行发展的多种硬件形态。
“模型即计算机”:把权重从外部存储搬进芯片
Taalas由前AMD和英伟达芯片架构师Ljubisa Bajic创立,其技术理念可以概括为“The Model is The Computer(模型即计算机)”。传统AI推理通常把模型权重存放在HBM或其他外部存储器中,计算芯片需要持续读取参数,因此系统性能不仅受计算单元限制,也受到内存带宽、数据搬移能耗和I/O效率制约。Taalas则采用模型专用ASIC思路,把基础模型的大部分结构和权重直接固化进芯片物理结构。
在其公开架构中,基础模型权重主要通过掩膜ROM存储结构固化,KV缓存和微调适配器则保留在SRAM中。这样可以显著缩短权重读取路径,并把“存储”和“计算”之间的边界压缩到单颗芯片内部。Taalas因此宣称其系统不依赖HBM、先进封装、3D堆叠、高带宽外部I/O和液冷。这里的“不依赖”指其专用推理架构的设计目标,并不等同于整个AI产业将放弃这些技术。
HC1展示极高推理速度,但性能数据仍需第三方验证
Taalas首款HC1技术演示芯片采用台积电6纳米制程,官方资料显示晶粒面积约815平方毫米、集成约530亿个晶体管,服务器功耗约2.5千瓦。其Llama 3.1 8B专用芯片可达到约1.7万tokens/s/user。原文援引Taalas数据称,HC1相较其英伟达GPU基线快约48倍,相较Cerebras对比系统快约8.5倍。
这些指标具有较强吸引力,但均来自Taalas自测或由Taalas选取的对比基准,不能直接视为独立第三方结果。不同平台的输入长度、批量规模、量化精度、功耗和服务质量要求都会显著影响推理性能,因此更合理的观察重点是:模型专用硬件能否在稳定、高并发且模型版本变化较慢的业务中持续提供更低时延和更低单位推理成本。
不使用HBM的代价,是牺牲通用性与模型更新自由度
Taalas的优势来自极端专用化,也因此存在明确代价。GPU可以通过软件加载新模型、修改权重或更换算法,而模型固化芯片如果需要切换到差异较大的基础模型,通常必须重新设计并制造新版本芯片。换言之,它把软件灵活性换成了硬件效率。
第一代HC1还采用了较激进的低比特量化方案,Taalas承认相较GPU基准存在一定模型质量损失。公司计划在第二代HC2采用更标准的4位浮点格式,以改善精度,同时继续提高密度和执行速度。Taalas还表示,从拿到一个此前未见过的模型到完成定制硅片,目标周期约为两个月;这一快速转化能力如果能够稳定复制,将决定模型专用ASIC能否突破传统定制芯片开发周期过长的限制。
AMD收购Taalas并非替代Instinct,而是补齐推理专用层
AMD官方明确表示,Taalas技术将补充其全栈AI平台,包括Helios机架级系统、Instinct GPU、EPYC CPU、ROCm软件及更广泛的AI生态。AMD计划把Taalas技术整合进未来加速器路线,并开发与Instinct GPU协同的系统级解决方案。
这与苏姿丰在Advancing AI 2026上的思路一致:AI负载不存在“一颗芯片适用于所有场景”的答案。通用GPU仍适合快速变化的前沿模型、训练和灵活推理,而模型专用芯片更适合高调用量、模型相对稳定、对单位token成本和时延极为敏感的业务。AMD此前还宣布让Helios与Cerebras AI计算技术组合用于混合推理,进一步说明其策略正在从单一处理器竞争,转向多类型计算引擎的系统级编排。
产业观察:专用推理芯片不会终结HBM,但会重新划分其价值边界
Taalas最值得关注的地方,并不是“是否淘汰HBM”,而是它把AI推理中的内存墙问题重新定义为架构问题。主流GPU通过更高带宽HBM、先进封装和3D堆叠不断扩大数据供给能力;Taalas则选择把模型权重固定在芯片内部,从源头减少外部内存访问。两种路径分别强调通用性和专用效率,并不存在简单的替代关系。
如果未来AI推理市场出现大量长期稳定、调用规模极高的模型,模型专用ASIC可能在推荐、搜索、代码生成、企业智能体或特定推理服务中获得显著成本优势。但对于模型持续升级、参数频繁变化或需要多模型共享同一硬件的平台,HBM与可编程GPU仍具备不可替代的灵活性。因此,AMD收购Taalas更像是在为AI推理市场分层提前布局:一端继续依靠Instinct、HBM和先进封装服务通用高性能计算,另一端则尝试用模型专用硅片换取极低时延和更高能效。未来竞争的核心将不是哪一种架构“胜出”,而是谁能为不同AI负载匹配最合适的计算、存储和系统成本结构。

