
AMD 于美国当地时间 2026 年 8 月 6 日宣布,已就收购专用 AI 推理硅片公司 Taalas 达成最终协议。据公司新闻摘要,Taalas 技术将进一步拉开 AMD AI 路线图的差异化,带来突破性的推理性能与能效;AMD 计划将该技术与 AMD Instinct™ GPU 整合,交付系统级方案。
Taalas 成立于 2023 年,总部位于加拿大多伦多。AMD 表示,其技术针对推理数据流做优化,可显著减轻通用架构在计算与内存上的瓶颈。收购完成后,Taalas 将与 AMD 全栈 AI 平台互补,涵盖 Helios™ 机架方案、Instinct GPU、EPYC™ CPU、ROCm™ 软件及既有 AI 生态。交易尚须满足惯常交割条件与监管审批。
科技媒体The Register 报道称,AMD 此举意在强化 AI 硬件竞争;Taalas 将模型权重直接写入硅片,该路线有望把推理性能提升一个数量级乃至更高。交易于周四收盘时宣布,金额未披露。报道称此为完整收购,而非单纯人才型收购,并提到与英伟达去年 12 月与 Groq 约 200 亿美元授权合作的相似目标——面向 AI 代理、代码助手等场景的高阶推理,追求更快速度与更低成本。
与传统 GPU 不同,也不同于 Groq LPU、Cerebras 晶圆级加速器所采用的数据流架构,Taalas 并不主要依赖 HBM 存放权重,而是将权重蚀刻进硅。The Register 将其概括为模型专用集成电路(model-specific integrated circuit,MSIC)。

2026 年 2 月,Taalas 公布首款基于台积电 6 纳米工艺的测试芯片 HC1。初步基准显示,在 Meta 的 Llama 3.1 8B 上,吞吐可达约每秒 16,960 个 token;按当时公布口径,约为英伟达 GPU 的 48 倍、Cerebras 加速器的 8.5 倍。报道同时指出,以当前标准看 Llama 3.1 已偏旧,该接近光罩尺寸的芯片主要用于验证技术可行性。
实现细节公开有限。目前已知处理器大致分两块:一是写入模型权重的 Mask-ROM Recall Fabric;二是存放 KV 缓存与微调 Adapter 的 SRAM Recall Fabric。
第二代 HC2 计划今夏推出,目标将单芯片参数规模提升至约 200 亿。大模型仍可通过流水线并行将权重分布到多颗加速器:按单芯 200 亿参数粗算,约 50 颗即可支撑约 1 万亿参数模型。AMD 具备机架级平台与系统团队,有条件承载此类配置。The Register 称,相较英伟达新近公布的 LPX 一类系统,在同等模型规模下,Taalas 路径在空间与功耗上更具优势——后者可能需要数十张 GPU,以及至少约 2000 颗 Groq LPU。
据 The Register 了解,AMD 计划将基于 Instinct 的 Helios 机架与 Taalas 技术芯片搭配使用:计算较重的 Prompt Processing 由 GPU 承担,Token Generation 卸载至 Taalas 加速器。报道亦推测,客户或先在 Instinct 上部署并验证模型,确认后再迁移到 Taalas 加速器——目前仍属推测。
AMD 人工智能事业群高级副总裁 Vamsi Boppana 表示,AMD 正在打造全栈 AI 平台,使客户能为不同 AI 负载部署合适的计算方案;Taalas 的技术与工程团队将以差异化的推理性能与能效充实其 AI 组合。Taalas 联合创始人兼首席执行官 Ljubisa Bajic 表示,公司创立初衷是从底层重新思考 AI 推理,围绕模型构建硬件;加入 AMD 将获得规模、工程资源与全球覆盖,以加快创新。AMD 同时称,收购延续其在加拿大半导体与 AI 生态的长期投入,并承诺继续保留、壮大当地人才。
该路线也存在约束。权重刻入硅并完成部署后,芯片即与特定模型绑定;超出 LoRA 一类适配范围的较大改动,往往需要重新改版流片,成本高、周期长。近年来新模型发布频率高,客户若采用该技术,需对所选模型有较高确定性。Taalas 方面称,新模型虽需重做,但不必从零设计,据称仅需修改两层金属,成本和周期可相应降低。The Register 估计,该技术更可能先由模型开发商、其基础设施提供商及部分推理服务商部署;该公司 2 月对 The Next Platform 表示,将权重蚀刻进硅的成本约为训练一个前沿模型的百分之一。
OpenAI、Anthropic、Meta 等均为 Instinct 重要用户。The Register 认为,不排除未来在 Taalas 与 Instinct 组合上部署 GPT 或 Claude 类模型。若能降低每 token 成本并将输出速度再提高一个数量级,也有利于测试时扩展(test-time scaling)——通过更长推理换取准确率——该做法会增加 token 消耗与等待时间。
今日推荐: