公众号记得加星标⭐️,第一时间看推送不会错过。
初创公司 d-Matrix 的工程师们在过去七年中,一直在构建一个软硬件结合的平台,旨在加速 AI 推理工作负载并降低成本。自 2019 年成立以来,该公司一直专注于推理,“当时甚至没有多少人知道推理是什么,”联合创始人兼首席执行官 Sid Seth 表示。
自那时起,对更快推理的需求呈爆发式增长。随着过去一年中像 Anthropic 的 Claude Code 等 Agentic AI(智能体 AI)工具的崛起,以及 OpenClaw 的引入,推理工作负载已超出 Nvidia 和 AMD 等公司的 GPU 独立处理能力的极限。
“在过去 12 个月中,许多不同应用对低延迟推理的需求迎来了爆发,”Seth 在本周的媒体与分析师简报会上表示。“现在,随着网络安全应用的到来,对低延迟 Token 的需求极大。正是因为低延迟推理的爆发,对推理的需求才真正飙升。”
经过七年的研发,在获得包括微软 M12 风险投资部门在内超过 5 亿美元资金支持的 d-Matrix,于今年 6 月推出了其首款推理加速平台 Corsair。该平台采用了以内存为中心(memory-centric)的方法,高管们声称这能帮助运行推理工作负载的速度比单用 Nvidia GPU 快十倍。
现在,Corsair 正与 Nvidia 的“Blackwell”GPU 加速器一同集成在同一个机柜中。
这种 XPU 将 SRAM 或 3D-RAM 等内存与同一机柜中的 GPU 和 CPU 紧密结合,以加速 Token 的生成并降低相关成本。在解耦(disaggregated)环境中,GPU 最适合处理推理工作负载中计算密集的 Prefill(预填充)阶段(即处理上下文 Token 的阶段);而 Corsair 与 Nvidia 的 Groq 3 LPX 加速器类似,更擅长 Decode(解码)阶段,即 AI 模型生成代码,或对来自人类或其他模型查询生成其他类型响应的阶段。
基于今年 4 月对 GigaIO 数据中心业务的收购,d-Matrix 还推出了与 Arista Networks、Broadcom 和 Supermicro 共同构建的 SquadRack 参考设计。
“我们的整个方法都建立在利用人们投入到我们计算中的资金做更多事情的原则之上,”Seth 说。“我们能够运行非常非常快的计算。我们用极少的时间完成更多的推理,并且通过以内存为中心的计算打造了一个非常节能的解决方案。这让我们能够用更少的资源——资金、时间和能源——做更多的事。随着时间的推移,我们希望能够缓解建设更多数据中心的需求。”
随着 Corsair 上市已有数月,d-Matrix 目前正在讨论其后续产品 Raptor 平台。d-Matrix 在最近的 Hot Chips 2026 大会上详细介绍了该平台,并将包含多层堆叠高规格 DRAM 的 Lightning 平台提上了路线图。Raptor 将于今年年底流片,并在 2027 年第四季度发布,它包含一个 3D-RAM 加速器,采用台积电(TSMC)制造的 4 纳米计算裸片(compute die),以 36 微米间距熔合(fused)在定制的 DRAM 裸片之上,可提供 100 TB/s 的带宽。

在 Raptor 上,d-Matrix 使用了一种目前用于 HBM 封装的 CoWoS(晶圆级芯片封装)变体技术。它将一个 DRAM 内存芯片和一个 SRAM 计算芯片结合在一起。
与 Nvidia 的新合作关系将帮助 d-Matrix 将其影响力延伸至企业和 HPC 数据中心、AI 实验室、超大规模数据中心、大型云建设商以及新晋云服务商。周四宣布的这一合作,将使 d-Matrix 的 Raptor XPU 平台能够通过 Nvidia 的 MGX 参考架构进行部署,并作为 Nvidia AI 工厂方案的一部分。Seth 表示,Raptor 需要一个“容身之所”,虽然构建自己的液冷机柜也是一种选择,但 Nvidia 拥有现成的生态系统。
“我们认为,这是将 d-Matrix 正在构建的这项令人惊叹的突破性技术以快速规模化推出市场的最快方式,并且有强大的供应链作为后盾,合作方也在全球每个数据中心都有部署,”他说。
该合作还将涵盖 d-Matrix XPU 的未来版本,包括 Lightning。
Nvidia 的 AI 工厂业务正在迅速扩张。在公布公司 2027 财年第二季度财报时,执行副总裁兼首席财务官 Colette Kress 表示,AI 工厂平台的营收潜力已从 2022 年“Grace-Hopper”机柜级系统的每吉瓦约 180 亿美元,增长到如今即将推出的“Vera-Rubin”系统的每吉瓦 400 亿美元。这正是 d-Matrix 正在参与的巨大市场机遇。
d-Matrix 计划的关键在于 NVLink 和 NVSwitch,这是 Nvidia 的高速互连技术,用于将其 GPU、CPU 和其他加速器一致性地连接到其机柜级 MGX 架构上。该架构包括 Vera CPU、Rubin GPU、Bluefield-4 DPU、Spectrum-X 以太网络和 ConnectX-9 SuperNIC。
d-Matrix 将使用相同的 NVLink 计算托盘(如下文左图所示),但其中放置的不是 Vera-Rubin 芯片,而是 Raptor XPU 以及 Nvidia 的 Vera CPU 和 Bluefield DPU,并使用 ConnectX 和 Spectrum-X 网络进行外向扩展(scale out)。它将插入右侧的液冷 NVL144 MGX 机柜中,d-Matrix 将使用 NVLink 交换机托盘。机柜本身将容纳 144 个 Raptor XPU。

该机柜内部每张卡还集成了 2.3 TB 的 3D 堆叠 DRAM 高速内存,运行速度达 100 TB/s,单个机柜的聚合内存带宽可达 7.2 PB/s。此外,还可以选择将 Raptor 机柜作为运行 Vera-Rubin GPU 的 Nvidia 机柜的配套扩展使用。

“这种解决方案的妙处在于,我们将 Raptor 托盘直接插入到已广泛部署在许多数据中心中的同款 NVL144 MGX 机柜架构中,便能立即进入这些数据中心,”Seth 表示。
在 Hot Chips 大会上,d-Matrix 展示了在单机柜 Raptor 芯片上运行两个 AI 模型(智谱 AI 的 GLM 5.2 和月之暗面的 Kimi K3)的结果(如下所示)。在 GLM 5.2 上,d-Matrix 取得了每用户每秒约 3,000 个 Token 的性能,而 Kimi 模型达到了每用户每秒 1,000 个 Token。Seth 指出,厂商可以将这一规模扩展跨越 8 个机柜。

Nvidia 数据中心 GPU 业务的主管产品营销经理 Jesse Clayton 表示,与 d-Matrix 的合作体现了 Nvidia 的架构设计路线,他将这一平台称为“完全可替换”且“垂直整合,但水平开放”。厂商基本上可以根据自身需求使用 Nvidia 技术栈中的任意部分(该技术栈也包括 Groq 3 LPX 加速器机柜),同时插入自己的产品。NVLink Fusion 端口为其他芯片打开了接入该平台的大门。
参考链接
https://www.nextplatform.com/compute/2026/09/10/startup-d-matrix-will-pair-its-raptor-memory-based-xpu-to-nvidia-rackscale-iron/5295601
*免责声明:本文由作者原创。文章内容系作者个人观点,半导体行业观察转载仅为了传达一种不同的观点,不代表半导体行业观察对该观点赞同或支持,如果有任何异议,欢迎联系半导体行业观察。
END
今天是《半导体行业观察》为您分享的第4527期内容,欢迎关注。
推荐阅读
★
★
★
★
★
★
★
★

加星标⭐️第一时间看推送~


