由英特尔公司老兵创立的初创公司 Delos Data 周二表示,该公司已筹集 1 亿美元(约7亿人民币,用于开发芯片和软件,以便在人工智能数据中心内更快地传输数据。人工智能数据中心正变得比以往任何时候都更加复杂。
在人工智能蓬勃发展的早期阶段,数据中心通常主要由英伟达的图形处理器(GPU)组成,这些GPU通过英伟达专有的网络技术连接在一起。但随着这些数据中心的重点从训练人工智能系统转向响应用户请求,让人工智能“代理”代表用户执行任务,英伟达的竞争对手,例如Cerebras Systems和AMD,逐渐获得了市场份额。
就连英伟达自身也开始提供多种类型的计算芯片。为了应对这种新型计算芯片的出现,Delos Data 设计了一套复杂的网络芯片和软件,其目标非常简单:帮助数据中心所有者实现所有昂贵计算设备之间尽可能快速的通信,并能灵活适应数据中心所有者现在或将来可能选择的任何计算芯片组合。
Delos Data首席技术官兼联合创始人丹·戴利在一次采访中表示:“我们不知道下一代智能体(AI)的基础设施架构会是什么样子,但我们知道我们可以提供最快捷、最高效的数据传输方式。”
英特尔前首席执行官、现任风险投资公司 Playground 合伙人 Pat Gelsinger 表示,等待数据的计算芯片仍然是人工智能数据中心中最大的金钱和能源浪费之一。Playground 参与了 Delos Data 的融资轮。
“就算我拥有世界上所有的电脑,如果我不能让这些设备有效地相互通信,那我就有很多发热的硬件,白白浪费电,只能闲着没事干,”Gelsinger说。
本轮融资的其他投资者包括 Matrix Partners、Playground、Socratic Partners、Capricorn、Matter Venture Partners、IAG 和 DYNAMIQ。
为人工智能芯片公司提供连接能力
对于初创公司而言,在芯片设计领域与AMD和Nvidia竞争已属不易。机架级架构的兴起更是雪上加霜。公司不仅需要投资芯片设计,还需要投资机械、热学和电源工程,才能将六十多个 AI 加速器集成到一个机架中,使其像一个巨大的 GPU 一样运行。
由前英特尔和 Barefoot Networks 高管资助的初创公司 Delos Data 展示了一款模块化服务器平台,旨在为芯片初创公司提供快速实现机架规模化的途径。向机架式架构迁移的一大挑战在于,设备端需要启用大量的网络功能。
一个典型的八GPU HGX节点,每个GPU只需要一到两个端口。相比之下,GB300 NVL72每个GPU则需要18个400Gbps端口。英伟达和AMD都开发了集成背板、电源和散热功能的定制机架。
相比之下,Delos的设计则相对简单,其机箱从正面看更像是一台交换机,而不是一台GPU服务器。它配备 36 个 OSFP 端口,系统核心的四个 OAM 插槽每个插槽分配 9 个端口。
如果您不熟悉 OAM,它是一种开放式插槽,通常用于高性能加速器,这些加速器需要比标准 PCIe 卡更高的互连带宽和供电能力。假设采用 200 Gbps 的 SerDes,则每个芯片的互连带宽可达 3.6 TB/s,与英伟达新款 Rubin GPU 的性能相同。OSFP 意味着客户可以根据其扩展域的规模,使用标准 DAC 或可插拔收发器和交换机。
虽然 OSFP 通常与以太网联系在一起,但实际上几乎任何协议都可以通过它传输,无论是 UALink、Ultra Ethernet、PCIe 还是其他协议。从部署角度来看,这些系统的布线方式与其他超大规模系统类似,只是密度要高得多。
对于寻求可扩展参考设计的芯片初创公司而言,Delos并非唯一选择。例如,AWS似乎正在将Nvidia的MGX外形尺寸重新用于其Trainium 3机架系统,而AMD的Helios机架现在已成为OCP标准。理论上,这两种设计都更易于维护,但Delos认为其模块化设计提供了更大的灵活性。“这使得它的灵活性更高,你可能想要一个可扩展到 100 的规模,也可能只需要一个规模,”首席技术官丹·戴利指出。 “这完全取决于你想连接多少根线缆。这也允许你连接到不同类型的交换机……可以是更简单的交换机,甚至是光路交换机 (OCS)。”
利用博通或Marvell现有的分组交换机,这种设计可以在单层交换结构中支持512到1024个加速器,具体数量取决于您使用的是200 Gbps还是100 Gbps的SerDes。使用多层交换结构、OCS和/或2D/3D环面,计算域可以进一步扩展,所有这些都可以在使用现成组件的情况下完成。
虽然 OSFP 保持了简单易用,但也意味着对于需要可插拔光模块的大型计算域来说,功耗可能会成为一个问题。事实上,这就是英伟达迟迟未能采用光学扩展技术的原因。铜线虽然传输距离有限,但功耗却低得多。
Delos 首席执行官 Ed Doe表示,该公司已经在探索该系统的版本,这些版本将使用近封装或共封装的光学器件,并通过 MPO 式连接器而不是 OSFP 连接器进行连接。
这家初创公司并非只做硬件。任何做过大规模网络的人都知道,物理拓扑和逻辑拓扑——也就是设备在网络上相互通信的方式——会根据工作负载的不同而有很大差异。Delos 开发了一个软件编排平台,旨在简化这些交换结构或网状网络的配置和监控,以便在链路发生故障时能够动态重新路由流量。
此前,Delos 展示了其名为 Nonstop AI 网络的这款软件平台,与会者可以随机拉取链接,并看到网络做出反应并自动纠正自身。 该公司的雄心壮志不仅限于网络编排和系统。据称,Delos 正在研发其他产品,虽然我们尚不清楚具体内容,但基于商用芯片的高基数交换机设计无疑将与其 Nonstop AI 系统形成互补。