理解CXL之二:系统网络与生态!

SSDFans 2026-09-22 09:13
理解CXL之二:系统网络与生态!图1


点击蓝字
关注我们



因为公众号平台更改了推送规则。记得点下右下角的大拇指“赞”和红心“推荐”。这样每次新文章推送,就会第一时间出现在订阅号列表里。

因为公众号平台更改了推送规则。记得点右下角的大拇指“赞”和红心“推荐”。这样每次新文章推送,就会第一时间出现在订阅号列表里。



从单个设备到整个系统网络——CXL 1.1 →2.0 →3.x

理解CXL之二:系统网络与生态!图2

自2019年1.0版本发布以来,CXL发展迅速。每个版本新增的功能最终都指向同一个方向:

让内存能够被放置得更远、容量更大,并由更多主机共享。

下面来谈谈每个版本中的关键变化。

CXL 1.1—直接连接至单个主机  

这是最基础的形式。一个CXL设备直接像PCIe插槽一样连接到单个主机的CPU上。

在这一阶段,CXL的主要作用是“将额外内存再向前延伸一步,紧邻DDR”。其核心目标是增加单个节点的内存容量,而不会扩展到其他节点的内存。

CXL 2.0—路由交换与内存池化 

2020年发布的2.0版本带来了决定性改变:引入了CXL交换机,使得多个主机和多个内存设备可以像网格一样相互连接。

最引人注目的应用是内存池化。数据中心的内存利用率平均约为40%至50%。通常有些服务器内存不足,而另一些则空闲率超过一半。

在CXL 2.0中,多个主机可以从单一内存池中动态分配所需的最大内存。

但有一点需要注意。这里的“共享”指的是动态分配,而非并发共享。

一个大型存储设备被划分为多个部分,以多逻辑设备(MLD)的形式存在。随后由名为Fabric Manager(FM)的控制平面进行分配:“这个部分给主机A,那个部分给主机B”。在任意时刻,每个部分仅由一个主机独占。因此,根本不存在任何可能导致缓存一致性冲突的区域。

用酒店房间的比喻来说明:当一位客人(主机)办理入住和退房时,单个房间(部分)会轮换使用;两位客人不能同时进入同一间房间。

仅靠这一模型,就足以减少基于最坏情况假设而为每台服务器过度购买内存的做法。此时,CXL已不再是单节点扩展接口,而是开始成为机架级内存资源管理的基础。

CXL 3.x—网络与多主机一致性

从3.0(2022年)、3.1(2023年)到3.2(2024年)的演进,目标变得更加雄心勃勃。

有两个关键点:

首先,从动态分配转向真正的共享。在2.0版本中,池化机制是“一个部分对应一个主机(在不同主机之间轮换)”,而在3.x多个主机可同时读写同一内存区域,而硬件仍保持缓存一致性。这被称为全局网状连接内存(GFAM)。分配(授予访问权限)在此处也不会消失——不同之处在于,2.0版本将一个内存块仅授予一个主机独占使用,而3.x版本允许Fabric管理器同时为多个主机授予对同一区域的访问权限。从这一阶段开始,实际冲突可能发生,主机和设备上的主代理将在缓存行粒度上解决这些冲突。

其次,从端口级别的连接到网状连接。3.x 将多个CXL 交换机连接起来,形成一个大规模的网络。在此阶段,基于端口的路由(PBR)通过目的地端口 ID 进行路由——与传统的树状结构不同,这种机制允许设备以多种拓扑结构部署,例如网状、蜻蜓网和三维环形,并能支持大量设备。

一旦达到这一阶段,CXL 实际上就成为数据中心内部一种全新的互连标准,甚至开始与NVIDIA 的NVLink 和UALink(一种用于连接加速器的开放标准)等加速器互连技术相提并论。

截至2026年,大多数量产产品已支持CXL 2.0。3.x 标准虽已发布,但实际设备和主机CPU 的支持仍处于追赶阶段。

CXL蓝图:三大内存厂商正在布局

在介绍了CXL的整体情况之后,现在让我们来看具体的产品。 

有趣的是,尽管该标准由英特尔、AMD、微软和Meta等联盟成员主导,但真正最积极地推出量产产品线的却是三大内存厂商。三星、SK海力士和美光几乎同时宣布推出了形状相近的CXL内存模块。

以下是这三家公司的产品阵容概览。

理解CXL之二:系统网络与生态!图3

显而易见,大多数产品采用E3.S标准形态。这是一种常见于服务器存储的热插拔标准形式,由于数据中心部署方面已积累了一定的技术经验,因此其采用门槛较低。

容量通常在96GB至256GB之间,具体取决于型号,接口普遍使用PCIe Gen5 x8。三家公司的规格令人惊讶地相似,真正的差异在于“是否会止步于内存模块,还是再进一步升级?”

第一条路径:诚实的内存扩展(Type 3 原样)

最基础的产品就是一块带有CXL接口的DDR5内存模块。

目标工作负载也十分明确:即那些已达到单插槽DRAM容量上限的工作负载。

这是第一个竞争战场,三家公司几乎拥有完全相同的规格。

第二条路径:模块之外的内存池化与计算

真正引人关注的是接下来的内容。三大主流内存厂商并未止步于简单的扩展模块,他们正试图将CXL的后续功能(内存池化、计算)整合到自家产品中。

主要有两种代表性方向:

一是将多个CMM-D卡集成进一个“池化盒”中。三星的CMM-B(Box)将多块CMM-D卡封装在单一设备内,形成机架级的内存池。该设备内置CXL 2.0交换机,使得多个主机可从该盒子中按需分配所需内存。

二是将计算引擎嵌入内存模块内部。SK海力士的CMM-Ax是典型代表,而三星的CMM-H和CXL-PNM也采用了类似架构。

这一理念属于近内存处理(NMP)或内存内处理(PIM)的一种方式。它不再先读取数据再进行计算,而是直接在数据所在的位置完成计算,并仅返回结果。

潜在的工作负载包括以下类型:

要使该模型具有意义,必须是数据在CXL之间传输的成本高于计算成本的情况。这里的“成本”指的是数据传输所需的时间(延迟)以及所消耗的带宽和功耗。与其将庞大的嵌入式数据集拉到主机进行相似性比较,不如直接在内存模块内完成处理,仅返回结果,从而减少流量和延迟。


Fabric与IP阵营:从控制器到交换机硅片 

除了三大存储厂商之外,还有一些企业始终活跃于CXL生态系统中,它们提供CXL控制器/交换机IP,或直接自行制造硅片。

存储公司有时会自行设计CXL控制器,但由于标准发展迅速,通常会外包或与IP/硅片供应商合作。尤其是在3.x这样标准本身才刚刚建立的领域。而像Panmnesia这样的专业玩家似乎已领先一步——即使从韩国半导体生态系统的角度来看,这一点也相当有趣。

为何存储公司都同时涌入CXL 

三家公司在几乎同一时间推出同一大类产品背后,有着共同的动机。

这是一个让内存提升到更高层次的机会——从“你插入的模块”转变为“系统中所占据的位置”。

具体来说,有三个影响:

如果HBM在GPU旁边拓展内存业务,那么CXL就是一张可以在CPU旁边重新拓展内存业务的卡——在系统层面。因此,三家公司在相近的时间推出类似的产品线也就不足为奇了。

那么它真的可行吗?

听到这些,CXL可能看起来像万能灵药,但在实际应用阶段,仍有一些不可忽视的功课。

延迟

通过CXL连接的内存比直接连接的DDR内存更慢。

这大约是延迟的2-3倍。这是由于在PCIe物理层之上叠加协议结构所带来的固有成本。

考虑到这一成本,CXL 内存自然不会作为主内存的全部替代方案,而是作为“邻近DDR + 一步之遥CXL”这种两级内存配置中的第二层级。

软件栈成熟度

从CPU 的角度来看,CXL 内存看起来像是“一个稍慢的NUMA 节点”。因此,操作系统和运行时系统必须决定哪些数据应保留在邻近的DDR 中,哪些则应发送到CXL。

Linux 内核正在快速实现 CXL 驱动、热/冷页跟踪、透明页迁移等功能,但针对不同工作负载进行优化调整仍需时间。

特别是对于具有确定性内存访问模式的工作负载(如LLM 推理),应用程序直接决定数据布局比依赖操作系统的自动分层更高效。这仍然是一个有待开拓的领域。

以Type3 为中心的现实 

理论上,Type1、2、3 都有定义,但实际市场主要围绕Type3 运行。这是由于Type2 的双向一致性复杂性,以及GPU 制造商正在推动自身互联技术(如NVLink 等)共同导致的结果。

CXL是否真的会发展成为“加速器互连标准”,还是最终定位于内存扩展与聚合的标准,目前仍是一个未解之谜。



总结与下一期预告

在本文中,我们探讨了CXL在内存层次结构中的作用及其构成部分。

以下是总结:

尽管如此,本文仅回答了“什么是CXL”这一阶段的问题。真正有趣的问题是接下来的:

CXL在实际的LLM服务工作负载中是如何被使用的?它适合哪些工作负载?

在下一部分,我们将探讨利用CXL的具体应用场景——包括KV缓存卸载、通过内存池化实现虚拟机整合,以及热/温/冷数据分层——并分析三大厂商的CMM产品阵容如何融入其中。



原文链接:

https://hyper-accel.github.io/en/posts/what-is-cxl/









高端微信群介绍

创业投资群


AI、IOT、芯片创始人、投资人、分析师、券商

闪存群


覆盖5000多位全球华人闪存、存储芯片精英

云计算群


全闪存、软件定义存储SDS、超融合等公有云和私有云讨论

AI芯片群


讨论AI芯片和GPU、FPGA、CPU异构计算

5G群


物联网、5G芯片讨论

第三代半导体群

氮化镓、碳化硅等化合物半导体讨论

存储芯片群

DRAM、NAND、3D XPoint等各类存储介质和主控讨论

汽车电子群

MCU、电源、传感器等汽车电子讨论

光电器件群

光通信、激光器、ToF、AR、VCSEL等光电器件讨论

渠道群

存储和芯片产品报价、行情、渠道、供应链



理解CXL之二:系统网络与生态!图4


< 长按识别二维码添加好友 >

加入上述群聊


理解CXL之二:系统网络与生态!图5


长按并关注

带你走进万物存储、万物智能、

万物互联信息革命新时代

理解CXL之二:系统网络与生态!图6
微信号:SSDFans



关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。
more
小鹏G9L真车实测:堪称GX青春版,靠后排体验突围大五座SUV混战
科幻照进现实!小鹏建成机器人工厂,IRON自主走下产线
能力上限触及L4自动驾驶!小鹏第二代VLA全新版本9月开启推送
尹正实测小鹏G9L极限性能,底盘调校成差异化竞争关键
1/3的SiC用量、效率追平全SiC方案:详解小鹏混合硅/碳化硅逆变器
马斯克喊了三年没做到!小鹏却先把高阶人形机器人送上了产线?
独家丨下半年还有数亿元保时捷收入,小鹏不只靠卖车赚钱
小鹏机器人,自己走下了产线
小鹏高管辟谣MONA L03停产传闻,产能爬坡正酣
第一台机器人下产线,小鹏人形机器人生产线启用
Copyright © 2025-成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号