
因为公众号平台更改了推送规则。记得点右下角的大拇指“赞”和红心“推荐”。这样每次新文章推送,就会第一时间出现在订阅号列表里。
从单个设备到整个系统网络——CXL 1.1 →2.0 →3.x

自2019年1.0版本发布以来,CXL发展迅速。每个版本新增的功能最终都指向同一个方向:
让内存能够被放置得更远、容量更大,并由更多主机共享。
下面来谈谈每个版本中的关键变化。
CXL 1.1—直接连接至单个主机
这是最基础的形式。一个CXL设备直接像PCIe插槽一样连接到单个主机的CPU上。
在这一阶段,CXL的主要作用是“将额外内存再向前延伸一步,紧邻DDR”。其核心目标是增加单个节点的内存容量,而不会扩展到其他节点的内存。
CXL 2.0—路由交换与内存池化
2020年发布的2.0版本带来了决定性改变:引入了CXL交换机,使得多个主机和多个内存设备可以像网格一样相互连接。
最引人注目的应用是内存池化。数据中心的内存利用率平均约为40%至50%。通常有些服务器内存不足,而另一些则空闲率超过一半。
在CXL 2.0中,多个主机可以从单一内存池中动态分配所需的最大内存。
但有一点需要注意。这里的“共享”指的是动态分配,而非并发共享。
一个大型存储设备被划分为多个部分,以多逻辑设备(MLD)的形式存在。随后由名为Fabric Manager(FM)的控制平面进行分配:“这个部分给主机A,那个部分给主机B”。在任意时刻,每个部分仅由一个主机独占。因此,根本不存在任何可能导致缓存一致性冲突的区域。
用酒店房间的比喻来说明:当一位客人(主机)办理入住和退房时,单个房间(部分)会轮换使用;两位客人不能同时进入同一间房间。
仅靠这一模型,就足以减少基于最坏情况假设而为每台服务器过度购买内存的做法。此时,CXL已不再是单节点扩展接口,而是开始成为机架级内存资源管理的基础。
CXL 3.x—网络与多主机一致性
从3.0(2022年)、3.1(2023年)到3.2(2024年)的演进,目标变得更加雄心勃勃。
有两个关键点:
首先,从动态分配转向真正的共享。在2.0版本中,池化机制是“一个部分对应一个主机(在不同主机之间轮换)”,而在3.x多个主机可同时读写同一内存区域,而硬件仍保持缓存一致性。这被称为全局网状连接内存(GFAM)。分配(授予访问权限)在此处也不会消失——不同之处在于,2.0版本将一个内存块仅授予一个主机独占使用,而3.x版本允许Fabric管理器同时为多个主机授予对同一区域的访问权限。从这一阶段开始,实际冲突可能发生,主机和设备上的主代理将在缓存行粒度上解决这些冲突。
其次,从端口级别的连接到网状连接。3.x 将多个CXL 交换机连接起来,形成一个大规模的网络。在此阶段,基于端口的路由(PBR)通过目的地端口 ID 进行路由——与传统的树状结构不同,这种机制允许设备以多种拓扑结构部署,例如网状、蜻蜓网和三维环形,并能支持大量设备。
一旦达到这一阶段,CXL 实际上就成为数据中心内部一种全新的互连标准,甚至开始与NVIDIA 的NVLink 和UALink(一种用于连接加速器的开放标准)等加速器互连技术相提并论。
截至2026年,大多数量产产品已支持CXL 2.0。3.x 标准虽已发布,但实际设备和主机CPU 的支持仍处于追赶阶段。
CXL蓝图:三大内存厂商正在布局
在介绍了CXL的整体情况之后,现在让我们来看具体的产品。
有趣的是,尽管该标准由英特尔、AMD、微软和Meta等联盟成员主导,但真正最积极地推出量产产品线的却是三大内存厂商。三星、SK海力士和美光几乎同时宣布推出了形状相近的CXL内存模块。
以下是这三家公司的产品阵容概览。

显而易见,大多数产品采用E3.S标准形态。这是一种常见于服务器存储的热插拔标准形式,由于数据中心部署方面已积累了一定的技术经验,因此其采用门槛较低。
容量通常在96GB至256GB之间,具体取决于型号,接口普遍使用PCIe Gen5 x8。三家公司的规格令人惊讶地相似,真正的差异在于“是否会止步于内存模块,还是再进一步升级?”
第一条路径:诚实的内存扩展(Type 3 原样)
最基础的产品就是一块带有CXL接口的DDR5内存模块。
三星的CMM-D、SK海力士的CMM-DDR5以及美光的CZ120/CZ122均属于此类。
从主机角度来看,这看起来就像是“一个稍远一些的DDR模块”,通过普通的load/store操作进行访问。
目标工作负载也十分明确:即那些已达到单插槽DRAM容量上限的工作负载。
内存数据库和大规模分析
LLM推理中位于CPU侧的KV缓存与嵌入式存储
虚拟机整合环境中的内存不足节点
这是第一个竞争战场,三家公司几乎拥有完全相同的规格。
第二条路径:模块之外的内存池化与计算
真正引人关注的是接下来的内容。三大主流内存厂商并未止步于简单的扩展模块,他们正试图将CXL的后续功能(内存池化、计算)整合到自家产品中。
主要有两种代表性方向:
一是将多个CMM-D卡集成进一个“池化盒”中。三星的CMM-B(Box)将多块CMM-D卡封装在单一设备内,形成机架级的内存池。该设备内置CXL 2.0交换机,使得多个主机可从该盒子中按需分配所需内存。
二是将计算引擎嵌入内存模块内部。SK海力士的CMM-Ax是典型代表,而三星的CMM-H和CXL-PNM也采用了类似架构。
这一理念属于近内存处理(NMP)或内存内处理(PIM)的一种方式。它不再先读取数据再进行计算,而是直接在数据所在的位置完成计算,并仅返回结果。
潜在的工作负载包括以下类型:
向量嵌入相似性比较(RAG)
数据库过滤与聚合
大语言模型推理的某些阶段(例如键值缓存压缩、Top-k选择)
要使该模型具有意义,必须是数据在CXL之间传输的成本高于计算成本的情况。这里的“成本”指的是数据传输所需的时间(延迟)以及所消耗的带宽和功耗。与其将庞大的嵌入式数据集拉到主机进行相似性比较,不如直接在内存模块内完成处理,仅返回结果,从而减少流量和延迟。
Fabric与IP阵营:从控制器到交换机硅片
除了三大存储厂商之外,还有一些企业始终活跃于CXL生态系统中,它们提供CXL控制器/交换机IP,或直接自行制造硅片。
Astera Labs:其Leo系列控制器被用于微软Azure的M系列CXL内存及其他设备,目标是成为CXL内存控制器的“标准组件”。
Marvell,Microchip(原Microsemi):他们凭借控制器产品线在IP领域占据一席之地。我们之前看到的Micron CZ120也采用了Microchip的SMC 2000控制器。
Panmnesia:一家来自韩国KAIST CAMELab(计算机体系结构与内存系统实验室)的无晶圆厂初创企业。这里存在一个有趣的关联:参考文献中提到的《Memory Pooling With CXL》论文作者M. Jung,正是KAIST的教授Jung Myoungsoo,也是该公司的创始人。该公司不仅限于控制器,更是一家全栈式参与者,直接在硅片上构建CXL 3.2网络交换芯片(PANSWITCH)。它率先在硅片上实现3.x版本最先进的功能,例如PBR以及网格/龙飞/三维环形拓扑结构。2026年4月,公司宣布进入下半年的大规模量产阶段,并开始供应预发布版硅片,正式迈入商业化阶段。
存储公司有时会自行设计CXL控制器,但由于标准发展迅速,通常会外包或与IP/硅片供应商合作。尤其是在3.x这样标准本身才刚刚建立的领域。而像Panmnesia这样的专业玩家似乎已领先一步——即使从韩国半导体生态系统的角度来看,这一点也相当有趣。
为何存储公司都同时涌入CXL
三家公司在几乎同一时间推出同一大类产品背后,有着共同的动机。
这是一个让内存提升到更高层次的机会——从“你插入的模块”转变为“系统中所占据的位置”。
具体来说,有三个影响:
扩展每个节点的可售容量:它们可以销售超出DDR通道上限的内存
为提高模块定价留出空间:通过聚合、NMP等附加功能实现差异化
进入解决方案业务领域:产品不再是简单的组件,而是以聚合设备(如CMM-B)的形式提供服务
如果HBM在GPU旁边拓展内存业务,那么CXL就是一张可以在CPU旁边重新拓展内存业务的卡——在系统层面。因此,三家公司在相近的时间推出类似的产品线也就不足为奇了。
那么它真的可行吗?
听到这些,CXL可能看起来像万能灵药,但在实际应用阶段,仍有一些不可忽视的功课。
延迟
通过CXL连接的内存比直接连接的DDR内存更慢。
DDR5原生:约80-100纳秒
CXL内存(Type 3):约170-300纳秒
这大约是延迟的2-3倍。这是由于在PCIe物理层之上叠加协议结构所带来的固有成本。
考虑到这一成本,CXL 内存自然不会作为主内存的全部替代方案,而是作为“邻近DDR + 一步之遥CXL”这种两级内存配置中的第二层级。
软件栈成熟度
从CPU 的角度来看,CXL 内存看起来像是“一个稍慢的NUMA 节点”。因此,操作系统和运行时系统必须决定哪些数据应保留在邻近的DDR 中,哪些则应发送到CXL。
Linux 内核正在快速实现 CXL 驱动、热/冷页跟踪、透明页迁移等功能,但针对不同工作负载进行优化调整仍需时间。
特别是对于具有确定性内存访问模式的工作负载(如LLM 推理),应用程序直接决定数据布局比依赖操作系统的自动分层更高效。这仍然是一个有待开拓的领域。
以Type3 为中心的现实
理论上,Type1、2、3 都有定义,但实际市场主要围绕Type3 运行。这是由于Type2 的双向一致性复杂性,以及GPU 制造商正在推动自身互联技术(如NVLink 等)共同导致的结果。
CXL是否真的会发展成为“加速器互连标准”,还是最终定位于内存扩展与聚合的标准,目前仍是一个未解之谜。
总结与下一期预告
在本文中,我们探讨了CXL在内存层次结构中的作用及其构成部分。
以下是总结:
空闲席位:DDR在单个节点内具有明确的通道上限,而PCIe则没有一致性机制,因此难以作为内存使用。中间的席位便是这一空白。
三种面向:CXL.io(与PCIe相同)、CXL.cache(设备缓存主机数据)、CXL.mem(主机直接访问设备内存)。
三种类型:Type 1(仅缓存)、Type 2(内存+缓存)、Type 3(内存扩展)。当前市场以Type 3为主导。
标准演进路径:1.1(单主机)→2.0(交换、聚合)→3.x(网络化、多主机一致性)。
三大CMM方案:第一行是真正的内存扩展(三星CMM-D、SK海力士CMM-DDR5、美光CZ120);第二行是聚合模块(三星CMM-B)和计算集成(SK海力士CMM-Ax、三星CXL-PNM)。
其余待解决的问题:延迟增加2-3倍、软件栈尚不成熟,以及Type 2的空闲席位问题。
尽管如此,本文仅回答了“什么是CXL”这一阶段的问题。真正有趣的问题是接下来的:
CXL在实际的LLM服务工作负载中是如何被使用的?它适合哪些工作负载?
在下一部分,我们将探讨利用CXL的具体应用场景——包括KV缓存卸载、通过内存池化实现虚拟机整合,以及热/温/冷数据分层——并分析三大厂商的CMM产品阵容如何融入其中。
原文链接:
https://hyper-accel.github.io/en/posts/what-is-cxl/
高端微信群介绍 | |
创业投资群 | AI、IOT、芯片创始人、投资人、分析师、券商 |
闪存群 | 覆盖5000多位全球华人闪存、存储芯片精英 |
云计算群 | 全闪存、软件定义存储SDS、超融合等公有云和私有云讨论 |
AI芯片群 | 讨论AI芯片和GPU、FPGA、CPU异构计算 |
5G群 | 物联网、5G芯片讨论 |
第三代半导体群 | 氮化镓、碳化硅等化合物半导体讨论 |
存储芯片群 | DRAM、NAND、3D XPoint等各类存储介质和主控讨论 |
汽车电子群 | MCU、电源、传感器等汽车电子讨论 |
光电器件群 | 光通信、激光器、ToF、AR、VCSEL等光电器件讨论 |
渠道群 | 存储和芯片产品报价、行情、渠道、供应链 |

< 长按识别二维码添加好友 >
加入上述群聊

带你走进万物存储、万物智能、
万物互联信息革命新时代
