128K上下文里79%的KV居然搬了也白搬:北大、阿里云用CXL重做大模型内存系统

机智流 2026-07-24 20:00

128K上下文里79%的KV居然搬了也白搬:北大、阿里云用CXL重做大模型内存系统图1

128K上下文里79%的KV居然搬了也白搬:北大、阿里云用CXL重做大模型内存系统图2

随着大语言模型参数规模的不断扩张以及长上下文推理需求的日益增长,大模型服务的瓶颈正从计算能力悄然转向内存容量。其中,前缀键值(KV)缓存的管理已成为影响服务性能的关键挑战。当单个请求的上下文长度达到数十万甚至上百万词元时,KV缓存的体积可轻松突破数十GB,这远远超出了单个GPU高带宽内存(HBM)或主机DRAM的承载能力。

为了应对这一挑战,基于RDMA(远程直接内存访问)的分离式内存池方案应运而生,成为业界扩展内存容量、实现跨节点共享的标准做法。这类系统通常会在解码开始前,通过RDMA网卡将整个前缀KV缓存从远程存储池预取到本地内存,以确保后续解码阶段的低延迟访问。对于传统的密集注意力模型,这种“全量预取”策略是行之有效的。

然而,对于以DeepSeek-V3.2、GLM-5.1等为代表的新一代稀疏注意力模型而言,RDMA方案却暴露出了根本性的效率缺陷。稀疏注意力的核心在于,每个解码步骤中,模型仅需关注全部历史KV缓存中的一小部分(例如Top-k)关键条目。这意味着,尽管系统为每个请求搬运了海量的KV数据,但其中绝大部分在解码过程中从未被访问,造成了巨大的传输带宽浪费和宝贵的本地内存占用。

128K上下文里79%的KV居然搬了也白搬:北大、阿里云用CXL重做大模型内存系统图3

论文标题:SAC: Disaggregated KV Cache System for Sparse Attention LLMs with CXL

论文链接:https://arxiv.org/pdf/2606.19746

来自北京大学、阿里巴巴云和中国人民大学的研究团队敏锐地洞察到这一问题,并提出了名为SAC的创新系统。SAC是首个为稀疏注意力模型优化的、基于CXL(Compute Express Link)的分离式KV缓存系统。它利用CXL的低延迟、缓存行粒度加载/存储语义,在推理过程中仅按需获取所需的Top-k KV条目,从而在根源上解决了传统RDMA方案面临的传输瓶颈和本地内存浪费问题。

研究背景:稀疏注意力时代的“内存墙”困境

大语言模型服务正经历一场深刻的范式转变。为了处理更长的文档、进行更复杂的多轮对话,模型需要支持越来越长的上下文窗口。随之而来的,是KV缓存体积的爆炸式增长。在本地GPU内存容量有限的情况下,将KV缓存分离到远程内存池中已成为必然选择。

128K上下文里79%的KV居然搬了也白搬:北大、阿里云用CXL重做大模型内存系统图4

图 1:DeepSeek稀疏注意力(DSA)的工作流程。其通过轻量级的Lightning Indexer动态计算相关性分数,并仅选取Top-k个KV潜在向量进行计算,将注意力计算复杂度从O(L²)降至O(kL)。

与此同时,模型架构本身也在进化。稀疏注意力,特别是像DeepSeek-V3.2所采用的DeepSeek稀疏注意力(DSA)机制,通过仅关注最相关的历史token,将注意力计算复杂度从序列长度的平方级降低至近线性级。这带来了更高的吞吐量和更长的上下文处理能力,但并未改变一个事实:为处理长上下文,系统仍需在内存中存储完整的KV缓存历史

传统的RDMA分离式内存池方案(如图2左)在此场景下遇到了双重挑战:

  1. 传输瓶颈:稀疏注意力模型的吞吐量通常受限于可实现的批处理大小,而非计算能力。对于长上下文请求,在解码开始前,通过RDMA预取数十GB的完整KV缓存会产生巨大的网络传输压力。高并发场景下,这会导致严重的排队延迟,直接影响首个词元的生成时间(TTFT)和整体吞吐量。
  2. 本地内存浪费:如图4所示,在DeepSeek-V3.2处理128K上下文请求时,实际被访问的KV缓存仅占21%。然而,基于RDMA的系统仍需将全部KV缓存取回并驻留在本地内存中。为了维持高并发,就需要在本地配备TB级的内存,这造成了极高的基础设施成本和极低的内存使用效率。
128K上下文里79%的KV居然搬了也白搬:北大、阿里云用CXL重做大模型内存系统图5

图 2:基于RDMA(左)与基于CXL(右)的分离式内存架构对比。CXL提供了硬件管理的加载/存储内存语义,数据路径更简洁。

一个直观的解决方案是“按需传输”,即只获取每层计算所需的Top-k KV条目。但这在RDMA架构下几乎不可行。首先,Top-k的索引需要根据当前查询向量在运行时动态确定,这个过程对延迟极其敏感,而RDMA固有的微秒级访问延迟无法满足要求。其次,稀疏的Top-k条目由大量离散的小数据段组成,通过RDMA获取它们需要发起数十个独立的请求或复杂的聚集/分散操作,会带来巨大的软件栈开销。

技术突破:CXL——为稀疏访问而生的互联技术

转机出现在新兴的计算快速链接技术。CXL建立在PCIe物理层之上,拥有更简化的协议栈,提供了比RDMA显著更低的访问延迟。更重要的是,CXL支持缓存行粒度的加载/存储语义,且几乎零消息协议开销,这使其特别适合读取稀疏且细粒度的数据。

研究团队通过实验验证了CXL的优势。如图5所示,他们测量了从不同内存后端(CXL内存、RDMA内存、本地DRAM)随机读取稀疏KV条目所需的GPU读取延迟。结果显示,基于CXL的分离式内存性能接近本地DRAM,延迟仅为后者的1.04至1.64倍。相比之下,RDMA的延迟高出4到19.7倍,当KV条目数量增加时,延迟甚至达到毫秒级。这证实了通过RDMA进行逐层Top-K KV获取对于实时推理而言是不切实际的。

128K上下文里79%的KV居然搬了也白搬:北大、阿里云用CXL重做大模型内存系统图6

图 5:从不同后端读取不同数量稀疏KV条目的平均延迟对比。CXL性能接近本地DRAM,而RDMA延迟显著更高。

基于CXL的这些独特优势,SAC系统应运而生。它将稀疏注意力模型的KV缓存管理,从传统的RDMA架构转向了基于CXL的分离式架构。

SAC系统设计:架构与工作流程

SAC系统的核心设计目标是高效满足稀疏注意力模型在分离式服务下的高并发需求。其架构主要包含三个部分:预填充实例、解码实例和基于CXL的分离式KV缓存系统(如图6)。

128K上下文里79%的KV居然搬了也白搬:北大、阿里云用CXL重做大模型内存系统图7

图 6:SAC系统概览及操作流程,展示了计算实例与分离式CXL内存池之间的交互。

  • 预填充实例:此阶段批处理规模大,主要受计算能力限制。KV缓存完整地保存在本地GPU内存中以确保快速访问。预填充完成后,该实例负责将计算好的KV条目写入CXL内存池。
  • 解码实例:建立在SGLang框架中的HiSparse机制之上,专为稀疏注意力模型的高吞吐推理而设计。SAC扩展了此框架,集成了分离式内存后端和基于CXL的KV缓存管理系统。在每一层注意力计算中,SAC直接从CXL内存池将所需的Top-k KV获取到GPU中。新生成词元的KV条目也会被写回CXL内存。
  • 基于CXL的分离式KV缓存系统:该系统管理KV缓存及其元数据,将所有数据映射到可供多个计算实例访问的全局CXL地址空间。它处理CXL设备初始化,并提供优化的读/写内核以及设备交错策略。

SAC的硬件拓扑依赖于基于CXL的分离式架构(图7)。每个服务器中的NUMA节点通过PCIe 5.0 x16适配器连接到CXL交换机。CXL内存池包含一个交换机节点,其配备的XConn XC50256 CXL交换芯片提供了内存设备与计算服务器之间高达512 GB/s的总带宽,最多可将8台服务器连接到CXL内存池。

128K上下文里79%的KV居然搬了也白搬:北大、阿里云用CXL重做大模型内存系统图8

图 7:SAC系统的硬件拓扑结构。

核心创新:CXL内存资源管理

与RDMA架构相比,SAC采用的CXL方法在KV缓存布局和元数据管理上具有两大优势:

  1. 位置透明的KV缓存布局:RDMA系统在本地和远程内存之间存在显著的性能差距,需要复杂且感知缓存的调度策略。而SAC利用CXL实现了接近DRAM的延迟。由于CXL支持字节可寻址的细粒度加载/存储语义,SAC采用了与本地GPU结构完全相同的、位置透明的“层优先”内存布局。这使得GPU可以使用与访问本地内存相同的逻辑来访问CXL内存中的KV缓存,将稀疏注意力模型中的逐层Top-k检索转变为GPU内核中轻量级的内存读取操作。
  2. 基于CXL的元数据管理:传统的共享KV缓存系统通常依赖通过RDMA或TCP/IP等高开销协议访问的集中式元数据服务。SAC则将这些昂贵的网络交互替换为将元数据托管在专用的、全局可访问的CXL共享内存区域中。通过利用原生的加载/存储语义进行跨服务器同步,SAC用高速内存操作取代了繁重的远程过程调用交互,确保了元数据更新和查找能以接近DRAM的延迟完成。

此外,SAC还通过设备交错策略来优化CXL带宽利用(图8)。系统将单个请求的KV缓存存储在一个CXL设备内,并在向模型执行器分发请求时,以轮询方式将GPU与CXL设备进行映射,确保GPU交错访问不同的设备。这样可以在并行GPU访问期间将流量分散到多个物理链路上,减轻单链路压力,显著降低检索延迟。

128K上下文里79%的KV居然搬了也白搬:北大、阿里云用CXL重做大模型内存系统图9

图 8:CXL设备交错策略示例,通过轮询映射平衡不同GPU对CXL设备的访问。

性能评估:显著优于RDMA基线

研究团队将SAC集成到SGLang和HiSparse框架中,使用DeepSeek-V3.2模型(AWQ 4位量化)在8卡H20 GPU服务器和2TB CXL内存池的环境下进行了端到端评估。他们对比了SAC与两种替代方案:基于RDMA的内存池,以及作为性能上限的本地主机DRAM。

评估采用了两轮实验设计:第一轮模拟预填充阶段;第二轮模拟解码阶段,此时所有KV缓存已预加载到内存池中,完全绕过预填充阶段。测试使用从ShareGPT数据集中采样的请求,上下文长度从16K到128K词元,输出长度固定为1K词元。

128K上下文里79%的KV居然搬了也白搬:北大、阿里云用CXL重做大模型内存系统图10
128K上下文里79%的KV居然搬了也白搬:北大、阿里云用CXL重做大模型内存系统图11

图 9 & 10: SAC与RDMA、本地DRAM后端在第一轮(预填充,上)和第二轮(解码,下)的性能对比,包括吞吐量、词元间时间(TBT)和首词元时间(TTFT)。

结果如下

  • 在第二轮解码阶段,SAC的平均吞吐量是RDMA基线的2.1倍
  • RDMA的首词元时间(TTFT)比SAC高出9.7倍,这是因为高客户端并发在KV检索期间饱和了传输带宽,导致排队延迟激增。
  • RDMA的词元间时间(TBT)比SAC高出1.8倍,这是由于严重的PCIe总线争用所致,该总线必须同时处理传入的KV缓存流量和HiSparse的换入过程。
  • 更重要的是,SAC的性能非常接近本地DRAM上限,平均吞吐量达到DRAM基线的91%,TBT和TTFT仅有边际增加。

卓越的可扩展性

SAC在可扩展性方面也展现出巨大优势。如图11所示,在不同上下文长度(32K, 64K, 128K)下,随着并发度的提高,SAC的吞吐量持续稳健增长。相比之下,RDMA后端由于需要全量获取KV缓存,很快耗尽了传输带宽,吞吐量迅速达到平台期。对于128K上下文,SAC的吞吐量最高可达RDMA系统的3.1倍。

128K上下文里79%的KV居然搬了也白搬:北大、阿里云用CXL重做大模型内存系统图12

图 11:不同并发度下,SAC与RDMA在解码吞吐量可扩展性上的对比。SAC表现稳健,而RDMA因传输瓶颈很快达到平台期。

与未分离基线的对比

为了展示CXL内存的架构优势,研究团队还将SAC与未分离的配置进行了对比(图12)。结果显示,尽管SAC将KV缓存存储在分离的CXL内存中,但其性能仍接近本地DRAM基线。与仅使用GPU HBM的基线相比,在低并发时HBM能提供更高的吞吐量,但随着并发度增加,HBM会达到容量极限,最大可实现的批处理大小无法继续提升。这证明了使用更低层级的记忆体(如CXL)对于稀疏注意力推理的重要性,它能提供必要的容量以支持高并发工作负载。

128K上下文里79%的KV居然搬了也白搬:北大、阿里云用CXL重做大模型内存系统图13

图 12:SAC与本地DRAM、仅GPU HBM等未分离基线在不同并发度下的吞吐量对比。

未来展望与结论

SAC的设计理念具有广泛的适用性。例如,最新的DeepSeek-V4混合使用了压缩稀疏注意力和重度压缩注意力,以支持高达100万词元的上下文长度。由于其稀疏注意力部分与DeepSeek-V3.2共享相同的Top-k访问模式,因此可以直接受益于SAC。相比RDMA,CXL通过加载/存储语义为异构KV缓存支持更灵活的存储和访问模式,展现出作为此类模型后端的巨大潜力。

模型稀疏化的发展正在驱动KV缓存访问模式向细粒度、异构化演变。传统的基于消息的协议已无法满足需求。大语言模型服务集群正在向内存语义互联演进,这需要计算节点与内存节点之间更紧密的耦合以最大化性能。CXL正成为这一转型的基石,而统一纵向扩展协议的出现,有望为高性能、分离式的KV缓存存储提供更强大的解决方案。

总结而言,SAC系统通过利用CXL的低延迟、细粒度加载/存储语义,革命性地改变了稀疏注意力大模型的KV缓存管理方式。它按需获取所需KV条目的设计,从根本上消除了传统RDMA方案中的传输开销和本地内存浪费。实验证明,SAC能带来数倍的吞吐量提升和显著降低的响应延迟。随着大语言模型架构继续向更高稀疏度和更长上下文演进,SAC证明了基于CXL的分离式内存架构,为下一代可扩展、高效的大语言模型服务基础设施提供了优越的基石。


> 本文由 Intern-S2 等 AI 生成,机智流编辑部校对


-- 完 --


加入机智流 Pro,1 天一块钱,AI 能力指数级增长时代,不掉队。机智流 AI 团队将燃烧远超人类的智能的 AI Tokens 驱动 AI Agents 军团带来「与你有关」「对你有用」的高质量资讯/研报。


机智流推荐阅读

1. 

2. 

3. 

4. 

关注机智流并加入 AI 技术交流群,不仅能和来自大厂名校的 AI 开发者、爱好者一起进行技术交流,同时还有等。
在「机智流」公众号后台回复下方标红内容即可加入对应群聊:
  • cc | 大模型技术交流群
  • hf | HuggingFace 高赞论文分享群
  • lc|LangChain 技术交流群
  • code | AI Coding 交流群
  • 具身 | 具身智能交流群
  • 硬件 | AI 硬件交流群
  • 推理 | AI 推理框架交流群
  • 智能体 | Agent 技术交流群

声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。 
内存 大模型 阿里
more
WAIC 2026大洗牌:机器人遍地,Agent干活,国产算力崛起,基础大模型只剩18家|甲子光年
WAIC后记:大模型叙事之外,一家亿级用户公司另类开局
全球显示领域第一!TCL华星星智X-Intelligence大模型缺陷识别准确率95%
终于用上AI的公司,发现业务被大模型公司抢了
339亿!芯片大厂投了“大模型一哥”
沿用DeepSeek架构,美国大模型开始抄中国作业
云天励飞WAIC公布三款专用推理芯片路线图:以分离式架构破解大模型推理“效率墙”
128K上下文里79%的KV居然搬了也白搬:北大、阿里云用CXL重做大模型内存系统
吉利系领衔!后装大模型在WAIC杀疯了
面壁智能端侧大模型将搭载三星手机上市丨36氪独家
Copyright © 2025 成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号