“KV Cache不再只是缓存,它正在改写推理系统的存储方式。 ” 作者丨魏溶编辑丨包永刚推理的KV Cache,已经大到需要单独管理了。这已经成为行业内越来越明确的共识。近日,华为全联接大会上推出了华为OceanStor M900,英伟达也已经推出了CMX Context Memory Storage。这类AI记忆存储产品,会将推理过程中已经产生、可能再次复用的KV Cache进行分层管理和存储,在后续请求命中时减少相应的重复计算,这将直接节省有关算力开销。有业者明确表示,即使缓存的命中率越来越高,继续从90%向95%提升依然很有价值。但是,对于存储价格“比金子还贵”的当下,单独存储一些可能复用的推理缓存,究竟是一笔什么样的账单?01从DRAM到SSD,换算不是1比1“KV Cache外置的核心逻辑就是‘以存换算’。”长期研究存储的学者章衡告诉雷峰网。以存换算,本质上是在计算成本和存储成本之间找一个平衡点。已经算过的历史KV,是直接丢掉、下次重新计算,还是保存下来,在后续请求命中时直接复用?现在行业给出的答案,显然是后者。章衡举例,假设KV Cache命中率从90%提高到95%,需要重新计算的部分就会从10%降到5%。“相当于重新计算的那部分算力开销减少了一半。”章衡说。但命中率继续提高,也意味着需要保存更多历史KV。尤其到了高命中率区间,为了再覆盖最后几个百分点的长尾数据,所需存储容量可能明显增加。要算的第一笔账,是这些KV Cache值不值得存。在某头部存储厂商负责人李辉看来,不同应用的数据生命周期差异很大。有些消费端应用中的KV Cache可能几分钟或一两个小时后就被清理。而部分企业端应用更看重上下文的持续性,KV Cache的数据生命周期也可能更长。对这类业务来说,让历史KV跨请求保留更久、供后续复用的价值也更高。第二笔账则是存在哪里。李辉认为,如果DRAM足够便宜、供应也充足,全部放在DRAM里当然最省事,性能也最好——但现实是DRAM既贵又缺,这给SSD留下了空间。但这种替换不是简单的把1TB DRAM简单换成1TB SSD。一方面,李辉表示,从整体成本来看,DRAM和SSD之间不是1:1的替换,而是“1:N”,在一些方案中甚至可能达到一比五、一比十。另一方面,按相同容量计算,李辉估算DRAM与企业级SSD的成本可以相差数十倍。正是这种价差,让内存卸载从过去资源不足时的“兜底手段”,逐渐进入新系统的初始设计。(关于DRAM、SSD的实际应用,欢迎添加作者微信 treelog10 分享、交流)企业虽然能用更便宜的SSD替代部分DRAM容量,但需要增加的SSD规模也会更大,最终仍要同时计算容量、性能和采购成本。章衡则告诉雷峰网,现阶段多数推理场景还没有到必须增加独立KV存储设备才能运行的程度。企业通常会先利用已有的DRAM、内存池和本地SSD,再逐步考虑外部存储。“肯定是先把服务器内已有的资源用满。”章衡说。华为M900和英伟达CMX的出现,则说明这种原本更多发生在服务器内部的KV分层,已经开始进一步走向独立的共享存储层。02KV需求冒头,SSD标准却没跟上独立KV存储设备已经出现,但真正承接这些KV Cache的SSD,还没有形成一个成熟、统一的产品品类。李辉告诉雷峰网,现在行业已经开始讨论面向AI推理、尤其是KV Cache负载优化的SSD,但真正落到采购端,大多数客户买的仍然是普通企业级SSD。“现在业内都在聊这个趋势,但还没有一个标准化、大规模上量的产品。”李辉说。目前市场上更多还是三星、闪迪、美光等厂商的传统企业级SSD。原因并不是SSD本身做不出来,而是KV Cache究竟会给SSD带来什么样的负载,行业还没有完全摸清楚。李辉举例,他接触到的一类相关方案,最初对SSD耐写能力的要求大约是3 DWPD,后来又提高到9 DWPD。DWPD即Drive Writes Per Day,表示一块SSD每天能够承受多少次整盘写入。“有可能明天变12,后天又变成5。”李辉说。指标之所以会反复变化,首先取决于KV Cache到底要保存多久。如果一批缓存只保存几分钟,数据需要频繁更新,SSD每天承受的写入压力会更高,对耐久度的要求也随之上升。但如果数据需要保存几个星期,写入频率下降后,耐写能力反而不再是主要矛盾,容量需求会更加突出。李辉提到,现在不同业务中的数据生命周期可能从分钟、小时,一直延伸到天甚至周。在应用形态和数据生命周期还没有稳定下来的情况下,SSD究竟需要多大的容量、多高的耐久度,以及怎样的性能指标,也很难提前确定。对于存储厂商来说,SSD本身是一个高度依赖规模的产品。“如果没有标准化,这个市场就很难形成规模。”李辉坦言。如果不同客户根据自己的业务分别定义一套SSD规格,产品就很容易停留在定制化阶段,无法形成足够大的统一市场。李辉举例,如果头部互联网大厂最终需要的产品都不一样,存储厂商很难依靠单一规格获得规模。所以现在,行业还需要时间在不同方案之间磨合,等实际负载逐渐收敛之后才可能形成更统一的产品标准。按李辉的估算,行业形成较统一的产品共识可能还需要6至12个月;即使标准确定,后续产品开发、验证和优化还可能再花约1年。李辉还提到,北美市场已经有客户因为AI推理和KV Cache增加SSD采购;中国市场也开始出现加单,但速度相对更慢,目前国内SSD需求的大头仍在训练和常规推理,KV Cache相关需求还在方案阶段。(有关SSD的市场采购现状,欢迎添加作者微信 treelog10 分享、吐槽)“KV Cache未来的确可能成为企业级SSD的重要增量之一,但这块市场目前仍处于‘百花齐放’的阶段。”李辉说。03存储压力下去了,搬运成本还在既然这么多历史KV Cache被搬走,HBM和DRAM的工作负载有没有被缓解呢?目前最直接缓解的,是DRAM的负载压力。章衡告诉雷峰网,外置KV缓存的目标之一,是减少服务器对大容量DRAM的依赖。“核心目标其实是换内存,不是要换显存。现在内存太贵了,那不如少买点内存,多买点SSD。”章衡笑言。在这类方案里,原本需要长期留在DRAM中的一部分历史KV,可以继续下沉到SSD,从而减少内存配置。相比之下,KV Cache外置对HBM的缓解没有那么直接。章衡认为,外部存储更多影响的是首Token延迟。历史KV从外部存储调回来的速度,会影响模型多久开始生成首个Token;而一旦开始生成Token,相关KV已经回到显存,后续生成速度仍然依赖高速显存。李辉也提到,随着不同存储层级之间的价差和供应差异扩大,分层和卸载正在更早进入推理系统的设计。但把历史KV放到更大容量的存储里,只解决了容量和成本问题。当前推理过程中,模型权重和数据仍然需要不断搬运。SSD解决的是存得下、存得有性价比,但它解决不了搬得够不够快。AI芯片公司创始人顾淮告诉雷峰网,存算一体(CIM)试图减少的,正是模型权重和当前数据的搬运开销。在传统推理架构中,模型权重和中间数据需要在存储单元与计算单元之间频繁移动;存算一体则希望把部分计算尽量放到数据附近完成,减少反复搬运带来的开销。当前请求为了快速生成Token,相关数据会放在DRAM、或者更靠近计算单元的SRAM中;模型权重和KV等数据如果能够在靠近计算的位置被重复利用,就可以减少反复搬运。顾淮认为,这种优势在Prefill阶段尤其明显,高并发场景下,同一组模型参数可以服务多个请求。顾淮以100路并发举例,同一组参数可以被多个请求复用,因此不需要为每个请求重复搬运一遍。“并发数越多越好。”顾淮说。到了Decode阶段,不同请求使用的KV缓存并不完全相同,能够在请求之间重复利用的数据更少。因此,存算一体在这一阶段的收益没有Prefill明显。在顾淮看来,如果未来存算一体进入服务器,一个直接作用是降低首Token延迟,并支撑更高并发。但是,存算一体并不能替代历史KV Cache的存储需求。历史对话产生的大量KV仍然需要SSD等大容量介质保存,后续请求再次命中时,再把需要的数据调回当前计算路径中。“历史对话的KV Cache还是要存在SSD里,否则存储量太大。”顾淮说。那么,再次回到那个问题,存储那些可能被复用的推理缓存,到底是一笔怎样的账单?它并不是简单地多花一笔存储成本,就能等额省下一笔算力成本。KV Cache保存多久、能够被复用多少次、使用什么介质,以及调取过程中还要付出多少数据搬运成本,都在影响最终选择。大模型记住过去,基础设施也开始为“记忆”买单。(关于单独管理KV Cache的行业难题、困境,欢迎添加作者微信 treelog10 分享、吐槽)* 文中章衡、李辉、顾淮均为化名。▼推荐阅读▼2026-09-082026-08-25