当上下文狂飙,谁在维持KV Cache的秩序?

英特尔中国 2026-09-04 11:00
当上下文狂飙,谁在维持KV Cache的秩序?图1


以存代算,近期最风靡的词汇之一。它的核心,就是KV Cache(键值缓存)。如果把大模型每次推理比作答题,KV Cache就像它的“即时记忆草稿本”。遇到多轮对话,模型直接翻看存好的草稿即可继续推演,既省下了算力,又缩短了答题时间。


但随着Agentic AI与长上下文模型的爆发,问题来了:智能体需要频繁回放百万级token的对话历史,这个“草稿本”越来越厚,转眼就占满了昂贵稀缺的GPU显存。显存放不下怎么办?系统只能把暂时用不到的记忆清出去。等智能体或用户再次提问时,模型又不得不把历史KV Cache从头再算一遍,如此往复的驱逐与重算导致了TTFT(首token时延)一路飙升,用户体验受到严重影响。


当上下文狂飙,谁在维持KV Cache的秩序?图2

从有损到无损,至强处理器为KV Cache卸载与压缩提供更优方案


行业早已达成共识,既然GPU显存太贵、装不下,不如把KV Cache“搬”出去,存到成本更低的DDR内存、SSD甚至远端存储里。然而,巨量数据的传输往往会带来额外的性能开销,且对数据的精度造成影响。


针对这个难题,英特尔推出KV Shrink分层卸载与硬件压缩加速方案,并与道客(DaoCloud)在联合实验室完成验证与落地。


KV Shrink的核心思路是“以存代算、分层卸载、硬件压缩”。


当上下文狂飙,谁在维持KV Cache的秩序?图3

基于不同存储介质的KV Cache多层卸载机制(L1–L4)


系统将KV Cache按访问热度分层流动:用于实时对话的极热数据常驻成本最高的L1层(GPU HBM显存),保障低延迟响应;用于多轮对话的热数据卸载至L2层(DDR内存),通过大容量缓存池扩容降本;用于历史对话的温冷数据下沉至L3/L4层(本地SSD或远端分布式存储),实现持久化复用。KV Shrink为多层卸载方案提供了完备的调度机制,已计算的KV Cache可被后续请求直接调用,从而避免重复计算带来的算力浪费。


当上下文狂飙,谁在维持KV Cache的秩序?图4

基于英特尔KV Shrink的KV Cache卸载


CPU是驱动KV Shrink机制运转的核心,承担着KV Cache压缩、调度、分层存储与生命周期管理的重要职责。至强处理器作为KV Cache管理与调度的核心,其内置的英特尔® QAT(QuickAssist Technology,数据保护与压缩加速技术)是KV Shrink运转的重要基础。


QAT不仅在金字塔式多层卸载与灵活调度方面解决问题,还从以下几个层面减少了KV Cache的存储压力:一方面,客户可以通过KV Shrink提供的冷热调度API实现KV Cache卸载,另一方面,英特尔重新编排了KV Cache的数据存储格式,使其对压缩算法更为友好,可将压缩率从原本的10%+提升至20%。


实测数据验证了英特尔KV Shrink方案的价值1 在80%缓存命中率的典型业务场景下,该方案相比原生vLLM基线实现TTFT最高约5倍的性能提升,用户交互体验改善显著。在压缩效率上,通过数据格式重排与QAT硬件加速的协同优化,KV Cache平均压缩率从原来的10%+提升至20%~30%,500TB规模下可节省约150TB存储空间;而QAT硬件压缩吞吐约为纯CPU软件方案的2倍,额外性能损耗控制在10%以内。在联合实验室的CodingAgent实测中,方案单路TTFT仅114.13毫秒,性能优于同类方案2

当上下文狂飙,谁在维持KV Cache的秩序?图5

英特尔KV Shrink方案与原生vLLM基线组TTFT性能对比

当上下文狂飙,谁在维持KV Cache的秩序?图6

英特尔KV Shrink方案与纯CPU软件方案压缩/解压缩性能对比

当上下文狂飙,谁在维持KV Cache的秩序?图7

英特尔KV Shrink方案与不使用压缩/解压缩方案的性能对比

滑动查看更多


至强处理器和内置QAT的结合所带来的成果是显著的,它们大幅提升了长上下文推理的吞吐与效率,为AI推理需求交出了一份行之有效的答卷。


当上下文狂飙,谁在维持KV Cache的秩序?图8

夯实硬件底座,至强处理器重新定义AI推理时代的CPU价值


除了QAT以外,至强处理器还集成了英特尔® DSA(Data Streaming Accelerator)数据流加速器,这是一个高性能数据拷贝与转换加速器,可从CPU分载数据移动任务,支持内存拷贝、数据填充等多种数据操作。DSA专为优化流式数据移动与转换操作而设计,可显著提升数据搬运的IOPS性能。


两大硬件加速器协同工作,让CPU高效承担起KV Cache的跨层数据流动、压缩和调度优化,将宝贵的GPU算力从繁琐的缓存管理中解放出来,专心做Token生成。


从存储压缩到性能提升,从单点测试到场景验证,英特尔以QAT无损压缩和系统级创新为KV Cache管理构建了兼顾精度、性能与成本的完整解题路径,这正是至强在AI推理时代不可替代的价值所在。




想要了解更多,点击“阅读原文”,获取英特尔白皮书《以“存”代算,英特尔KV Shrink破解大模型长上下文推理瓶颈》。白皮书围绕“以存代算”这一核心概念,系统阐述大模型推理中KV Cache膨胀引发的显存瓶颈与TTFT困境,并说明英特尔推出的KV Shrink方案如何通过分层卸载与QAT硬件无损压缩实现5倍TTFT提升与50%以上存储压降,为行业提供了兼顾性能与成本的系统级解题思路。




向上滑动阅览

注释:

  1. 测试配置:处理器:双路英特尔® 至强® 金牌6554S处理器;GPU:英伟达L20*2;OS :Ubuntu 22.04.3 (Kernel 6.8.0-47-generic);LLM模型:Qwen/Qwen3-32B, TP2;Benchmark method: vllm bench serve, 100 iterations;Baseline: vllm v0.10.0;chunked prefill:disabled

  2. 测试配置:处理器:双路英特尔® 至强® 金牌6554S处理器;GPU:英伟达H800*8;LLM模型:Qwen/Qwen3-32B-fp8; SW: vllm v0.13。LM Cache请参阅:https://docs.lmcache.ai


©英特尔公司,英特尔、英特尔logo及其它英特尔标识,是英特尔公司或其分支机构的商标。文中涉及的其它名称及品牌属于各自所有者资产。



/转载请注明出处/

当上下文狂飙,谁在维持KV Cache的秩序?图9

关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。
more
2025年中国半导体CVD设备行业发展现状、竞争格局及前景展望:行业技术不断进步,市场规模超500亿元[图]
富加镓业MOCVD外延片助力氧化镓功率器件全链路贯通
【DeepSeek问答】半导体技术对比分析:CVD-PVD-ALD
2025年中国CVD 碳化硅零部件行业市场调查研究报告-华经产业研究院
Copyright © 2025-成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号