7月18日,2026 世界人工智能大会(WAIC)如期举办。翼华科技(北京)股份有限公司(以下简称翼华科技)联合创始人兼高级副总裁贾淑芸受邀参加由观察者网、WAIC CONNECT主办,半导体行业观察协办的《重构算力——AI算力需求与供给的结构性重构产业链接会》。

图:翼华科技联合创始人兼高级副总贾淑芸
推理成本的隐形墙:瓶颈从“算力”到“记忆”
当大模型上下文窗口从几千Token扩展到百万级,当多轮对话、多智能体协作成为主流应用形态,一个被长期忽视的问题正浮出水面——推理成本的瓶颈,正在从“算力”转移到“记忆”。
同样的模型、同样的GPU,推理成本却可能天差地别。短对话场景下,几千Token的上下文,KV Cache常驻HBM,成本可控。但在长上下文Agent任务中,数十万乃至百万级Token、多轮往返,KV Cache被反复驱逐、反复重算,GPU大量时间消耗在“补作业”而非实际推理上。
KV Cache,即大模型推理过程中缓存的注意力键值(Key/Value),本质上是模型的“工作记忆”。缓存它们,模型就不必在每生成一个新Token时重新“算一遍”全部历史。但代价是:KV Cache随上下文线性增长,很快超过单卡HBM容量。一旦被驱逐,再次命中时只能重算,而重算=烧钱——多花GPU时间、多耗电、拉高首Token延迟。
贾淑芸称,多智能体、多轮对话、长上下文三重压力正在让工作记忆“装不下”。KV Cache不再是“临时副产品”,而是必须被专门管理的一等数据资产。
在大规模 AI 推理与智能体业务普及的当下,KV Cache 的价值属性发生根本性转变,它不再是模型推理过程中产生的临时中间副产品,而是需要持续留存、分层调度、精细运营的一等数据资产。
当前业界推理体系普遍存在显著的三级存储断层与资源错配难题:GPU HBM 拥有 TB/s 级超高带宽、超低时延,是实时推理的最优介质,但容量仅有 GB 级别、成本昂贵,无法承载海量长上下文缓存;主机 DRAM 拥有数百 GB/s 带宽与百 GB 级容量,可适度缓解缓存压力,但规模化部署成本依然偏高;而NFS、对象存储等大容量外部存储或基于 POSIX 接口的分布式文件/对象存储具备 PB 级超大容量、成本低廉的优势,却受限于仅 GB/s 级带宽与较高访问延迟,无法满足推理实时读写需求。
三级介质性能、容量、成本严重不匹配,造成 KV Cache 频繁逐出、重复计算、数据搬运低效,成为制约 Token 生产成本下降与推理吞吐提升的核心结构性瓶颈。
解决方案:DPU驱动的Context Memory节点
长期以来,行业只能被动二选一:将海量 KV Cache 强行塞进稀缺的 GPU 显存,牺牲并发承载上限;或是卸载至远端通用存储,承受极高重算率与首 Token 延迟。基于这一行业痛点,翼华科技提出核心论断:现代推理基础设施缺失关键中间层级 —— 上下文记忆层,该层级需要兼具接近内存的访问时延、接近闪存的容量成本,同时支持跨节点全局共享,补齐 HBM 与后端存储之间的架构空白。针对这一缺口,翼华给出完整技术解决方案:在 GPU 计算集群与后端持久化存储之间,搭建一层专为 KV Cache 调度而生的共享上下文记忆层,由自研 AI-DPU 承担全部数据调度、传输、压缩与索引工作,重构推理全链路数据流转逻辑。
翼华科技是国内专注高性能算力网络 DPU / 智能网卡芯片研发、智算集群互联整体方案的硬科技企业。企业以算力互联为核心赛道,解决万卡级 AI 集群、大模型训练推理场景的网络瓶颈,形成 “自研芯片硬件 + 成套算力解决方案” 一体化模式。
翼华 AI-DPU 体系实现 KV Cache 按访问热度自动分层驻留、无感迁移,构建热 - 温 - 冷三级完整存储池:
热 KV 为当前正在解码、高频交互的会话缓存,直接驻留 GPU HBM,保障 Token 生成极低延迟;
温 KV 为短周期内需要快速回填复用的上下文数据,统一存放于 Context Memory 内存节点池,依靠 DRAM 平衡容量与时延;
冷 KV 为历史归档、低频访问的长期会话数据,下沉至NFS、对象存储或NVMe 闪存资源池,以低成本承载海量存量缓存。
三级存储池依托翼华自研高速 RDMA 网络平面,实现 KV 数据块跨 GPU、跨内存节点、跨闪存池零拷贝传输,全部迁移、置换、预热逻辑交由 AI-DPU 硬件调度,无需占用主机 CPU 算力,不干扰 GPU 核心推理计算任务。整套分层架构彻底摆脱传统缓存逐出机制,实现上下文资源全局池化复用。
翼华AI-DPU的三大关键能力
依托 “图南” 算力互联芯片、“培风” AI 加速芯片双芯协同架构,翼华清晰定义 AI-DPU 在上下文记忆层的核心价值,三大硬件卸载能力直击行业核心痛点:
第一,全局 KV 索引与元数据硬件卸载。DPU 独立承载全集群会话 KV 块管理,毫秒级完成任意会话、任意智能体、任意模型缓存块的位置检索,把 CPU 低效的索引查询工作下移至专用硬件,释放通用算力资源用于推理计算。
第二,跨节点 RDMA 零拷贝高速传输。依托图南系列网卡成熟商用 RDMA 引擎,KV 数据块在各级存储介质间直达搬运,无主机内存中转;图南二代芯片进一步强化 KV Cache、向量数据库双重卸载能力,适配海量并发长上下文推理场景。
第三,在线压缩加密与智能预取硬件加速。数据写入闪存池实时硬件压缩,跨节点传输全程硬件加密,多租户安全隔离原生嵌入芯片层;同时搭载智能预取流水线,在 Decode 阶段启动前提前将待使用 KV 块预热至 GPU 侧,将数据加载延迟隐藏在计算流程中,从根源降低首 Token 等待时长。
效果验证:性能跃升与成本下降
从源头压低单 Token 生产成本
基于1M上下文、200 并发的真实业务集群验证,翼华 AI-DPU 上下文记忆方案实现全方位指标突破:首 Token 平均延迟下降约 60%,集群整体推理吞吐量提升 3 倍,KV 重复计算率趋近于零,单 Token 综合运营成本降低 50% 至 70%,所有性能优化均可转化为可量化的算力、存储、电力成本节约。
方案核心降本逻辑在于消除无效重复计算:系统提示词、RAG 知识库、智能体工具定义等公共前缀 KV 仅完成一次 Prefill 计算,海量业务请求共享同一份缓存资源,大幅摊薄预处理开销;多轮会话、长周期智能体任务缓存存入全局共享池,会话挂起后再次唤醒无需完整重算上下文,显著改善交互体验。同时方案兼容 vLLM、SGLang、Dynamo 等主流推理调度框架,提供标准化接入接口,存量集群无需重构模型代码即可平滑部署落地,兼顾改造成本与业务连续性。
翼华科技的方案强调兼容异构GPU与标准以太网,兼顾存量集群改造,渐进式接入,不推倒重来。翼华科技同时开放POC合作计划,邀请客户带着真实负载来共同验证。
其长期愿景是:上下文记忆层,将成为AI基础设施的标准一层——如同当年的CDN之于互联网。
“算力决定模型能想多快,记忆决定模型能想多远——而成本,决定这一切能否普惠。”
翼华科技正以“图南”+“培风”双芯驱动,在AI-DPU这一关键赛道构筑国产算力底座的又一块重要拼图,让每一个Token更便宜,让AI推理真正走向规模化普惠。
点这里👆加关注,锁定更多原创内容
*免责声明:文章内容系作者个人观点,半导体芯闻转载仅为了传达一种不同的观点,不代表半导体芯闻对该观点赞同或支持,如果有任何异议,欢迎联系我们。
推荐阅读

喜欢我们的内容就点“在看”分享给小伙伴哦~![]()
