公众号记得加星标⭐️,第一时间看推送不会错过。
据台北时报报道,DeepSeek最新模型声称降低了对HBM的需求,引发市场对“AI模型越来越高效,会不会降低单位推理所需HBM”的担忧。9月11日,SK海力士、三星电子股价分别一度下跌约2.2%和3.5%。韩国投资者本月已经大规模减持两家公司股票。
DeepSeek表示,其AI模型已经减少了对高带宽存储器(HBM)的需求量,这一表态进一步加剧了市场对科技股的担忧,而投资者同时还在担心美国可能加息。
从技术上看,这次真正让存储芯片投资者敏感的,是DeepSeek对KV Cache(键值缓存)的进一步压缩。
9月10日发布的DeepSeek V4.1 Flash是一款总参数量达到5520亿的MoE(混合专家)模型,但其采用全新的因果编码器—解码器(Causal Encoder-Decoder,CED)架构,输入阶段每个Token只激活约80亿参数,输出阶段激活约160亿参数。更重要的是,在支持最长100万Token上下文的同时,DeepSeek将推理过程中最占显存的部分之一KV Cache进一步大幅压缩。
KV Cache为什么重要?大模型在生成文字时,并不会每输出一个Token都重新计算此前全部上下文,而是把此前注意力计算产生的Key和Value保存在显存中,供后续Token直接调用。上下文越长、并发用户越多,需要保存的数据就越庞大。因此在长上下文和Agent应用中,限制系统吞吐量的往往已经不只是GPU算力,HBM容量和带宽同样会成为瓶颈。
DeepSeek V4.1 Flash主要从三个维度压缩这部分数据。其CSA2(Compressed Sparse Attention 2,压缩稀疏注意力2)架构会压缩单个KV条目的大小、减少需要保留的Token数量,并让不同Transformer层之间复用部分KV信息;同时进一步引入FP4格式存储KV Cache。最终,其常驻HBM中的全局KV Cache可以压缩到每Token约890字节,只有上一代DeepSeek V4 Flash的大约四分之一。对于需要存放到SSD或主机内存中的持久化KV Cache,通过SWA Bounded Replay机制,只重新计算最近窗口中的部分Token,其存储占用则降至上一代约八分之一。
这也是资本市场担心三星电子和SK海力士的原因。如果越来越多AI模型都沿着稀疏注意力、KV Cache压缩、低精度存储、跨层KV复用等方向演进,那么完成相同数量的AI推理任务,需要配置的HBM容量理论上可能下降。尤其对于Agent、长上下文推理等高度依赖KV Cache的场景,软件和模型架构创新正在直接提高“每GB HBM能够服务多少Token”。
此前,在大型科技公司继续增加资本开支、股票估值较低、盈利强劲以及股东回报丰厚等因素推动下,市场对这两家韩国芯片巨头的情绪一度有所改善。虽然大多数投资者认为DeepSeek的最新进展只是短期利空,但近期的股价下跌表明,这轮反弹不会是一条直线上升的道路。
Eugene Asset Management首席投资官Ha SeokKeun表示:“DeepSeek的新模型可能会加剧市场对短期半导体需求放缓的担忧。”不过,他同时指出,Meta Platforms和OpenAI等公司的新模型“将通过推动AI实际应用以及半导体需求,对行业基本面产生更大的影响”。
事实上,目前HBM供应依然紧张。路透社9月10日报道称,HBM短缺甚至正在推高中国产AI加速器的成本,多家厂商已经因此提高AI芯片报价。
*免责声明:本文由作者原创。文章内容系作者个人观点,半导体行业观察转载仅为了传达一种不同的观点,不代表半导体行业观察对该观点赞同或支持,如果有任何异议,欢迎联系半导体行业观察。
END
今天是《半导体行业观察》为您分享的第4527期内容,欢迎关注。
推荐阅读
★
★
★
★
★
★
★
★

加星标⭐️第一时间看推送~


