LPDDR,成为AI新贵

半导体行业观察 2026-07-27 09:25

公众号记得加星标⭐️,第一时间看推送不会错过。


随着人工智能工作负载在数据中心需求中占据越来越大的份额,通用服务器和人工智能服务器面临的最关键限制因素也在发生变化。功耗和散热预算,而不仅仅是原始计算能力,越来越决定着机架能够完成多少有效工作。而这正是LPDDR5X和新型SOCAMM2模块化设计开始为数据中心带来显著优势的关键所在。SOCAMM2将低功耗DRAM的高效性和高密度集成到专为服务器设计的模块化、可维护模块中,从而为以前难以实现的系统架构打开了大门。


但幻灯片上的好想法并不等同于经过验证的想法。因此,我们着手回答一个更难的问题:当将这种内存部署到真实的数据中心工作负载中时,它会带来什么区别?


要做到这一点,需要密切合作:美光的数据中心工作负载工程团队与 Meta 的工程师并肩工作,使用 Meta 的开源 DCPerf 基准测试套件,该套件能够反映超大规模数据中心的生产环境。正是这种合作关系使得测试结果值得关注:这些测量结果基于反映真实数据中心环境的工作负载。


我们研究了决定一种内存技术是否适用于数据中心的关键维度:带宽、延迟、容量和能效。我们的研究分析了包括高容量配置在内的 LPDDR5X 如何影响这些维度。我们的一些发现令人惊讶,特别是当为受限于容量的工作负载提供足够的内存时会发生什么。


结论很简单:数据中心内存的选择不再仅仅局限于速度最快或容量最大的内存,而是要根据不同的工作负载选择合适的内存。SOCAMM2 为系统设计人员提供了一种全新的选择。


完整的内容(方法论、工作负载和数据)都在这篇美光与 Meta 联合发布的白皮书中。如果您正在为性能上限、容量限制或扩展 AI 基础设施的经济性问题而苦恼,这份白皮书值得您花时间阅读。




适用于大规模数据中心部署中通用

和人工智能工作负载的LPDDR




随着数据中心面临日益严峻的电力和散热限制,向 LPDDR5X 的转变是服务器架构的一次关键演进。LPDDR5X 最初应用于移动和边缘设备,如今凭借其在提供更高内存带宽的同时,功耗仅为传统 DDR5 实现的几分之一,因此在现代数据中心工作负载方面具有独特的优势。随着人工智能和通用计算 (GPC) 工作负载的不断扩展,这种能效对于控制数据中心的总体拥有成本 (TCO) 至关重要。诸如 SOCAMM2 等新型模块化外形进一步推动了这一转变——它既具备移动内存的效率,又满足数据中心所需的可维护性,从而使 LPDDR5X 成为超大规模部署的实用且极具吸引力的选择。


这项工作是 Meta 和 Micron 合作的成果,旨在评估 LPDDR5X 在数据中心环境中的适用性,并在典型工作负载下对其内存带宽、容量、延迟和能效进行表征。我们采用了 Meta 公司的开源基准测试套件 DCPerf,该套件能够反映真实数据中心的工作负载。Meta 开发 DCPerf 的目的是为了代表其超大规模数据中心集群中的主要工作负载类别,并利用应用级指标和系统级信号来指导平台选择。Meta 内部使用 DCPerf 进行产品评估、平台配置和数据中心采购决策。该套件旨在基于生产集群的分析来模拟主要工作负载类别,其基准测试结果用于指导软硬件协同设计和早期优化。


更高的 LPDDR5X 容量和带宽能够显著提升 DCPerf 套件中 AI 和 GPC 工作负载的性能。这种方法能够更好地利用资源并降低能耗,使其成为寻求在性能和可持续增长之间取得平衡的企业和数据中心的理想选择。我们将从这些维度对 LPDDR5X 进行全面的表征。


绩效评估和规模分析


我们的分析围绕四个关键维度展开:带宽、延迟、容量和能效。这些维度涵盖了决定内存子系统是否适用于现代数据中心工作负载的主要特性。对带宽敏感的工作负载可直接受益于 LPDDR5X 更高的信号传输速率,而对延迟敏感的工作负载则会在实际并发情况下考验内存访问响应时间。容量敏感性则反映了工作集大小成为瓶颈的场景。能效是所有这些维度的基础,LPDDR5X 的低工作电压使其能够在显著降低能耗的同时提供极具竞争力的性能,从而优化整个内存集群的总体拥有成本 (TCO)。总而言之,这四个维度构成了一个全面的框架,用于评估 LPDDR5X 在生产数据中心环境中的价值所在和应用方式。


一、工作负载

我们从 DCPerf 中选择了一系列 AI 和 GPC 基准测试用于本次研究。这些测试包括张量重批处理、反序列化、MediaWiki 和 SparkBench,旨在评估 LPDDR5X 在实际数据中心条件下的带宽、功耗、容量和延迟特性。


内存带宽敏感型工作负载:张量重批处理会执行持续的多线程内存复制 (memcpy) 操作,将数据从大型内存池复制到连续的输出缓冲区,从而构成内存带宽敏感型工作负载。反序列化则通过模拟数据摄取管道中典型的内存访问模式来补充这一挑战,在这些管道中,序列化的张量数据必须在推理之前在内存中进行解析和重构。这两种操作都代表了 AI 数据管道中的关键阶段,在这些阶段,数据移动是性能和能耗的主要影响因素。


对内存延迟敏感的工作负载:为了描述内存性能如何影响 GPC 工作负载的尾延迟,我们运行了 mediawiki_mem 工作负载,并扫描了一系列线程连接数 (-c) 值,测量了吞吐量(每秒请求数,或 RPS)和并发度增加时的请求延迟。MediaWiki 基准测试模拟了 Facebook 在元数据中心的 Web 服务工作负载。


对内存容量敏感的工作负载:为了展示 LPDDR5X 的容量优势,我们评估了 SparkBench 在默认配置和更高负载配置下的性能。Spark SQL 工作负载对内存容量非常敏感,因为它们依赖于将大型数据集、中间 shuffle 数据和操作系统页面缓存驻留在内存中,以避免代价高昂的溢出到磁盘操作。当内存容量不足时,shuffle、排序和扫描阶段会产生重复的磁盘 I/O,从而显著增加端到端执行时间。SparkBench 通过运行数据仓库风格的 Spark SQL 工作负载来模拟数据分析工作负载。


虽然传统的LPDDR受限于其焊接式设计,但SOCAMM外形尺寸通过模块化、高密度接口消除了这一障碍。这使得数据中心能够显著扩展内存容量,从而使这些工作负载能够在不牺牲性能的情况下处理驻留在内存中的海量数据集。


二、硬件平台

我们评估了两种 LPDDR 内存配置。SKU1 采用 4 列配置,每个插槽容量为 512GB,读写速度为 6400 MT/s。SKU2 采用 2 列配置,容量为 256GB,读写速度为 8533 MT/s。SKU1 更高的列数通过堆叠更多 DRAM 芯片来增加容量,但增加的电负载限制了内存信号传输速率——这解释了为什么 SKU2 尽管容量较低,却能实现更高的数据传输速率。


LPDDR,成为AI新贵图1


三、分析

1、带宽敏感性:LPDDR 更高带宽带来更佳性能


图 1 显示,在张量重批处理工作负载下,SKU2 的 LPDDR5X 内存(8533 MT/s)比 SKU1(6400 MT/s)提供更高的持续 DRAM 带宽。观察到的 13% 带宽优势直接转化为工作负载性能的提升,实现了更高的重批处理吞吐量(11%)和更低的单批处理时间(10%)。


LPDDR,成为AI新贵图2


在 AI 数据管道中,张量重批处理位于数据摄取和计算之间的关键节点。单批处理时间的任何减少都直接转化为加速器空闲时间的减少,从而提高整个管道的吞吐量。SKU2 的带宽优势表明,更高的 LPDDR5X 信号速率可以显著加速这一阶段,减少内存瓶颈,否则内存瓶颈会限制数据到达计算层的速度。


反序列化也表现出带宽敏感性。该工作负载解析序列化的张量数据并在内存中重建,将内存读取与轻量级计算操作相结合。SKU2 的内存带宽提升了 6%,IPC(每周期指令数)提升了 18%,证实了更快的内存接口能够减少后端停顿,使 CPU 可以将更多周期用于执行有效工作,而不是等待内存。


2、能效:LPDDR 的功耗优势


LPDDR,成为AI新贵图3


功耗细分分析(图 2)显示,在内存密集型工作负载下,LPDDR5X 的功耗更低。在张量重批处理基准测试中,DRAM 功耗仅占系统总功耗的 6.8%。这与传统的 DDR5 服务器配置形成鲜明对比,在传统的 DDR5 服务器配置中,内存功耗可能占系统总功耗的更大比例。美光之前的分析已经强调了这一优势,表明 LPDDR5X 的功耗比 DDR5 低 75%(图 3)。


LPDDR,成为AI新贵图4


LPDDR5X 在提供更高内存带宽的同时,实现了卓越的能效。其更低的运行电压和先进的信号传输技术,使得带宽能够在不增加相应功耗的情况下扩展,从而实现了比传统服务器内存更高的每瓦带宽性能。


在数据中心规模下,这种能效优势可以显著降低与电源相关的运营成本——在满足现代 AI 工作负载所需的内存带宽的同时,避免传统 DDR5 解决方案带来的相应功耗和散热开销。


3、GPC 延迟:mediawiki_mem


DCPerf 中的 oss_performance_mediawiki_mem 基准测试是 mediawiki_mem 的优化版本,并结合了优化后的内存级并行 (MLP) 技术,同时加入了 LambdaChase 以增加内存压力。我们扫描了每个线程的连接数 (c=36–288),以表征在并发性增加的情况下每秒请求吞吐量 (RPS) 和尾延迟的扩展性。


在 mediawiki_mem 并发性扫描过程中,SKU2 通过更高的吞吐量实现了服务质量优势,同时将 P99 内存读取延迟降低了 12–20 毫秒(约 9%)(图 4)。这种尾延迟的压缩使负载生成器能够维持更高的有效并发性,从而直接转化为更高的 RPS。


LPDDR,成为AI新贵图5


主要区别在于 SKU2 更快的 LPDDR5X 数据速率(8533 MT/s 对比 6400 MT/s),这提供了更高的带宽和更低的延迟。这减少了后端停顿并提高了核心效率(IPC)——缩短了请求延迟的尾部,而不仅仅是改变了平均值。


使用 Multichase 进行的微基准测试交叉验证显示了相同的根本原因:SKU2 在步长和线程扫描中保持了更高的带宽和更低的加载延迟(图 5(a) – 5(c)),证实了应用层 QoS 的改进本质上是由内存子系统驱动的。


最后,在评估范围内,所有吞吐量/延迟曲线均未达到饱和;当 HHVM 自动扩展限制在两个实例时,所实现的并发性对应于 Multichase 的低线程状态,表明存在额外的扩展空间——预计随着 SKU1 的加载延迟在 ≥16 个线程处出现拐点,SKU2 的优势将进一步扩大。


LPDDR,成为AI新贵图6


4、容量敏感性:LPDDR 的更大容量优势


为了评估容量敏感性,我们在两个平台上分别运行了 DCPerf 套件中的 SparkBench 测试,测试配置为两种:标准查询负载 (spark_standalone_remote) 和负载增加 3 倍的变体 (spark_standalone_remote_3x)。除此以外,两个系统在 CPU 架构、核心数、缓存层次结构和 Spark 工作线程内存分配 (276GB) 方面完全相同,从而将内存容量作为主要的性能变量。


LPDDR,成为AI新贵图7


图 7 清晰地展示了 SKU2 性能差距的根本原因。在标准工作负载下,shuffle 密集型阶段成为主要瓶颈,一旦 shuffle 数据超过可用 DRAM 并溢出到 SSD,性能就会下降 38 倍。在 3 倍负载下,瓶颈转移到以重复读取为主的扫描阶段,SKU2 的性能下降了 5.96 倍,因为其较小的操作系统页面缓存无法保留数据集,导致每次扫描都需要重复读取 SSD。


LPDDR,成为AI新贵图8


相比之下,SKU1 更大的内存容量发挥着双重作用:它将整个 shuffle 工作集保存在 DRAM 中,从而避免磁盘溢出;同时,它还维持着足够大的操作系统页面缓存,以确保频繁访问的数据在不同阶段保持驻留状态。这些效果共同表明,内存容量是 Spark 性能的决定性因素,而配置足够的 DRAM 来同时容纳 shuffle 分区和页面缓存对于避免磁盘 I/O 导致的性能下降至关重要。




结论




我们使用 Meta 的 DCPerf 测试套件进行的评估证实,LPDDR5X 在本文提出的分析框架的四个维度上均表现出色:


  • 在带宽敏感性方面,SKU2 更高的内存速度转化为更高的吞吐量和更短的张量重批处理时间,反序列化进一步证实了更快的内存速度可以减少后端停顿并提高 CPU 利用率。

  • 在延迟敏感性方面,更快的 LPDDR5X 接口在 MediaWiki 工作负载下实现了更低的尾延迟,这表明内存速度的提升同样有利于 GPC 工作负载。

  • 在容量敏感性方面,扩大 LPDDR5X 内存占用量消除了 SparkBench 中的磁盘溢出,从而显著提升了速度。

  • 在能效方面,LPDDR5X 在保持这些性能水平的同时,消耗了更少的系统总功耗。


随着 LPDDR5X 信号速率向 9600 MT/s 及更高水平迈进,在诸如张量重批处理等工作负载中观察到的带宽优势预计将进一步提升,从而进一步提高吞吐量并降低延迟。在容量方面,美光的 256GB SOCAMM2 模块可使每个 CPU 插槽支持高达 2TB 的 LPDDR5X 内存,这种配置能够消除更广泛的大规模工作负载中的磁盘溢出问题。


最终,LPDDR5X 提供了数据中心级带宽、显著的容量扩展能力和更高的能效,这证明它不再仅仅是一种“边缘”技术,而是超大规模 GPC 和 AI 平台至关重要且切实可行的标准。


*免责声明:本文由作者原创。文章内容系作者个人观点,半导体行业观察转载仅为了传达一种不同的观点,不代表半导体行业观察对该观点赞同或支持,如果有任何异议,欢迎联系半导体行业观察。


END


今天是《半导体行业观察》为您分享的第4480内容,欢迎关注。


推荐阅读


LPDDR,成为AI新贵图9


加星标⭐️第一时间看推送


求点赞


LPDDR,成为AI新贵图10

求分享


LPDDR,成为AI新贵图11

求推荐


LPDDR,成为AI新贵图12

关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。
AI
more
明日开幕!600+高层集结,3大专场直击2026全域AI核心技术命题,锚定“破茧·智变”新周期!
AI最尴尬的短板,中国科学院出手了
AI Agent 设计出量产级芯片!(详细流程)
黄仁勋马斯克对中国AI发声/曝苹果智能眼镜明年亮相/携程回应被罚51亿
华大九天亮相DAC 2026|多方案复合布局,AI赋能求索产业全新路径
马斯克对话《经济学人》:AI十年夺权与人类“园艺”隐喻
车百专著 | AI 赋能智能电池:智能材料、内置传感与AI-BMS全链路技术解析
UW天才少女官宣入职OpenAI!46场面试,地狱级求职笔记刷屏
菲尔兹奖得主预警:AI可能杀死数学!
杨植麟直言OpenAI无原创,Kimi K3登顶编程榜引硅谷震荡
Copyright © 2025 成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号