

在当今AI技术快速发展的浪潮中,多模态大模型正成为推动智能应用落地的核心引擎。从能够理解图像和音频的对话助手,到能够生成代码的编程智能体,这些复杂的模型为我们带来了前所未有的交互体验。然而,在这光鲜的背后,支撑模型推理运行的算力基础设施,正面临着日益严峻的能耗挑战。每一次模型调用,每一轮词元生成,都伴随着巨大的电力消耗。
面对这一挑战,来自加州大学河滨分校、NVIDIA和印度理工学院布巴内斯瓦尔分校的研究团队,将目光投向了现代GPU内部的动态电压频率调节机制。他们发现,由硬件电源管理单元自动管理的频率调节策略,在多模态推理服务的复杂场景下,存在着显著的能量利用效率低下问题。为此,他们提出了一种名为Tri-Serve的软件端解决方案,旨在从根源上优化能效。

论文标题:Energy-Efficient Multimodal Inference Serving with Tri-serve
论文链接:https://arxiv.org/pdf/2606.29629
研究背景:多模态推理的能耗困境
多模态大模型通常采用复杂的多阶段流水线架构。以Qwen-Omni系列模型为例,其推理过程被分解为"思考者"、"讲述者"和"声码器"三个主要阶段,分别负责核心推理、声学词元生成和最终音频波形合成。由于每个阶段都拥有独立的模型权重和庞大的键值缓存,它们通常需要被分配到不同的GPU上运行,通过生产者-消费者队列进行数据交换,形成一条流水线。
这种流水线并行架构虽然提升了吞吐量,但也带来了新的问题:上游阶段(如"思考者")和下游阶段(如"声码器")的计算速度存在天然差异。当下游阶段处理完队列中的数据,而新的数据尚未到达时,GPU核心就会进入空闲等待状态。研究团队通过性能剖析工具发现,在这种由阶段间依赖导致的空闲等待期间,GPU的流多处理器核心频率和显存频率却依然维持在接近自动加速上限的高位,造成了显著的"空转耗电"。

图1展示了Qwen-Omni三个阶段的流水线结构,以及各阶段在不同计算阶段(预填充、解码、空闲)的SM频率、功耗和张量利用率变化。可以明显看到,在Vocoder(声码器)的空闲期,频率和功耗并未显著下降。
深入剖析:GPU能效低下的三大根源
研究团队通过对vLLM-Omni服务框架运行Qwen-Omni模型的深入剖析,揭示了现代多模态推理服务中三类主要的功率低效问题。
第一类:阶段间依赖空闲期的功率浪费。 如图2所示,在真实的在线服务场景中,由于阶段间执行速度不匹配,依赖等待导致的空闲时间占总GPU时间的比例相当可观,其中声码器阶段的空闲时间占比甚至高达34%。这些空闲期通常持续时间较长,但GPU的硬件电源管理单元并未将频率降至最低的P8空闲状态(SM频率210MHz,显存频率810MHz),而是维持在接近峰值的频率,导致不必要的功耗。

图2显示了Thinker、Talker和Vocoder三个阶段在依赖等待时的空闲时长分布。可以看到,Vocoder的空闲等待时间最长,且所有阶段都存在大量超过10毫秒甚至秒级的空闲等待。
第二类:自动加速频率与算术强度的"反相关"现象。 研究团队观察到一个有趣且低效的现象:在需要高计算性能的预填充阶段(算术强度高,计算密集),GPU的SM频率反而较低;而在计算需求较低的解码阶段(算术强度低,访存密集),频率却升至自动加速上限。这意味着GPU在"该出力时不出力,不该出力时猛出力"。
为了探究这一现象的根源,团队设计了一个"频率锁定屋顶线"微基准测试。如图3所示,测试结果清晰地展示了硬件电源管理单元的频率调节策略:在低算术强度的访存密集阶段,PMU允许频率达到最高值;随着算术强度增加至计算与访存平衡的区域,功耗触及上限,核心频率开始下降;进入高算术强度的计算密集阶段后,由于访存活动减少,部分功耗预算重新分配给计算核心,频率略有回升,但仍远低于低算术强度阶段所能达到的频率。

图3通过微基准测试揭示了GPU PMU频率管理策略与算术强度的关系。图中显示,对于低算术强度工作负载,PMU会选择最高频率(标记1),但同样的吞吐量完全可以在更低频率下实现(标记4),造成了能量浪费。
第三类:计算密集阶段的热节流效应。 在高算术强度的预填充阶段,研究团队观察到了SM频率随时间单调下降的现象(图4a)。这是由于计算密集的核函数会产生更多热量,导致GPU芯片温度升高。硬件PMU在管理自动加速频率时,会依据实时的热裕量进行调整。随着计算密集阶段的持续运行,热裕量逐渐耗尽,PMU被迫降低频率以防止过热,即发生了"热节流"。如图4c所示,对于计算密集型核函数,由于热节流导致的频率下降可达400-800MHz,直接影响了计算吞吐量。

图4a展示了Thinker/Talker预填充阶段频率随时间下降的现象。图4b显示了在不同算术强度下,TFLOPS(每秒万亿次浮点运算)与温度的关系,高算术强度下性能随温度升高下降明显。图4c量化了不同算术强度下稳态频率的下降幅度。
Tri-Serve:三重感知的能效优化方案
基于以上发现,研究团队提出了Tri-Serve,一个软件协调的DVFS控制器。它通过联合优化处理上述三类低效问题,旨在实现高效节能的多模态模型推理服务。Tri-Serve的核心架构如图5所示,包含三个主要组件。

1. 空闲感知频率调节:解决依赖等待的功耗问题。 当检测到GPU因阶段间依赖而进入阻塞等待状态时,Tri-Serve会立即将SM频率和显存频率分别降至最低的P8状态(210MHz和810MHz)。一旦等待结束,再恢复自动加速。由于依赖等待通常持续时间较长(图2),这一简单直接的策略能有效减少"空转"功耗。
2. 算术强度感知频率调节:为不同阶段选择最优频率。 该组件旨在解决PMU频率选择与算术强度反相关的问题。其核心思想是:对于一个给定算术强度的工作阶段,找到能够达到基线吞吐量(或可接受的略低吞吐量)的最低功耗,并选择实现该功耗的最高频率。
为了实现这一目标,团队构建了吞吐量和功耗的数学模型。吞吐量模型(公式1)基于经典的屋顶线模型,描述了在访存受限和计算受限区域性能与算术强度及频率的关系。功耗模型(公式2)则考虑了空闲功耗、随利用率变化的动态功耗以及功耗墙的限制。通过对基准测试数据的拟合(图6),模型能够准确预测不同算术强度和频率下的性能与功耗,从而为实时决策提供依据。


图6a和图6b分别展示了吞吐量模型和功耗模型与实测数据的拟合情况,验证了模型的准确性。
在运行时,Tri-Serve首先通过性能剖析工具获取当前阶段(如解码)内所有计算核函数的算术强度,并计算其时间加权平均值(公式5)。如图7所示,不同阶段和不同计算阶段的算术强度存在显著差异。然后,通过一个轻量化的优化求解器(公式6),快速找到该算术强度下的最优工作频率。



图7展示了Qwen2.5-Omni-7B模型推理过程中,Thinker、Talker、Vocoder各阶段在预填充和解码时,内部核函数的算术强度分布。颜色条带表示每个时间窗口内各核函数算术强度的10%-90%分位数范围。
3. 热裕量感知频率调节:避免计算密集阶段的热节流。 为了避免预填充等计算密集阶段因过热导致的频率衰减,Tri-Serve采用了一种"先缓后急"的两阶段频率调节策略。
缓行阶段:在阶段开始时,选择一个可持续的、不会快速耗尽热裕量的较低频率(例如1800MHz)运行一段时间(如预填充时长的10%)。这相当于为GPU"热身"并储备热裕量。 急行阶段:在剩余的90%时间里,开启GPU的自动加速功能。由于在缓行阶段积累了热裕量,PMU此时能够允许并维持一个更高的频率运行,从而提升整体计算性能。
效果评估:能效显著提升,性能保持稳定
研究团队在配备8块NVIDIA RTX A6000 Ada GPU的工作站上对Tri-Serve进行了全面评估,使用Qwen2.5-Omni-7B模型和vLLM-Omni服务框架。
消融实验 结果(表I)清晰地展示了每个优化组件的贡献:
仅使用空闲感知调节,可将每输出词元的能耗降低13.1%,且对延迟和吞吐量无任何影响。 仅使用算术强度感知调节,主要优化解码阶段,能耗降低6.5%,对性能有轻微影响,同时显著降低了GPU峰值温度。 仅使用热裕量感知调节,能耗降低1.7%,但吞吐量反而提升了1.4%,同时温度控制效果最佳。 Tri-Serve(全组件) 综合效果最佳,实现了22.1% 的能耗降低,吞吐量还有0.8%的提升,并将峰值温度控制在最低的64°C。

与基线对比 实验(表II)将Tri-Serve与多种策略进行了比较,包括默认的硬件自动加速、固定的中档频率、以及为单模态大模型设计的先进节能策略throttLL'eM。实验涵盖了离线、不同在线请求率的多种场景,以及2-GPU和3-GPU两种部署配置。

在所有测试场景中,Tri-Serve都一致地实现了最佳的能效,每输出词元的能耗相比默认的自动加速基线降低了20.8%至23.7%。与此同时,Tri-Serve在首词元延迟、每输出词元时间等服务质量指标上,几乎与性能最强的自动加速基线持平,显著优于固定的中档频率策略。而专门为文本大模型设计的throttLL'eM策略,由于无法全面应对多模态流水线的独特挑战(如阶段间依赖和热节流),其能效提升远低于Tri-Serve。
总结与展望
Tri-Serve的工作揭示了现代GPU硬件电源管理机制在多模态AI推理服务场景下的局限性,并成功通过软件层面的协同优化,实现了显著的能效提升。它通过空闲感知、算术强度感知和热裕量感知这三重优化,精准地对准了能耗浪费的"靶心",在几乎不影响服务性能的前提下,将能效提升了超过五分之一。
这项工作为未来绿色、可持续的AI计算基础设施提供了新的思路。随着多模态大模型应用的不断普及,其巨大的能耗成本不容忽视。像Tri-Serve这样从系统软件层深入硬件行为进行优化的方案,有望在数据中心规模部署时产生巨大的经济和环境效益。未来,如何将此类优化与更广泛的集群资源调度、模型压缩等技术结合,构建端到端的节能AI服务栈,将是值得深入探索的方向。
> 本文由 Intern-S2 等 AI 生成,机智流编辑部校对
-- 完 --
机智流推荐阅读:
1.
2.
3.
4.
cc | 大模型技术交流群 hf | HuggingFace 高赞论文分享群 lc|LangChain 技术交流群 code | AI Coding 交流群 具身 | 具身智能交流群 硬件 | AI 硬件交流群 推理 | AI 推理框架交流群 智能体 | Agent 技术交流群