为MoE解绑:全新「专家即服务」推理架构发布,超细粒度扩展锐减37.5%成本

机器之心 2025-10-13 12:18
为MoE解绑:全新「专家即服务」推理架构发布,超细粒度扩展锐减37.5%成本图1

本文第一作者刘子铭为新加坡国立大学三年级博士生,本科毕业于北京大学,研究方向为机器学习系统中的并行推理与训练效率优化。通信作者为上海创智学院冯思远老师和新加坡国立大学尤洋老师。共同作者来自于上海奇绩智峰智能科技有限公司,北京基流科技有限公司等。


近年来,大型语言模型的参数规模屡创新高,随之而来的推理开销也呈指数级增长。如何降低超大模型的推理成本,成为业界关注的焦点之一。Mixture-of-Experts (MoE,混合专家) 架构通过引入大量 “专家” 子模型,让每个输入仅激活少数专家,从而在参数规模激增的同时避免推理计算量同比增长。这一稀疏激活策略使模型能扩展到数万亿参数规模,但也给推理系统带来了新的挑战:


扩展性差:


现有主流 MoE 推理框架大多要求使用大规模同步通信组来部署模型,一次性占用大量 GPU 资源,使弹性资源伸缩变得十分困难。这种粗粒度伸缩方式导致资源供给无法严格按照当前用户流量进行调整,只能按整块单元增加或减少,造成资源浪费。


容错性低:


传统 MoE 推理采用全局紧耦合架构,各 GPU 间通过 All-to-All 等大规模集体通信协同工作。在这种高度依赖统一通信组的设计下,任意一个节点故障都可能迫使整个服务集群重启,导致服务中断。也就是说,系统缺乏容错能力,一处故障即全局崩溃。


负载不均:


MoE 中的专家调用是动态稀疏的,哪个专家被激活取决于输入内容,在不同的工作负载下被激活的分布有很大区别。固定的专家映射和资源分配策略难以适应这种波动。某些专家所在 GPU 因频繁命中而过载,而其他专家节点长期闲置,造成资源利用低下。


通过观察,作者发现这些问题其实有共同的根本原因:整个系统被当作一个庞大的 “有状态整体” 去管理。事实上,专家层本质上是无状态的,它对输入执行纯函数计算,不依赖历史上下文。作者利用这一特性,将专家层的计算抽象为独立的无状态服务,与维护 KV 缓存的 Attention 前端解耦部署。尽管近期也有研究尝试解耦 Attention 层与专家层、按不同组件拆分部署,但仍未根本解决伸缩僵化、大规模容错等问题。为此,本文作者提出了一种全新的 MoE 模型推理系统 ——Expert-as-a-Service (EaaS),旨在通过架构层面的创新来提升大规模 MoE 推理的效率、扩展性和鲁棒性。


为MoE解绑:全新「专家即服务」推理架构发布,超细粒度扩展锐减37.5%成本图2


方法


为MoE解绑:全新「专家即服务」推理架构发布,超细粒度扩展锐减37.5%成本图3


EaaS 的 “专家即服务” 的架构转变,使 MoE 推理能够像微服务一样灵活调度。在这一前提下,作者对系统进行了如下设计:



为MoE解绑:全新「专家即服务」推理架构发布,超细粒度扩展锐减37.5%成本图4

EaaS 专家服务器的动态批处理机制。



为MoE解绑:全新「专家即服务」推理架构发布,超细粒度扩展锐减37.5%成本图5

EaaS 利用 InfiniBand GPUDirect Async (IBGDA) 来实现低通信延迟,并通过完全 CUDA graph 捕获来最小化内核启动开销,从而实现无 CPU 控制的通信。



为MoE解绑:全新「专家即服务」推理架构发布,超细粒度扩展锐减37.5%成本图6



实验


论文通过一系列大规模实验,利用端到端的 benchmark 对比了 EaaS 与当前主流 MoE 推理方案(如 SGLang + DeepEP、vLLM + DeepEP 以及 SGLang + TP 等组合)的性能,在扩展性和容错等方面展现出 EaaS 的优势。


为MoE解绑:全新「专家即服务」推理架构发布,超细粒度扩展锐减37.5%成本图7



为MoE解绑:全新「专家即服务」推理架构发布,超细粒度扩展锐减37.5%成本图8



为MoE解绑:全新「专家即服务」推理架构发布,超细粒度扩展锐减37.5%成本图9



为MoE解绑:全新「专家即服务」推理架构发布,超细粒度扩展锐减37.5%成本图10

1 对 3 往返通信平均延迟


为MoE解绑:全新「专家即服务」推理架构发布,超细粒度扩展锐减37.5%成本图11

2 对 2 往返通信平均延迟


除此以外,作者也将 EaaS 的通信库与当前开源的 Step3 中 StepMesh 使用的通信库进行了 torch 侧调用从端到端的延迟比较,并发现在对称与非对称的场景下,EaaS 的通信库通过 IBGDA 本身的高效通信模式与仅 CPU-free 的结构支持的 CUDA graph 带来的 kernel launch 开销的 overlap,最多将延迟降低了 49.6%。


总结


面向未来,EaaS 展现出在云端大模型推理和模型即服务(MaaS)等场景中的巨大潜力。其细粒度的资源调配能力意味着云服务提供商可以根据实时负载弹性地调整 MoE 模型的算力分配,从而以更低的成本提供稳定可靠的模型推理服务。这种按需伸缩、平滑容错的设计非常契合云计算环境下的多租户和持续交付需求。另一方面,EaaS 的服务化架构具有良好的可运营和可演化特性:模块化的专家服务便于独立升级和维护,通信调度组件也可以逐步优化迭代,从而使整套系统能够随着模型规模和应用需求的变化不断演进。


为MoE解绑:全新「专家即服务」推理架构发布,超细粒度扩展锐减37.5%成本图12


© THE END 

转载请联系本公众号获得授权

投稿或寻求报道:liyazhou@jiqizhixin.com


关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。
more
脑机接口走进养老,但它可能先制造一道「神经鸿沟」
成都关于征集2026年“揭榜挂帅”(脑机接口方向)项目需求的通知
脑机接口新进展:Paradromics Connexus® BCI 让首位植入者用神经活动实时“说话”
全球首个人工智能+脑机接口标准中国首发,我国第三个脑机接口医疗器械标准将于2027年9月1日起正式实施
告别键盘与屏幕?Science Corp CEO Max Hodak 描绘“后屏幕时代”的脑机交互新图景
脑机人物 x 脑韵科技王朝阳:一副测脑电的耳机,如何从众筹走到量产?
全球首个人工智能+脑机接口标准 中国首发!
算力尽头是电力|郑海荣院士:普通人能用的脑机接口,非侵入才是正解
全球首个人工智能+脑机接口标准发布!
被忽视的脑机接口供应链:封装市场2033年将突破1亿美元
Copyright © 2025-成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号