DeepSeek开源昇腾基础组件:计算、通信与编译工具同步发布

机器之心 2026-09-30 12:04
DeepSeek开源昇腾基础组件:计算、通信与编译工具同步发布图1
编辑|泽南

来自 DeepSeek 团队的底层 AI 芯片工具开源了。


9 月 30 日上午,DeepSeek 宣布开源面向华为昇腾算力平台的基础设施组件,覆盖 TileLang 高级语言编译工具、高性能计算库和分布式通信库。根据 DeepSeek 的介绍,这些组件与其此前面向英伟达平台开源的组件一一对应。


DeepSeek开源昇腾基础组件:计算、通信与编译工具同步发布图2

此次发布包含 DeepGEMM、DeepEP、TileKernels、FlashMLA 和 DeepSelect,分别承担矩阵运算、跨设备通信、常规向量计算与访存、稀疏注意力和数据筛选等任务,共同支撑模型运行中的关键环节。


华为则将双方围绕昇腾 950 及超节点开展的联合创新成果在 CANN 社区开源,覆盖模型部署、大规模训练、超长文本 KV Cache 池化与 Agentic RL 等实践,并披露了 DeepSeek-V4.1-Flash 的部分离线推理性能数据。


开源项目链接:



这次开源让我们得以了解 DeepSeek 在国产 AI 算力上开发工具、核心算子和通信组件等方面的进展。而对于开发者来说,现在也可以在更接近模型实际需求的工具基础上开展优化,减少从底层重新实现关键能力的工作。


把前沿模型的算子开发经验带到昇腾


对大模型而言,芯片的理论算力只是起点。模型中的运算如何拆分、数据如何搬运、计算与访存如何衔接都会影响硬件最终能发挥多少性能。这些工作很大一部分落在算子实现上。


用较底层的语言编写算子,开发者就可以精细控制硬件,但也需要处理更多执行细节。模型结构持续变化,新算子不断出现,开发效率与性能优化便需要同时考虑。TileLang 试图解决的正是这个问题。据 DeepSeek 的介绍,其希望提供一种编程更简单、同时能够充分利用芯片计算资源的高级语言,降低高性能算子的开发难度。


DeepSeek 表示,相比于 CUDA 语言,TileLang 的编程模型能够简化代码逻辑、提高算子开发效率和项目可靠性。同时,其设计又强调充分利用硬件资源。团队称,这条技术路线已经在英伟达平台得到验证,目前承载了 DeepSeek V4 系列模型训练中大部分算子的实现。


此次开源的昇腾版本进一步将这一编程方式扩展到国产算力平台。DeepSeek 表示,相比昇腾原生的 Ascend C 底层语言,TileLang 昇腾版大幅简化了编程模型,同时保持硬件性能。据团队披露,DeepSeek 训练中用到的每一个 TileLang 算子,在昇腾上都有对应的高性能实现。


这意味着此次发布已经覆盖了一组源于真实模型训练需求的算子。对于研究者来说,新模型结构往往需要新的计算方式,如果算子的实现与调优门槛下降,验证模型想法所需的工程投入也有望降低。


这套高级语言仍然需要硬件软件接口的支撑。华为介绍,昇腾通过开放的 Ascend C 编程接口与 PTO ISA 底层指令体系,支持 TileLang 的编译对接,有经验的开发者也可以继续进行底层手工调优。


五项组件,覆盖计算与通信关键环节


与 TileLang 一同发布的计算和通信组件,为开发者提供了可复用的基础能力。


DeepSeek开源昇腾基础组件:计算、通信与编译工具同步发布图3


这几项能力覆盖了不同类型的性能瓶颈。矩阵运算关系到计算单元的利用率,向量计算与访存关系到数据处理效率,稀疏注意力和筛选算子则服务于模型更具体的计算需求。


当模型跨越多张加速卡运行时,通信会成为单独需要优化的环节。单卡上的计算再快,如果数据无法及时到达下一步计算所在的设备,整个任务仍然会等待。


DeepSeek 表示,在多项关键测试用例中,此次开源组件的计算与通信性能已接近硬件上限。此次成套开源后,模型团队可以复用已经实现的基础组件,把更多精力投入自身的模型结构和应用需求,在某个环节出现瓶颈时,也能够查看并进一步修改实现。


超节点上的通信优化


此次合作还涉及昇腾 950 机型和 128 卡超节点方案,双方对计算与通信进行了联合优化。


华为提供的方案包括 SuperPoD Flex 与 UBL128 组网。据介绍,UBL128 超节点采用全互联设计,昇腾同时提供 ASC-COMM 高性能自定义通信编程库,支持通信算子以及通算融合算子的开发。


在此基础上,DeepSeek 开发了高性能 DeepEP 通信库,覆盖 EP、CP、PP、FSDP 等模式下的通信算子,分别对应专家并行、上下文并行、流水线并行和全分片数据并行等模型分布式执行方式。


这些并行方式需要传输的数据不同,通信发生的时机也不同。例如,专家并行需要把数据分发给相应专家,再汇聚计算结果。通信与计算的组织方式,会影响设备是否需要等待以及整个任务的执行效率。


华为披露,相关测试中 Dispatch 带宽达到 375 GB/s,Combine 带宽达到 347 GB/s,并称其接近硬件上限。对于大模型集群,这类优化的意义在于让新增的硬件资源能够更有效地参与计算。模型规模扩大、上下文变长,都会改变计算和通信的需求。可见,双方的合作深入到了模型计算方式与硬件互联之间。


V4.1 Flash 推理数据


在具体部署上,华为披露了基于 EP32 部署策略的 DeepSeek-V4.1-Flash 离线推理测试结果。


DeepSeek开源昇腾基础组件:计算、通信与编译工具同步发布图4


TPOT 衡量输出阶段每个 token 的生成耗时,吞吐则衡量单位时间内输出的 token 数量。两组结果呈现了不同 token 生成时延目标下的吞吐表现:在通稿给出的测试中,允许更长的 TPOT,对应更高的每卡输出吞吐。


数据均来自 Offline 推理模式,统计的是不带框架的纯模型性能,不包含 Serving 调度和框架负载均衡的影响,所列测试条件还包括 ContextLength 为 128K,以及 DSpark 投机接受率为 0.85。实际服务还需要考虑请求调度、负载变化和框架开销。


作为一组注明条件的模型执行测试,这些结果为评估昇腾平台上的部署方案提供了参考。对于准备开展部署的团队,能够复现测试并了解参数选择,往往比单独看到一个性能数字更有用。


可复用的联合优化成果


此次计划开放的实践,覆盖从单卡、单机到大规模部署的多个场景,也包含基于 PyTorch 原生框架的模型预训练、低精度量化训练、LoRA 微调和 Agentic RL 等内容。


其中,超长文本 KV Cache 池化涉及长上下文推理中的缓存管理,Agentic RL 则进一步涉及智能体与环境交互过程中的训练基础设施。这些方向说明,对大模型的联合优化正在延伸到模型部署与训练的具体流程。


此次的开源可以帮助开发者理解一项能力如何进入完整任务。计算库和通信库提供可调用的实现,部署及训练实践则提供组合这些实现的参考路径,减少团队各自探索配置与调优方法的成本。


对昇腾软件生态而言,这次发布增加了一套来自前沿模型实际需求的高级语言工具和基础组件,也给其他团队提供了可研究、可修改的工程范本。


DeepSeek开源昇腾基础组件:计算、通信与编译工具同步发布图5


© THE END 

转载请联系本公众号获得授权

投稿或寻求报道:liyazhou@jiqizhixin.com

关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。
开源
more
「开源版Jev」登上Hugging Face热榜第一
DeepSeek开源沙盒DSec:RSI闭环初现,Agent训练迈入“自进化”时代
一套Harness打通前后台:蚂蚁清华开源9B模型Realtime-Venus,让AI办事对话异步并行
DeepSeek开源昇腾适配组件,TileLang助力国产算力生态破局
Suno最强开源对手来了:4090一分钟出歌,把AI音乐从抽卡变成可编辑工程
流式3D重建新SOTA重磅开源 | SURE-Map:长序列漂移大幅降低,点云更干净、几何更锐利,超越LingBot-Map与HorizonStream
DeepSeek 重磅官宣:开源华为昇腾基础组件!
小米凌晨搞大事!MiMo-V2.6开源模型发布,超越 Kimi K3、GLM-5.3,而且不涨价
MiniMax 开源编程 Agent,实测更强更省钱!
刚刚,阶跃Step 5 Preview发布!一举杀进全球开源前三
Copyright © 2025-成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号