
【内容目录】
一、统一算力网,到底统一什么?
二、一笔任务,怎样找到能完成它的算力?
三、网络、电力与时延,怎样一起影响调度?
四、为什么会从租设备,走向买结果?
五、产业链上,谁在解决哪一段交付问题?
六、服务互通与跨芯片协同,分别卡在哪?
引言
空闲算力未必接得上远处的任务。模型适配、数据位置和网络成本,都会影响资源能否被用起来。
2026年9月5日,新华网报道中国联通呼和浩特云数据中心,披露全光无损400G算力智联网及“星罗”对通算、智算和国产、非国产千卡集群的统一管理。同日,国家数据局发布内蒙古调研信息,提出接入全国一体化算力网监测调度体系、推进算电协同,探索“词元工厂”。
这些进展指向一种近期价值:减少资源与任务的错配,让分散算力接住原来接不上的任务。
统一算力网,到底统一什么?
单座智算中心用卡数、机柜和峰值算力描述规模。客户提交任务时,更关心模型能否运行、数据能否使用,以及完成时间、费用和故障处理。

图1 分散算力接入统一服务入口(机制示意)
统一算力网首先要统一资源与任务的描述:资源目录记录芯片、显存、软件环境、网络、数据位置和可用时间;任务描述明确模型、精度、时限、预算与合规要求,再由执行、监测、计量和责任接口连接交付过程。
统一“控制面”组织的是资源描述、任务要求和交付接口,各种芯片仍保留自己的架构与执行方式。
平台可以先把任务交给兼容的资源池,通过统一入口提供服务。至于同一任务能否在不同芯片间迁移,或由多种芯片共同执行,则需要更深入的作业协同。
8月25日,联通披露星罗已从跨域异构混训试验推进到多地混训、混推和AI云服务,将芯片适配、调度、训推切换、网络路径与服务入口串联起来。这是运营商自有体系内的进展,尚不代表全国跨主体服务已打通。
一笔任务,怎样找到能完成它的算力?
以一批需隔夜完成离线推理的文档为例:客户提交模型、数据位置、交付时间和预算,不指定GPU品牌。这是假设场景,不对应已披露订单。

图2 任务提交、资源筛选、执行与结果返回(流程及数值均为示意)
平台先验证芯片型号、软件版本和模型配置,检查框架、编译器、算子、通信库与精度要求是否匹配,筛掉无法运行任务的资源。适配要落到具体组合,品牌名称或目录登记不足以说明任务可以启动。
再比较执行位置。远端空卡可能因数据搬运、网络等待或环境准备错过时限;本地节点虽然单卡价格更高,却可能凭借现成的数据和运行环境更适合完成任务。
运行中还要持续回写状态。节点失联、链路抖动或版本变化时,系统需重试、重启或恢复,并确认替代资源兼容,避免重复计算和恢复开销抵消计算收益。
最终按约定完成文档处理,并留下执行与计量记录。
调度的目标,是找到一条能完成任务的路径。
网络、电力与时延,怎样一起影响调度?
呼和浩特披露的400G网络形成了呼包鄂乌2毫秒、京津冀5毫秒、全国核心节点20毫秒的时延圈。这些连接扩大了节点选择范围,但时延圈描述的是网络连接;模型服务还要计入排队、数据读取、执行和结果回传。
可延后或中断的任务,可结合电价、功率上限和绿电条件选择节点;实时请求与强同步训练,则先受时延和通信代价约束。算电协同需要在交付约束内比较总成本。
训练与推理的运行方式

图3 训练中的节点协同与推理中的请求处理(机制示意)
训练关注收敛、集合通信和检查点(Checkpoint)恢复;推理关注输入处理(Prefill)、逐Token生成(Decode)、KV Cache、请求路由与尾部时延。硅基流动与摩尔线程的联合实测展示了跨芯片缓存与时延优化,效果限于其模型、配置和测试条件。
为什么会从租设备,走向买结果?
当匹配、执行、监测和计量连起来,分散资源才有机会成为一种新的可采购产品。
在隔夜文档处理的例子中,客户把芯片选择和任务放置交给平台,约定结果、时限、预算及异常处理。平台将条件落实到资源和执行过程,再按规则验收、结算。裸卡、整机和专属资源池仍是采购选项,按任务购买是在其上增加一层服务。

图4 设备租用、任务交付与模型调用(机制示意)

国家数据局提到的“词元工厂”,探索的是由模型与算力共同提供Token服务。产品需同时约定模型效果、时延、稳定性和合同责任。
中国铁塔异构算力跨域任务编排系统采购结果,表明跨域编排已进入工程采购与研制。后续还需经过到货验收、持续运行与复购,才能判断服务的商业化程度。
产业链上,谁在解决哪一段交付问题?
产业链的分工,可以按各环节解决的交付问题来理解。

图5 芯片、软件、网络与服务平台的协作分工(机制示意)

表中仅按环节列出代表样本,不表示各家均具备该行全部能力,也不构成合作关系认定。
芯片和系统厂商要做好适配与稳定运行,软件和网络环节减少等待、搬运及故障开销,平台将这些能力组织成客户愿意持续购买的服务。
潜在增量既包括新设备,也包括已有节点的适配、调优、运维与服务化;实际收益仍需订单和利润验证。
服务互通与跨芯片协同,分别卡在哪?
全国范围的扩展,需要分别观察服务互通与作业协同。

图6 跨平台服务与跨芯片计算(机制示意)
服务层解决统一入口、身份互认、验收、计量分账与责任处理,可以先在兼容、承诺支持的资源范围内推进,无须所有芯片一开始就能任意替换。
作业层解决模型跨芯片复现、任务迁移和混合执行,需要逐芯片、软件版本与网络拓扑验证精度、通信、性能和恢复能力。统一接口并不消除这些差异。
服务可以先在兼容资源池间互通,跨芯片混合执行则继续验证;两者有各自的推进节奏。
就现有披露而言,进展主要集中在运营商和云平台自己的资源体系,以及特定合作边界内的跨域验证。继续扩大范围,需要不同平台按共同约定接单、执行、结算和担责。
适配与复现应覆盖承诺支持的资源组合,服务指标对应采购产品,故障恢复与赔付落实到明确主体。服务范围是否扩大,要看真实任务能否跨平台完成。
回到那批需要隔夜处理的文档
回到那批文档,客户最终关心的是第二天能否拿到结果、账单是否符合约定、失败后由谁处理。分散资源的价值,要通过这些实际任务体现。
接下来值得追踪的,是有多少原来接不住的任务,开始以合理的成本被稳定完成。
参考文献与说明:(上下滑动可查看):

