8位AI Infra高管复盘WAIC:当堆砌「暴力美学」触顶,AI Infra如何求变?

雷锋网 2026-07-25 17:00
8位AI Infra高管复盘WAIC:当堆砌「暴力美学」触顶,AI Infra如何求变?图1
8位AI Infra高管复盘WAIC:当堆砌「暴力美学」触顶,AI Infra如何求变?图2
Scaling没有搁浅在岸上,只是转向了效率的新航道 ”       

作者丨魏溶

编辑丨包永刚
8位AI Infra高管复盘WAIC:当堆砌「暴力美学」触顶,AI Infra如何求变?图3


7月的上海,WAIC 2026的热度,或许比蝉鸣来得更盛。

几乎每个展台都人头攒动,人群的目光在展板的铅字和展商的面庞间来回切换。无数人来到这里,心里总带着同一个问题:中国的人工智能产业,到底走到哪一步了?

雷峰网特别策划WAIC 2026观察报道,我们与8位参展AI Infra公司的决策者聊了聊,试图从展台边的对话里,捕捉今年大家真正在关心什么,以及这个行业正在形成哪些新方向和新共识。


01

扬帆 | 从拼规模升级为比效率

今年产生了这样一种有意思的趋势,不管是来自CEO还是业务负责人,都不约而同地提到同一件事——WAIC 2026,行业关注的重心发生了改变。

过去大家更多在聊千卡集群、GPU性能等指标;而现在,话题更多转向了如何稳定、低成本批量产出Token,以及在此基础上,要怎么样利用这些稳定的、低成本的token去支撑Agent和AI应用持续稳定运行

市场数据能清晰地印证这轮转变。2025年全市场Token调用量同比暴涨300倍,头部大模型企业的增长已完全由API和Token调用拉动。以智谱为例,其年化收入已从预期的7亿突破至10亿美金,增长核心全部来自推理侧规模化调用。据Gartner测算,推理目前已经占到企业AI计算支出的65%以上。

这不再是一场“谁有更多卡谁就是赢家”的规模竞赛——用产出衡量能力,是推理时代的必然。

九章云极市场部负责人陈庶观察到,去年大家还在讨论如何把模型训练出来,今年讨论已经变成了“如何让模型规模化地跑起来”。推理效率、调度能力、成本管控替代了算力规模,成为展台和论坛上最高频的词。

这一看法成为了默契的共识,首都在线COO董直烨提到,行业的关注点已经从“算力资源的有无和规模大小”,转向了“算力的落地效率与价值确定性”。

并行科技董事长,CCF中国计算机学会副理事长陈健指出,前两年行业算力需求基本上训练、推理五五分,但今年开始,随着AI Coding、小龙虾式自主智能应用批量落地,直接把算力推理需求推到了绝对主导地位。

陈健将其概括为行业的一个共识判断——2026是AI大规模商业化元年,推理才是算力消耗的长期主体。


02

暗涌 | 99%的Token会被Agent消耗

如果说Token是AI时代的石油,那Agentic AI就是那个轰鸣的内燃机。

Agent正在推动AI从“生成内容”走向“完成内容”,在执行任务的过程中不断调动多个模型、多个工具,这会带来比传统单轮问答成百上千倍的Token消耗量。

当AI Coding、智能客服和企业Agent等场景成为业务板块的一部分,单次请求将面临着更复杂的任务,也会更频繁的调用工具——毫无疑问,Agent的消耗速度绝对不是人可以比拟的。

PPIO的创始人兼CEO姚欣这样的判断,现在人类和Agent的Token消耗量能打个平手,但未来Agent才会是Token的第一用户。“99%的Token都会由Agent消耗,而不是人。

这意味着,Agentic AI会明显提高对Infra的要求。趋境科技创始人兼CEO艾智远有一个判断,未来AI基础设施的竞争不会只停留在单点性能,而是更看重复杂任务中的连续稳定服务能力。

博大数据董事长余武旺表示,未来竞争不会只是拼 GPU 数量,而是拼整个系统的协同能力,包括 AI 网络、高速互联、能源保障、资源调度,以及能否快速响应不同业务场景。

需求端的变化已经清晰,供给端要如何回应?(关于AI Infra的产业需求变革,欢迎添加作者微信 treelog10 交流)


03

合流 | AI工厂和Token工厂:双帆共舞

Agent让Token消耗呈现指数级增长,行业的回应是“AI工厂”和“Token工厂”。

从2022年,英伟达CEO黄仁勋提出AI工厂,到2025年AI工厂被明确为像互联网和电力一样的基础设施。这场关于“造Token”的革命,在2026年已经进入了发展的关键阶段。

8位站在行业最前沿的人均认同,AI工厂和Token工厂并非对立关系,二者更像一体两面的共生关系:AI工厂将包含推理和训练两大板块,是整个Token生产体系的完整载体;而Token工厂则更加注重规模化交付,把算力输出为标准的Token产能。

董直烨认为,AI工厂的概念更宽泛,覆盖从数据处理、模型训练、微调、推理到应用分装的全流程;Token工厂则是聚焦智能最小单位——Token的全生命周期,本质是把算力转化为标准化的Token产能,更侧重推理侧的效率和确定性。

清程极智联合创始人师天麾出,AI工厂和Token工厂之间的概念异同,更多是一种观察尺度和叙事重点的区别。“AI工厂”这一概念强调的是完整的生产体系;而Token工厂则是把视角聚焦到推理和服务交付环节。

Token 工厂可以理解为 AI 工厂在推理时代、特别是在大规模 Agent 应用场景下的一种具体运营形态。”师天麾说。

陈健则对二者关系做出了分层。他认为完整AI工厂分为两大模块,训练工厂和推理工厂,而推理工厂就是行业所说的Token工厂。他还指出二者之间存在的差异,是产业变革的核心。

第一是需求体量与长期占比的改变。陈健表示,长期来看,训练算力整体占比会萎缩至10%左右,研发类算力占比5%,剩余85%以上的算力需求将全部归属Token推理工厂。行业算力资源投入重心不可逆的向推理倾斜。

第二是集群设计逻辑完全相反。大规模训练任务是典型的超大规模单一计算任务,允许外部互联网络临时波动,但无法接受集群内单点硬件故障;而Token推理是线上持续服务,可容忍单张GPU失效等集群内故障,但无法承受对外服务互联网络的不稳定。

“总而言之,AI工厂是完整产业载体,Token工厂是AI工厂当下和未来的价值核心——所有商业化收入、规模化应用增量,将由Token推理承载。”陈健说。(如果对AI工厂和Token工厂有独到的见解和看法,欢迎添加作者微信 treelog10 交流)


04

深海 | 效率决胜,玩家分层

“后Scaling时代”是今年WAIC大会的热点词之一,意思是单纯堆算力、堆参数的方法,边际效益在递减。

这个解读是否符合产业真实情况?目前从一些方面看来,答案是肯定的。

早期,行业靠放大模型参数、建立千卡、万卡集群实现算力的跃升,但是来到2026年,已有厂商仅靠传统方案10%的训练算力,就做出了顶尖模型;企业也越来越“现实”,同样的资源要能产出更多有效的Token。

但后Scaling并不意味着Scaling的终结。师天麾判断,Scaling并没有失效。只不过,靠扩大和堆叠算力,已经不能再自动换来等同比例的业务价值。训练和推理规模仍会增长,只是行业必须同时回答成本、能耗、延迟、稳定性和商业回报的问题。

共绩科技创始人兼CEO付智,也有类似的判断:后Scaling并非“不再Scaling”,而是进入一种更加精细的系统Scaling、效率Scaling和调度Scaling。陈庶也提出,Scaling并没有结束,但是它的优先级在下降;模型能力的上限仍然在向前推进,但竞争的焦点确实在转移。

既然单纯拼规模的时代已经过去,那现在行业要如何满足Agent的需求?市场给出了一个更加现实的答案——“效率为王”。

“我们的判断是,AI Infra正从资源竞争转向系统效率竞争。”师天麾说。

付智把这种效率竞争划分为三个层面。一是计算效率,通过芯片、网络、推理框架、模型优化和系统架构,让同样的硬件产生更多有效计算。第二是资源效率。通过弹性调度、异构资源整合和跨区域协同,让更多原本闲置或利用率不足的算力进入生产体系。第三是能源效率。算力任务如何与能源条件进行匹配,会越来越影响最终的Token成本。

艾智远的观察是,企业会非常现实地计算:同样一批资源,能产出多少有效Token;服务能稳定运行多久;成本能不能支撑长期使用。未来竞争的关键,是提升单位资源产出、提高有效利用率、跨过成本线,并把这套能力复制到更多客户和场景中。

姚欣则给出一个锋利的判断:随着赛道进入白热化竞争,绝大多数Token工厂目前都应处于亏损状态。

比赛已经进入下半场,不同赛道的玩家在这场变革中各怀优势,也各有短板。

陈健对雷峰网表示,他判断当下Token工厂赛道的玩家正在加速分层。其中,具备万卡GPU集群和全栈调度优化能力的算力服务商,优化后集群TPS和单位算力Token吞吐能拉开中小玩家10倍差距。但重资产模式注定了更长的扩张周期。

自研大模型厂商自建推理集群,可以深度贴合自有模型架构,但硬件出处不对外开放,无法承接第三方海量Token需求。硬件采购上也有对外服务性价比不足的弱势。

至于中小型算力服务商和初创团队,体量小、决策灵活,可承接定制化零散小单,却缺少长期稳定大客户订单、大批量GPU锁货渠道和底层调度与性能的优化能力。

稳定大客户订单、强GPU供给、顶尖性能算力优化能力三者缺一不可。同时,具备的头部玩家会持续收割份额,中小玩家的生存空间正在持续收窄。”陈健说。

AI产业的发展进入深水区,百川归海,构建起新的行业共识。故事更迭背后,是技术浪潮的自然延续,Token产出取代GPU卡数成为新的标尺,效率接替规模成为新的命题。

AI  Infra企业纷纷在地图上圈出了新的目的地——让AI真正成为可度量、可交付、可依赖的生产力。

百舸扬帆,向深海驶去。


05

掌舵者说

关于竞争和优势,8位决策者还给出了不同的判断和解读。

算力基础设施与规模化交付

  • 并行科技董事长,CCF中国计算机学会副理事长  陈健

8位AI Infra高管复盘WAIC:当堆砌「暴力美学」触顶,AI Infra如何求变?图4

站在2026 WAIC现场,我感受到最直观的行业变化只有一句话概括:推理落地了。

整个会场厂商、客户交流的核心不再是“能搭多大训练集群”,而是“如何稳定、低成本批量产出Token”,Token工厂、推理服务、低时延调度成为全场高频词。

本次WAIC并行科技集中释放全栈算力服务落地成果,核心想向行业传递一个信号:算力竞争早已告别“拼卡量、拼集群规模”的粗放阶段,高效、稳定、低成本的Token化推理服务,才是产业长期生存的核心壁垒。

硬件储备层面,我们和合作伙伴2025年已经落地国内首套2000卡B200集群、万卡5090集群,今年落地两个超大规模算力集群。业务新增两大核心业务线:规模化推理算力服务及Token工厂标准化MaaS服务,覆盖AI Coding、文生视频和自主智能三大场景。

随着Agent带来底层的需求变革,Token消耗规模被拉高了一个量级。推理服务规模化之后,Token工厂应运而生,稳定大客户订单、强GPU供给、顶尖性能优化能力,这三个必要条件这抬高了赛道的准入门槛。当前Token工厂赛道的玩家主要分三类,各有优劣势的体现。

第一类是具备大规模硬件储备和全栈调度优化能力的算力服务商。优势在于手握万卡级多元GPU集群,深耕算力调度多年,优化后集群TPS和算力单位Token吞吐能拉开中小玩家10倍差距;长期服务头部客户,有稳定大订单摊薄硬件折旧成本。劣势是重资产模式,硬件采购和机房建设资金投入大,扩张周期更长。

第二类是自研大模型厂商自建推理集群。优势是深度贴合自有模型架构,软硬件适配度高。劣势则是硬件储备只为自有业务配套,不对外规模化开放,无法承接第三方海量Token需求,缺少业务灵活性和服务完备性。

第三类是中小型算力服务商和初创团队。优势是体量小、决策灵活,可承接定制化短期零散小单。但致命短板是三重壁垒无法突破:没有长期稳定大客户订单、缺少大批量GPU锁货渠道、底层调度与性能优化能力薄弱。同样硬件规格下,Token产出效率和头部厂商存在10倍级差距,成本完全没有竞争力。

整体回望2026整个算力产业,旧规则正在全面作废:从拼卡量、拼训练规模,转向拼推理、拼Token效率、拼场景交付。推理落地带来的Token浪潮只是起点,未来十年,谁能把算力稳定、低成本转化为标准化Token供给,谁就能握住AI基础设施赛道的长期话语权。

  • PPIO创始人兼CEO 姚欣

8位AI Infra高管复盘WAIC:当堆砌「暴力美学」触顶,AI Infra如何求变?图5

今年WAIC,我认为最大的变化在于算力供需关系的彻底逆转。

一年前市场的核心困境是“卖不掉”,手里积压着大量英伟达卡,客户仍停留在验证与试点阶段,市场整体需求疲软。而今天,形式完全倒转,算力不仅短缺,价格更持续飙升。

这一反转背后,驱动力来自两大关键变化:其一,AI的智能生产力已切实落地,编程、办公、AI短剧等场景进入了规模化应用阶段;其二,智能体的崛起带来了指数级的算力消耗,成为新的需求引擎。

PPIO今年带来了两款核心产品。一是智能Token工厂,在国内首发了智能模型网关产品。智能模型网关是AI Agent的智能调度中心,关键决策由混合模型把关提升质量,简单任务自动分流到轻量模型,确保Agent用最低的Token成本、最高的智能性能完成任务。二是Agent Harness层,以Agent沙箱为核心,集成任务编排、Tool Use、记忆管理等功能,延长Agent可持续运行的Loop时长以解决复杂长程任务。

关于Token工厂之间的竞争,我认为关键区别在于能力覆盖的层次。目前最典型的一类,是底层算力和云服务完全依赖第三方,仅聚焦于推理加速这一中间层。推理加速虽是Token生产链上的关键软件环节,早期优化空间巨大。但随着赛道进入白热化竞争,绝大多数Token工厂目前都应处于亏损状态。

根本原因在于,Token的性价比和毛利空间,必须通过每一层的端到端优化来兑现。

从底层往上拆解:第一层是能源成本,中国东西部电价相差近3倍,算力中心的选址直接决定成本基线;第二层是调度效率,将全球调用的白天黑夜利用率从40%~50%提升至70%~80%,又能释放20%~30%的空间。

第三层是模型服务层的推理加速,优化潜力同样高达百分之七八十;第四层是Token的实际用途——用于长上下文Agent应用还是简单问答,两者价值能差出10倍。

我认为现在行业不能只盯着Token生产数量,更要关注Token的智能含量和毛利率。而要实现可观毛利率,必须完成从底层能源到上层应用的全栈式优化,覆盖至少五个层级。

  • 首都在线COO 董直烨

8位AI Infra高管复盘WAIC:当堆砌「暴力美学」触顶,AI Infra如何求变?图6

我认为,目前行业的关注点,已经转向了算力的落地效率与价值确定性。

去年行业的讨论更多围绕算力供给扩张、大模型训练基建搭建、GPU资源保供等“规模侧”问题;而今年的讨论已经深入到产业落地的具体环节,包括Token全链路的价值共识,Agent带来的基建新需求,国产算力怎么从概念走向实操三大方向。

今年首都在线在WAIC展示的核心成果与能力,均围绕“Token从生产到应用的确定性旅程”展开,包括有智算基建的规模化落地成果,自研CloudOS算力调度平台和自研Maas智能调度与运营平台的能力升级。

首都在线对自身的定位很清晰:坚守中立云定位,坚持不碰模型、不碰客户数据、不碰芯片。我们希望行业看到,AI基础设施的竞争已经进入下半场——不再是单纯拼GPU数量或是算力规模,而是拼全链路的确定性、效费比与服务能力。

关于不同背景玩家在Agent基础设施竞争中的优劣势,我的判断是这样的:

头部云大厂的优势是生态体系完整、品牌影响力强、标准化产品成熟,C端与中小客户覆盖广泛。但劣势也很明显——服务高度标准化,灵活度不足,难以满足客户深度定制化的部署与运维需求。同时,多数云厂商自身也布局大模型和应用业务,与客户存在潜在的业务竞争关系,在数据安全与商业隐私上的中立性存在天然短板。

至于接下来的竞争核心,我认为有三个方面:一是算力转化效率,通过集群调度与推理引擎优化释放每张GPU的产出;二是网络传输效率,Agent时代的低延迟与稳定性直接决定用户体验;三是运营调度效率,动态匹配算力与模型,实现Token消耗全链路可监测、可管控。

如果说,行业上半场拼的是“谁有更多算力”,下半场拼的是“谁能把算力的价值发挥到最大,给客户更确定的结果”。规模是基础,但最终的核心竞争力,是全链路的效率与确定性。

系统软件与优化层

  • 清程极智联合创始人 师天麾

8位AI Infra高管复盘WAIC:当堆砌「暴力美学」触顶,AI Infra如何求变?图7

我今年最直观的感受是,AI Infra 开始真正回答算力最终能稳定产出多少Token、成本是多少、能否真正被 Agent 和企业应用用起来。

现场有几类产品让我印象很深:一类是面向大规模集群的超节点、光互连和异构算力方案,继续解决算力规模化和资源利用率问题;一类是围绕推理引擎、Token 计量、持续评测和智能调度的产品,把算力产出转化为可以衡量、比较和交付的服务;还有一类是面向 Agent 的本地网关、身份管理、调用追踪和故障恢复工具,说明 AI Infra 正在进入应用的真实运行链路。

讨论重点的迁移,反映出行业正在从基础设施的建设期走向持续运营期。

今年WAIC清程极智最大的变化,是把一站式Token全链路服务做成了一个可以现场体验的“前店后厂”。赤兔推理引擎负责“后厂”生产,AI Ping负责“前店”评测和路由,ATM负责Agent调用管理。我们最想传递的是,AI 基础设施的价值,体现在能否持续生产并稳定交付高质量、低成本的 Token。只有生产、评测、路由、管理和应用形成闭环,国产算力才能真正进入规模化使用。

关于不同背景公司在Agent基础设施竞争中的位置,我的判断是:芯片和算力厂商的优势在硬件资源和基础设施投入,但硬件性能并不会自动转化为推理效率,跨芯片、跨模型的适配与优化仍需要专业的系统软件。

模型公司最了解自身模型能力,也能针对Agent场景做深度优化,但如果体系只围绕单一模型展开,用户的跨模型选择空间会受到限制。云和MaaS平台拥有丰富的资源与运维能力,但还需要解决跨服务质量透明度和中立调度问题。

我认为,这个市场最终不会由单一层级包办。芯片、算力中心、推理引擎、模型服务商、评测调度平台和 Agent 开发框架,需要开放协同。

放眼未来,竞争的关键不是谁拥有最多算力,而是谁能让单位算力、单位能耗和单位成本产生更多真正有用的 Token,并把它们稳定交付给用户。对于 Agent 场景,还要进一步看长期完整任务成功率、单位任务成本和服务稳定性。

我们的产品布局也围绕这件事展开。算力资源仍然重要,但模型、推理引擎、评测、路由与应用负载之间能否协同优化,将决定一套基础设施最终的真实产出。

  • 趋境科技创始人兼CEO  艾智远

8位AI Infra高管复盘WAIC:当堆砌「暴力美学」触顶,AI Infra如何求变?图8

今年我感受到,AI Infra 的讨论重心正在发生变化:从“基础资源是否充足”,转向“这些资源能不能形成稳定、可持续的生产能力”。今年的焦点不只是建设基础设施,而是如何运营好基础设施。

趋境科技这次想传递的核心信息是,我们正在围绕高品质AI Token工厂,推进从技术能力到生产能力的落地。过去一段时间,我们持续升级自研ATaaS平台,并在关键模型、真实负载和企业场景中提升Token生产效率、稳定性和成本表现。

追求把模型列表做得更长并非趋境科技的目标,我们想要真正有生产需求的模型做深度优化。因为企业客户最终关心的不是接入了多少模型,而是这些模型能否在实际业务中稳定、低成本、高效率地运行。

行业方面,在我看来“AI 工厂”和“Token 工厂”不是对立概念。AI 工厂更偏整体组织,强调模型、资源、数据、应用和工程系统如何协同;Token 工厂更偏结果导向,关注底层资源能否持续产出高品质 AI Token。

而具备企业级价值的高品质AI Token,需要同时满足低首Token时延、高输出速度、高并发等多个要求。难点不在单项指标,而在这些指标能否在真实生产负载下长期同时成立。

关于Agent的行业竞争,我认为未来会看重复杂任务中连续稳定的服务能力。这意味这模型公司更理解模型能力边界,云和资源型公司有基础资源优势,系统工程型公司则更擅长把模型、资源和业务负载整合成稳定服务。

最终竞争会看谁能在 Agent 场景下稳定产出高品质 AI Token,并把成本控制在可持续区间。

算力链接与调度平台

  • 博大数据董事长 余武旺

8位AI Infra高管复盘WAIC:当堆砌「暴力美学」触顶,AI Infra如何求变?图9

今年让我印象最深刻的 ,并不是某一款产品 ,而是 AI 基础设施正在进入“系统级竞争”的新阶段 。

大家关注的不再只是单张芯片性能 ,而是如何通过高速互联 、系统集成和软硬协同 ,让更多GPU 高效协同工作 。我认为,这反映出 AI 产业发展的一个重要趋势:竞争正在从“单点性能”走向“系统能力” 。

这次 WAIC,博大数据重点展示的是博大数据面向 AI 时代的整体基础设施能力,包括智算中心、AI 算力、AI 网络,以及覆盖全国和海外的资源布局。我们希望展示一套完整的 AI 基础设施解决方案,从规划设计、建设交付,到网络互联、运营维护。我们最想传递的信息是:AI 的发展,不只是模型的竞争,更是基础设施能力的竞争 。

关于未来,我认为竞争不会只是拼 GPU 数量,而是拼整个系统的协同能力,包括 AI 网络、高速互联、能源保障、资源调度,以及能否快速响应不同业务场景。

不同类型企业也各有优势 。芯片企业推动算力性能不断提升;模型企业持续优化算法;应用企业探索商业场景;而像博大数据这样的基础设施企业,则更关注如何把这些能力连接起来,构建稳定、高效、可持续运行的底座。

未来 AI 产业一定不是单个企业完成的 ,而是生态协同 。

至于未来竞争的关键,我认为主要是系统效率、能源效率和运营效率三大方面。简而言之,未来行业不会从“拼规模”走向“不拼规模” ,而是会进入一个规模和效率并重,但效率决定竞争力的新阶段 。

  • 共绩科技创始人&CEO  付智

8位AI Infra高管复盘WAIC:当堆砌「暴力美学」触顶,AI Infra如何求变?图10

今年一个很明显的变化,是大家讨论 AI Infra 的方式正在发生变化,AI Infra正在从“资源规模竞争”走向“系统效率竞争”。

这次WAIC共绩科技带来“上天入地,算力一体”的画面展示:把IDC、企业园区闲置算力、网吧GPU、车载算力放在同一张图景里。我们以电网式算力调度平台为底座,一端连接不同算力供给,另一端连接模型训练、推理、Agent等需求,进行跨区域、跨集群调度。

随着Agent的爆发式增长,我认为这意味着未来AI负载会越来越呈现出几个特征:调用频率更高、链路更长、并发波动更大、模型更加多样,而且越来越多任务会长期运行。

这就对AI Infra提出了一些新的要求:高峰流量来了能否快速扩容?不同任务能否调度到最合适的模型和算力?大规模并发下延迟和SLA能不能稳定?大量Token消耗之后,企业的综合成本能不能控制?

因此,我认为Agent基础设施的竞争最终会分成几个不同的层次。芯片和服务器厂商的优势在于底层硬件和系统协同能力,能够不断提升单机和集群性能;大型云厂商拥有规模化资源和成熟云生态,能够提供完整的平台能力;模型和推理服务企业更接近模型层,在推理优化、模型路由和Token服务上有优势。

未来真正有竞争力的AI Infra,需要同时具备三个能力:资源异构化,不能只能依赖一种芯片或一个资源池;供给弹性化,业务需求增加时能够快速补充,下降时能够释放资源;调度智能化,不同任务能够根据时延、成本、模型、网络和算力条件选择更优的执行路径。

当然,这里面仍然有很多需要解决的问题,包括异构资源标准化、跨区域网络、数据安全、稳定性以及调度效率。这也是未来基础设施公司真正需要长期投入的地方。

  • 九章云极市场部负责人 陈庶

8位AI Infra高管复盘WAIC:当堆砌「暴力美学」触顶,AI Infra如何求变?图11

今年大会上,能明显感受到一个转向——不少头部AI Infra厂商已经从“展示芯片和集群规模”转向“展示Token生产效率和工程化能力”,这个变化本身就很说明问题。

让我印象比较深的是,大家普遍在谈如何让算力真正产出价值——从“我有多少P的算力”转向“我能以什么成本产出多少Token”。

这次WAIC九章云极在展位搭建了一座微型AI工厂的实景,完整覆盖从算力调度到Token交付的全链路。Alaya NeW Cloud的三项核心能力:智能队列调度、资源配额管理、开发工具套件,对应算力使用中最关键的三个问题:排得公平、分得清、用得顺手。

Agentic AI确实是Token消耗的“放大器”,但反过来看,这也意味着企业对Token交付的稳定性、成本、合规和可审计性的要求,比传统API调用高出一个数量级。

云厂商的优势在于规模化供给和完整服务体系,短板是异构算力精细化调度与多模型路由优化——而这恰恰是Agent任务的核心需求。芯片厂商强在底层硬件掌控力,可通过软硬协同优化提升单卡Token产出,但缺少从芯片到上层应用的工程化封装能力。

算力运营商的优势则在于对算力、模型、调度、计价的系统性整合,Agent需要的是“算力+模型+调度+计量+成本管控”的一体化能力。

未来行业竞争的关键,我们认为有三层。第一层是算力治理能力——能不能让算力资源被充分调度、不被闲置。行业平均利用率不足30%,意味着大量算力投入未被有效转化,谁先把这部分效率释放出来,谁就有成本优势。

第二层是Token生产效率:同样一度电、同样一张卡,能不能产出更多有效Token。第三层是规模化运营能力:能不能让这套体系在不同的行业、不同的业务场景中被复用,而不是每个项目都从零开始搭一遍。

算力是投入,Token是产出。用投入衡量能力,是训练时代的惯性;用产出衡量能力,是推理时代的必然。

欢迎添加作者微信 treelog10 交流,互通有无。8位AI Infra高管复盘WAIC:当堆砌「暴力美学」触顶,AI Infra如何求变?图12

//

近期热门文章



8位AI Infra高管复盘WAIC:当堆砌「暴力美学」触顶,AI Infra如何求变?图16

声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。 
AI
more
倒计时3天!600+产业链高层集结,2026全域AI技术峰会最全参会指南来了
景德镇申遗成功,腾讯AI游戏《瓷都小匠》同步上线
GPT-6疑似“越狱”入侵Hugging Face,AI安全防线遭遇真实世界考验
黄仁勋 X 发首贴:联合25家科技巨头反制美国AI管制!
黄仁勋入驻X平台力挺开源AI,马斯克发声声援
小米神秘旗舰入网,玄戒芯片+澎湃OS+自研AI大模型?
“七姐妹”市值一夜蒸发5.8万亿,谷歌、特斯拉现金流首度告负,AI豪赌的账本亮红灯
310元!我在超市买了台「儿童智能体」,孩子的第一台AI硬件?
ChatGPT语音杀入桌面!你负责动嘴,一群AI负责干活
AI 是设计工具的顺风还是逆风?
Copyright © 2025 成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号