Token两年暴涨千倍之后,摩尔线程开始“造工厂”|甲子光年

甲子光年 2026-07-20 19:17
Token两年暴涨千倍之后,摩尔线程开始“造工厂”|甲子光年图1
Token两年暴涨千倍之后,摩尔线程开始“造工厂”|甲子光年图2

一套架构撑起三大AI工厂,市场该好好认识摩尔线程了。


作者|刘杨楠

编辑|王博


每年WAIC都是观察中国AI产业重心迁移的一个窗口。


今年,机器人和模型、应用仍在百花齐放,而算力厂商却默契地向“超节点”收敛。超节点成了各家芯片厂商展出的标配,推理成本、Token工厂、集群稳定性这些工程词汇,开始取代单纯的规模较量,成为被讨论最多的话题。


这种变化有明确的产业背景。Token消耗量持续指数级增长,Agent落地正在推动算力需求的增量重心向推理侧倾斜,行业关心的问题变成:谁能以更低的成本、更稳定的系统,持续生产高质量智能。


当Token开始像电力一样被计价、被调度,“工厂”正在成为一个比“实验室”更贴切的产业隐喻。


这个隐喻下,摩尔线程成为今年WAIC上一个值得细看的样本。


7月17日至20日,摩尔线程以“词元时代 万物智能”为主题,首次开启上海世博展览馆与张江科学会堂双展区联动,展出C256超节点、夸娥万卡智算集群,以及AICUBE、AIBOOK两款AI原生终端。7月18日的主题论坛上,创始人、董事长兼CEO张建中给出了公司三大AI工厂的完整战略框架。


Token两年暴涨千倍之后,摩尔线程开始“造工厂”|甲子光年图3

摩尔线程创始人,董事长兼CEO张建中


一家芯片公司,选择用“工厂”来定义自己的战略核心。这个选择本身,就是理解今年算力产业的一把钥匙。




1.摩尔线程为何要造“AI工厂”?

Token两年暴涨千倍之后,摩尔线程开始“造工厂”|甲子光年图4


2026年,Agent应用爆发后,Token消耗进入爆发式增长阶段。


国家数据局局长刘烈宏早在2025年中就将Token的地位类比为“互联网时代的流量”,其膨胀速度超出多数人的直觉。数据显示,2024年初,中国日均词元调用量为1000亿;到2025年底,跃升至100万亿;到2026年3月,已突破140万亿,两年增长超过1000倍。


摩尔线程创始人、董事长兼CEO张建中在论坛上解释这种暴涨时,归因很简单:“已经不是我们在用AI,是我们的Agent在用AI。”人的阅读有极限,一目十行不过几十个字;一个智能体可以在几分钟内“读”完一整面墙的书。


当Agent成为Token消耗的重要增量来源,调用量开始以十倍、百倍、千倍的量级跳涨。年初爆火的OpenClaw就是一个重要注脚。


而就在论坛前两天,Kimi发布新模型K3,参数量2.8万亿。这个半年前还难以想象的天文参数,如今成了这场行业论坛的开场白。


过去一年,Token从技术指标变成计价单位,又变成基础设施建设的动员令。摩尔线程三大“AI工厂”正是在这个背景下提出的。


5月18日,摩尔线程已在北京的发布会上系统阐述过模型训练工厂、词元生产工厂、智能体生产工厂的布局,主题同为“词元时代 万物智能”。而此次WAIC更像一次实物交付和成果展示,展台动线按三大工厂分区,论坛议程同样围绕按三大工厂的主线展开。


Token两年暴涨千倍之后,摩尔线程开始“造工厂”|甲子光年图5


外部的反馈同样值得参考。


中国工程院院士、清华大学教授郑纬民认为,算力基建的关键在于将每一份算力转化为高质量词元,三大“AI工厂”是算力基础设施的必然演进。


Token两年暴涨千倍之后,摩尔线程开始“造工厂”|甲子光年图6

中国工程院院士、清华大学教授郑纬民


国家信息中心大数据发展部副主任魏颖说得更为直白:“算力基础设施是词元生产的物理底座,GPU决定词元生产的效率与成本。”


Token两年暴涨千倍之后,摩尔线程开始“造工厂”|甲子光年图7

国家信息中心大数据发展部副主任魏颖


一家公司的战略,能够得到国家院士和国家级智库的认可,也侧面映射出这正是共识所向。


当Token成为一种新的工业原料,AI产业便从“实验室逻辑”切换到“工厂逻辑”,企业真正比拼的核心能力转向稳定、高性价比、大规模生产智能的能力。


Token两年暴涨千倍之后,摩尔线程开始“造工厂”|甲子光年图8


共识之下,越来越多的企业开始造自己的工厂。光是“Token工厂”,「甲子光年」就在WAIC展台上看到二十多家。那么,摩尔线程造的工厂又有何不同?




2.三大工厂背后的三条“Scaling Law”

Token两年暴涨千倍之后,摩尔线程开始“造工厂”|甲子光年图9


摩尔线程高级副总裁董龙飞将三大工厂与三条Scaling Law联系起来。在他的解释中,三大工厂面向不同市场,不存在简单的先后顺序,但模型训练工厂构成整个体系的能力源头。


模型训练工厂对应其中两条Scaling Law。第一条是预训练Scaling Law,即用更多算力和数据扩大模型规模、提升基础能力;第二条是强化学习Scaling Law,即通过更多数据和算力,让模型更好地遵循人类指令。两者都发生在模型训练阶段。


模型训练工厂是三大工厂的根基。


Token两年暴涨千倍之后,摩尔线程开始“造工厂”|甲子光年图10


摩尔线程生态副总裁吕其恒的说法更有画面感。“如果把AI比作女娲造人,产业界热衷的应用落地是在造‘人’,训练工厂造的是‘女娲’本身。”


可以想见,“造女娲”的门槛极高。训练芯片是一场容不下短板的竞赛,显存、带宽、可靠性、算力、通用性、精度,任一项出现短板,都会直观反映在最终的模型性能上。


摩尔线程拿出的证据是一组硬指标。基于MTT S5000构建的夸娥万卡级集群,Dense模型MFU达到60%,MoE模型MFU达到40%。


Token两年暴涨千倍之后,摩尔线程开始“造工厂”|甲子光年图11


比指标更重要的是训练精度的对齐。


一直以来,业内对于国产芯片的性能有一个极务实的评判标准,即同样的模型、数据和参数,换到国产平台上,训出来模型性能是否会打折?


而在训练精度方面,夸娥万卡级智算集群可与国际主流计算集群对齐,覆盖MoE、多模态、具身智能等前沿架构,训练Loss曲线与参照基准基本重合,收敛行为一致。


董龙飞透露,在DeepSeek这类MoE模型上与国际旗舰卡做训练对比,在前3万步训练中,摩尔线程平台的平均相对误差可做到万分之六以内。此外,团队用500B到5T不同规模数据反复实验,Benchmark评测结果与参考平台基本一致,部分指标甚至更高。


基于这种对齐能力,摩尔线程已经真正实现了“国芯训国模”的成果,并在MoE、世界模型、具身智能上跑通了标志性训练闭环。


具体来看,摩尔线程与合作伙伴合作,在国产万卡集群上完成MoE-236B基础模型从零起步的完整训练,覆盖预训练、持续预训练到长窗口持续预训练全链路。训练全程由摩尔线程夸娥AI训练套件(KUAE Training Suite)提供底层技术支持,有效训练时长占比超90%,MMLU评测精度与国际主流计算卡持平。


在摩尔线程“灯塔计划”支持下,北京大学EvoPhys团队的全球首个5D世界模型EvoPhys-World,全程在基于S5000的夸娥集群完成原生训练,连续37天登顶斯坦福WorldScore“世界生成”维度榜首。这是一个完全由中国科学家原创的前沿模型,且在基于MTT S5000的国产GPU集群上完成全栈原生训练。


EvoPhys.ai创始人、首席执行官谭桦杰认为,这标志着国产算力在支撑高水平AI研究方面取得重要进展;双方后续还将联合发布白皮书及EvoPhys-World技术报告。


Token两年暴涨千倍之后,摩尔线程开始“造工厂”|甲子光年图12

EvoPhys.ai创始人、首席执行官谭桦杰


合作伙伴的实际使用也提供了另一组验证。京东集团技术委员会主席、京东云总裁曹鹏表示,京东与摩尔线程有深度合作;在京东模型工厂中,双方围绕MTT S5000开展模型训练、适配和调优,最新发布的一系列JoyAI大模型中,相当一部分训练算力来自摩尔线程。


Token两年暴涨千倍之后,摩尔线程开始“造工厂”|甲子光年图13

京东集团技术委员会主席、京东云总裁曹鹏


第三条扩展定律发生在推理侧,即Test-time thinking:模型在推理阶段投入更多思考步骤,通常能够换取更高的任务表现,但同时也会消耗更多算力。它对应的生产场所,是词元生产工厂。


这条定律发生的场所是词元生产工厂,也是三个工厂中覆盖用户最广的市场。每个人向豆包、DeepSeek或Kimi提问,本质都是在向词元工厂下订单。


Token两年暴涨千倍之后,摩尔线程开始“造工厂”|甲子光年图14


这也是规则最残酷的市场。目前,模型深度思考后智能水平虽能高一截,但代价是每一步都在烧钱。


董龙飞点破了训练与推理的商业逻辑差异。他指出,训练对性价比不敏感,卡慢10%,无非30天的任务多训3天;推理则不同,Token成本高10%,用户便会用脚投票。


吕其恒给出一个更具冲击力的对比:一次传统搜索和一次大模型对话,算力消耗相差约10万倍,而大众级应用远未完全爆发,“一旦人人都用,目前的算力和电力远远不够”。


词元工厂的竞争,由此成为一门极致的成本工程学。PD异构分离方案是一个关键解法,摩尔线程也有相应布局。


当前长上下文推理的瓶颈正从Decode生成侧转向Prefill输入侧,前者吃显存带宽,后者吃算力,同构部署无法两全。摩尔线程把Prefill交给S5000计算池,Decode交给国际主流GPU生成池,分池部署、独立优化,独家支持KV Cache FP8和1M超长上下文。


张建中算了一笔账:3台S5000加2台国际主流计算卡的异构组合,吞吐可顶9台国际主流计算卡。


在推理侧,曹鹏表示,京东自研xLLM推理引擎已经与MTT S5000完成深度适配,支撑京东集团内部大规模Token应用。


趋境科技创始人、首席执行官艾智远则从生产侧给出了更直接的验证。


趋境正与摩尔线程深度合作,基于MTT S5000与国际主流GPU的异构方案构建日均万亿级Token产能。艾智远表示,S5000在计算能力、超长上下文、高稳定与高并发、FP8支持和生态迁移等方面的能力,是趋境将其纳入实际生产方案的重要原因。


Token两年暴涨千倍之后,摩尔线程开始“造工厂”|甲子光年图15

趋境科技创始人、首席执行官艾智远


MiniMax副总裁薛子钊也表示,2026年是国产芯片走向真实线上训练和推理的重要拐点,越来越多国产算力开始承担实际业务;MiniMax也将推动大规模国产芯片推理集群上线。


Token两年暴涨千倍之后,摩尔线程开始“造工厂”|甲子光年图16

MiniMax副总裁薛子钊




3.超节点:三大AI工厂的共同底座

Token两年暴涨千倍之后,摩尔线程开始“造工厂”|甲子光年图17


再往上看,摩尔线程展出的MTT C256超节点并不只服务于词元工厂,而是三大AI工厂共用的系统级底座。


Token两年暴涨千倍之后,摩尔线程开始“造工厂”|甲子光年图18

MTT C256超节点


它通过一层Scale-up网络,实现标准单宽机柜128卡全互联、两柜256卡高速互联,将256张GPU组织成一台数据中心级计算机;卡间通信延迟压缩至亚微秒级,为大模型并行计算提供更大的优化空间。


放到三大工厂的框架中,C256在训练侧可作为十万卡集群的核心组件,支撑预训练、后训练和强化学习;在推理侧面向大规模MoE与百万级长上下文,以低延迟、高吞吐降低Token成本;在智能体侧,则为AI Coding等高并发、低时延任务提供算力支撑。


Token两年暴涨千倍之后,摩尔线程开始“造工厂”|甲子光年图19

相比单纯增加卡数,C256更值得强调的壁垒在于工程化能力:2U节点设计兼容现有智算软硬件生态,高效液冷、三盲插、RAS机制和集群管理系统,则共同保障了大规模部署下的稳定性、可维护性,以及从万卡向十万卡集群平滑扩展的能力。


与超节点的Scale-up路线并行,PD异构方案还体现了另一种思路:在开放架构下兼容客户已有的计算设备,让存量资源继续发挥价值。


目前,大量企业手里握着已采购的国际主流GPU,异构推理让存量设备继续发挥价值,国产芯片得以用“搭班子”的方式进入推理市场。配合对GLM、DeepSeek、Qwen、Kimi、MiniMax等主流模型的Day-0适配,新模型发布当天即可部署。


某种程度上,词元工厂的胜负手,已从单卡参数表转向了整套软件栈成熟度。


三条Scaling Law之外,还需要回答Token最终流向哪里。大量低成本、高质量的Token生成后,最终要通过智能体转化为现实场景中的生产力。


如果说词元工厂负责“生产Token”,智能体生产工厂负责的就是让Token转化为行动:在电脑中操作Office和浏览器的是数字智能体,在物理世界中操纵设备的是机器人。智能体生产工厂由此成为词元工厂向行动层的延伸。


Token两年暴涨千倍之后,摩尔线程开始“造工厂”|甲子光年图20


摩尔线程选择分两条腿走路。


数字智能体一侧,是自研的“小麦”,掌握60余项技能,支持38款APP跨应用控制。同时承载它的AIBOOK算力本,在MTT AIOS原生Linux系统下预装OpenClaw智能体,单机支持12个智能体并行,把研发、设计、营销、客服编成一支数字员工队伍。


物理智能体一侧,是全栈国产化具身智能仿真平台MT Lambda,旨在赋能用户构建数据合成、策略训练、仿真验证的高效工作流。物理仿真、渲染、AI训练三类负载在同一颗GPU内完成,数据零拷贝。


染能力可以在数据生成、具身仿真等环节提供支持。这意味着,训练、推理和物理智能不再只是三条相互独立的产品线,而是开始在同一客户的业务链路中形成闭环。


三个工厂讲到这里,脉络已经清晰,训练工厂创造智能,词元工厂给智能计价,智能体工厂让智能干活。背后的三条扩展定律各自狂奔,把算力需求拉向三个完全不同的方向。


客观来看,若将这三大工厂的任意一环单拎出来,都足以作为一家公司攻克的战略命题,为什么摩尔线程一家公司能够同时做成三件事?




4.全功能GPU与统一软件栈的先见之明

Token两年暴涨千倍之后,摩尔线程开始“造工厂”|甲子光年图21


全功能GPU和统一软件栈,是摩尔线程在创办第一天就写下的答案,给今天三大AI工厂的战略以及云边端生态布局打下了基础。


目前,摩尔线程的三大工厂共用同一套MUSA架构、同一套软件栈,甚至同一颗芯片的技术源头。董龙飞解释道:“我们三个工厂不是说有不同的技术、不同的产品,整个技术体系从GPU芯片架构到上面的系统,都是完整统一的。一套软硬件方案支撑三个工厂,这也是我们的产品被称为‘全功能GPU’的原因。”


Token两年暴涨千倍之后,摩尔线程开始“造工厂”|甲子光年图22


“全功能”容易被听成宣传话术,其内核却是一场“通才”与“专才”的路线之争。


专用芯片的逻辑,是赌定一个确定的计算范式,把效率和成本做到极致。这个赌注在范式稳定时无疑能获得回报丰厚,但AI是一个范式剧烈动荡的行业,且模型的迭代速度和芯片的生产周期之间存在鲜明的张力。


芯片从设计到投产大致需要两年,2024年设计的芯片很难预测今天中国大模型的模样。同样,也没人能保证2028年的模型还在延续今天常见的结构。“如果芯片通用性不够,今天投入几十亿建的智算中心,两年后可能就没法用了。”董龙飞表示。


GPU的价值,在于站在性能和灵活度的交界处。从CNN到Transformer,再到正在兴起的世界模型,每次计算范式更迭,GPU都没有出局。


MUSA架构在这个逻辑上再加一层。单芯片同时集成AI计算、图形渲染、物理仿真和科学计算、超高清视频编解码四大引擎。这条“算、渲、仿”一体化路线上,全球的对标者是英伟达,国内此前没有第二个玩家。


目前来看,全功能GPU在大语言模型时代或许看似有些功能“冗余”,但到物理AI时代,全功能便是更优解。


吕其恒解释了具身智能对算力的特殊要求。他表示,语言模型计算的是符号,具身智能计算的是世界本身,需要构建1:1的数字孪生环境,要符合物理定律,要光追级的高保真渲染去覆盖现实采集无法穷尽的极端场景,训练完还要在仿真中做强化学习,才能Sim-to-Real。


Token两年暴涨千倍之后,摩尔线程开始“造工厂”|甲子光年图23


还是以S5000为例,S5000不止能做训练和推理,加上摩尔线程自研的AI生成式渲染(AGR)和Ray-Tracing(光线追踪)技术,便能支持机器人企业在MT Lambda上做逼真的图形仿真渲染,完成机器人的仿真训练。


同时,统一架构也为摩尔线程云边端协同的生态布局提供了现实基础。


AICUBE和AIBOOK搭载的都是摩尔线程自研智能SoC“长江”,具备50TOPS异构算力,其中的GPU与S5000同出一项技术,只是做得更小。


Token两年暴涨千倍之后,摩尔线程开始“造工厂”|甲子光年图24


一颗芯片既能撑起万卡集群,也能塞进笔记本和电视盒子。计算产业“先做大、后做小”这条产业老路,正在智能体时代发生最新一轮重演。IBM的大机变成PC,成就了微软和英特尔;互联网的基建浓缩进手机,成就了移动互联网。算力企业向终端渗透,在国外是常识,只是在中国市场,芯片公司做消费品,如今还显得有些新鲜。


回到本章开头的问题。全功能GPU和架构统一是最关键的“1”,三个工厂是后面的“0”,如果缺了统一架构,三个工厂就是三块互不相干的业务;有了它,训练、推理、智能体连成一条可以自我强化的流水线。




5.国产算力的牌桌上,摩尔线程不止当玩家

Token两年暴涨千倍之后,摩尔线程开始“造工厂”|甲子光年图25


独特的技术定位也塑造着摩尔线程独特的生态位。


过去一年,能支撑推理任务的自主算力集群越来越多,推理价格战已经开打,但真正能够被高效使用的算力集群依然屈指可数。


政策口径印证了这一点。2026年1月7日,工信部等八部门正式印发《"人工智能+制造"专项行动实施意见》,明确提出要“推动智能芯片软硬协同发展,支持突破高端训练芯片、端侧推理芯片、人工智能服务器、高速互联、智算云操作系统等关键核心技术”。


而摩尔线程是国内极少数建成万卡集群、跑通“国芯训国模”全链路,且能够支撑云边端多元负载的芯片公司。


对于国产算力的市场潜力,摩尔线程也十分有信心。


尽管短期来看,资本市场对算力投资的态度难免波动,关于算力过剩的讨论时有发生,但董龙飞从更高维度给出了判断:“今天在中国建的算力,是为中国未来十年、二十年建的新基础设施。就像修铁路、修高速公路,第一天看永远供不应求。”


其中,一个巨大的增量市场便是智能终端。目前,多数手机和PC仍未成为真正意义上的AI原生终端,相关增量市场仍处于早期阶段,更不用说还有无数形态未定的AI设备正在涌现,长期来看,AI算力的市场需求仍未见顶。


事实上,市场的态度波动和摩尔线程这类基础设施建设者的分歧往往来自于时间尺度,后者往往会选择押注更长期的结果。


目前,摩尔线程正在大力建设生态,试图组建一支“国家队”。


国内目前有许多优秀的芯片公司,芯片架构也越来越多元,异构将长期存在,但从孕育一个产业生态的生态的视角来看,“我们不能让开发者今天适配这家,明天适配那家,工具链五花八门,那样成本太高。”高林丽直言。


因此,各家在应对良性市场竞争,守住自身技术独特性的同时,必须拧成一股绳,把整个生态的盘子做大,这是对国家产业与用户最优的路径。


“我们的目的,是让这支‘国家队’代表中国,打造出世界一流的算力平台。通过合作,在Token工厂里为不同层级的市场需求提供最优性价比的产品。”高林丽表示。


从产业发展视角出发,提升国产算力整体可信度这道命题,分量超过任何单一竞争者。摩尔线程希望通过每一次Day-0适配、每一次万分之六量级的精度对齐、每一个在国产集群上跑通的前沿模型,给整个国产芯片阵营攒信誉。


只有信誉攒够了,生态成熟了,客户才敢把下一个SOTA模型,放心交给国产算力。


(封面图来源:摩尔线程)


Token两年暴涨千倍之后,摩尔线程开始“造工厂”|甲子光年图26




END.




Token两年暴涨千倍之后,摩尔线程开始“造工厂”|甲子光年图27
Token两年暴涨千倍之后,摩尔线程开始“造工厂”|甲子光年图28


Token两年暴涨千倍之后,摩尔线程开始“造工厂”|甲子光年图29Token两年暴涨千倍之后,摩尔线程开始“造工厂”|甲子光年图30


声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。 
工厂
more
台积电将建16座工厂
走进零跑超级五电工厂:车企如何自制电子部件?
茵梦达(天津)驱动技术有限公司新工厂正式投产
跨集群异构PD分离WAIC首发,专访无问芯穹李秀红,探秘Token工厂「超级管线」的落地路径
德国博世,斥巨资在美国建SiC工厂
AI软件工厂—AI时代自动化软件开发的实践与思考|杭州迅速智能CEO熊继斌「AgenticAICon 2026」预告
重磅,三星将新建DRAM工厂,月产能10万片
对话PPIO姚欣:Token工厂的第一客户不再是人,而是Agent
特斯拉FSD转为订阅模式,苹果代工厂塔塔电子被黑,大疆锁定Pocket 4黄牛团队,李斌谈未来纯电车市场渗透率,这就是今天的其他大新闻!
元石智算受邀出席智猩猩开放日,共话Token工厂建设新路径
Copyright © 2025 成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号