国产GPU训出世界模型,登上国际榜单,首提三大AI工厂

芯东西 2026-07-19 18:00

国产GPU训出世界模型,登上国际榜单,首提三大AI工厂图1

首次展示MTT C256超节点。
作者 |  ZeR0
编辑 |  漠影
芯东西7月19日报道,在世界人工智能大会WAIC 2026期间,摩尔线程创始人、董事长兼CEO张建中提出建设三大AI工厂,展示两个AI原生终端、一个MUSA生态,勾勒出一张从AI算力基础设施到智能体应用落地的全景图。
    • 三个AI工厂:模型训练工厂、词元生产工厂、智能体生产工厂,均基于夸娥智算集群。
    • 两个AI原生终端:MTT AICUBE家庭AI中枢和MTT AIBOOK AI算力本。
    • 一个MUSA生态:MusaCoder代码大模型、MUSACODE AI编程智能体、摩尔学院。
    值得一提的是,依托夸娥智算集群,摩尔线程成功跑通了“国芯训练国模”技术路径,实现全链路训练闭环。北京大学团队基于摩尔线程MTT S5000和MUSA软件栈训练出的全球首个5D世界模型EvoPhys-World,登顶斯坦福WorldScore世界模型基准测试榜单。
    摩尔线程自研MUSA架构实现了在单芯片上同时支持AI计算加速、3D图形渲染、物理仿真和科学计算、超高清视频编解码四大引擎,使摩尔线程全功能GPU具备了国内稀缺的“算、渲、仿”一体化通用算力优势。
    在WAIC 2026期间,作为国内唯一同时深耕B端、C端市场的全场景GPU厂商,摩尔线程开启世博展览馆与张江科学会堂双展区联动,全面展示其三大AI工厂、覆盖“云-边-端”的全场景智算能力。

    01.
    三大AI工厂:
    包揽从大模型训练到智能体落地


    进入智能体时代,词元消耗量迅速增长。AI的消耗方式正在从"人调用AI"转向"AI调用AI",一个用户指令可能触发几十上百个子任务并行执行,每个子任务都在持续消耗词元。
    今年3月,我国词元日调用量突破140万亿,两年增长超过1000倍。消耗量的爆发,直接穿透到算力基础设施这一层。算得够不够快、够不够稳、单位词元成本能不能持续下降,影响了AI经济的天花板。
    这正是摩尔线程"三大AI工厂"框架所要回答的问题。
      支撑三大“AI工厂”高效运转的,是摩尔线程自研的先进MUSA架构。依托MUSA架构,摩尔线程构建了从芯片、计算卡、服务器、超节点与万卡级集群,到边缘与智能终端的完整硬件矩阵,并以软硬协同推动全场景智算落地。
      值得注意的是,摩尔线程此次首次展示了MTT C256超节点。如果说夸娥智算集群回答的是"如何让万卡协同训练",那么C256回答的是"如何把万卡集群搭得更高效"。
      国产GPU训出世界模型,登上国际榜单,首提三大AI工厂图2
      摩尔线程MTT C256超节点首创一层Scale-up网络,实现标准单宽机柜128卡全互联,并柜扩展可达256卡极速互联,攻克传统多层网络的带宽损耗与高延迟痛点,在2U空间内释放极限的单位面积算力。MTT C256采用计算与交换一体化的高密设计,将大幅提高智算中心GPU部署密度,为万卡乃至十万卡级超大规模长稳训推集群打造坚实算力底座。
      依托全功能GPU的通用算力平台化优势,摩尔线程通过不同形态的算力载体,实现了全场景智能应用的无缝覆盖
        • 云端:万卡级智算集群,全面支撑大模型高效训练与极致推理,并面向物理AI、具身智能、世界模型等提供高精度物理仿真与系统级算力。
        • 边缘:高性能AI模组,深入工业质检、智能驾驶及低空经济等典型场景,提供高效、低延迟、强可靠的边缘AI算力。
        • 终端:通过家庭AI中枢MTT AICUBE与AI算力本MTT AIBOOK,推动端云算力与智能体深度融合,加速端侧应用创新,让“端侧承载力”真实落地。

        02.
        模型训练工厂:万卡级集群高效训练
        支撑全球首个5D世界模型


        模型训练的技术壁垒非常高。让成千上万张GPU卡高效协同,是一道极苛刻的工程题。
        摩尔线程构建的夸娥智算集群,具备单集群万卡级AI算力(高达10EFLOPS),基于特色训练优化技术,能将Kimi K2 1T大模型的预训练性能实现接近翻倍提升。
        其MFU(训练算力利用率)在稠密大模型上达60%、MoE模型上达40%,有效训练时间占比超过90%,训练线性扩展效率达95%,训练精度与国际主流计算卡一致。
        国产GPU训出世界模型,登上国际榜单,首提三大AI工厂图3
        夸娥智算集群已实战跑通Wan2.1开源多模态模型的千卡长稳训练。除了大语言模型外,该集群还能支撑具身智能、物理AI以及世界模型等高精度物理仿真与大规模训练需求。
        摩尔线程与合作伙伴联合建设的国产万卡GPU集群,已实现从零起步完整训练MoE-236B基础模型。该模型基于25T+高质量训练语料,训练全程由摩尔线程夸娥AI训练套件提供支持,有效训练时长占比超90%,在万卡规模下展现出与国际同类集群相当的系统稳定性与训练效率。
        北大EvoPhys团队研发的全球首个5D世界模型EvoPhys-World在斯坦福WorldScore“世界生成”维度位列全球第一,并连续37天蝉联榜首。这款模型的原生训练全程在基于摩尔线程MTT S5000的夸娥智算集群完成,由MUSA软件栈全栈支撑,训练稳定性、扩展性与生成质量均达国际主流水平。
        国产GPU训出世界模型,登上国际榜单,首提三大AI工厂图4
        面向具身智能场景,基于FlagOS-Robo框架,依托摩尔线程MTT S5000千卡智算集群,智源成功完成通用具身大脑RoboBrain 2.5的全流程训练,实现“训得稳、训得快”。
        对行业主流BEV感知模型BEVFormer的训练实测显示,基于夸娥智算集群及MUSA软件栈,单机与双机训练吞吐均达国际主流训练GPU的1.56–1.67倍
        这些成果均在摩尔线程WAIC 2026展台上首次展示,展现出对标国际主流水平的高性能,并验证了国产芯片在超大规模、超长连续稳定训练上的全链路闭环能力。

        03.
        词元生产工厂:PD异构分离大降算力成本
        可支撑高精度物理仿真


        训练是"把模型做出来",而推理是"让模型持续用起来"。在词元经济时代,推理成本直接决定AI应用的商业化天花板。
        基于旗舰级AI训推一体智算卡MTT S5000与全栈自研MUSA架构,摩尔线程构建了从底层算子库到上层推理框架的完整推理生态。在跑GLM-5.1、DeepSeek-V4-Flash、Hunyuan Video等国产前沿模型时,MTT S5000的推理性能比肩国际水平。
        国产GPU训出世界模型,登上国际榜单,首提三大AI工厂图5
        很多企业手里已有大量历史算力资产,通过将不同代际、不同架构、不同品牌的计算卡合理组合,能在维持高质量推理输出的同时大幅摊薄成本。
        摩尔线程针对大语言模型推出的PD异构分离方案,通过将高算力需求的Prefill计算池(MTT S5000)与高带宽的Decode生成池(国际主流GPU)异构分离、分池部署,独家支持KV Cache FP8与1M超长上下文,实现高性价比词元生产。
        实际测试显示,通过PD异构分离,3台MTT S5000加2台Hxx,效能已经堪比9台Hxx。这一方案将帮助企业以更低成本,用国产卡和现有资产混搭,就能花更少的钱、办更高效的事。
        国产GPU训出世界模型,登上国际榜单,首提三大AI工厂图6
        作为一款全功能GPU,MTT S5000除了能跑AI训练与推理外,还支持自研3DGS基础库LiteGS和3D语义理解技术UniSem,甚至支持光线追踪,能加速3D/4DGS场景重建与仿真闭环。
        例如在智能驾驶场景,运行极佳视界前馈3DGS闭环仿真模型时,MTT S5000的单卡推理性能可达到国际高端Hxxx的64.3%,8卡性能可达到其68.2%。

        04.
        智能体生产工厂:推动端云算力与智能体融合
        32GB内存算力本能跑80B大模型


        智能体生产工厂靠近应用侧,要解决的问题是:智能体如何从云端走向本地,如何在算力相对受限的端侧真实运行起来?
        摩尔线程依托通用全功能GPU算力,推动“智能体生产工厂”全面运转,在WAIC展台展示了全栈国产化具身智能仿真平台MT Lambda及面向工业场景的MT Lambda for Factory解决方案,以助力生产物理世界的智能体。
        在边缘侧,MTT E300 AI模组搭载摩尔线程自研智能SoC芯片“长江”芯片,具备50TOPS异构AI算力,支持混合精度计算,具备低延迟、高可靠的实时响应能力,可应用于工业、能源、教育、交通、医疗等行业。
        在终端侧,两款搭载“长江”芯片的AI终端产品MTT AIBOOK和MTT AICUBE均在展区开放体验。
        国产GPU训出世界模型,登上国际榜单,首提三大AI工厂图7
        MTT AIBOOK是一款面向AI学习与开发者的AI算力本,可在原生Linux系统(MTT AIOS)下预装OpenClaw智能体,单机支持最多12个智能体高效并行,实现了从开发、调试到部署的完整闭环。该设备还能打通夸娥云端算力,灵活部署各类大模型,通过端云协同为数字员工团队提供AI能力支撑。
        该算力本搭载32GB高速统一内存,结合AI加速分区与智能推理软件系统,通过AISSD自适应缓存管理机制,集中调度MoE专家权重、长文本KV缓存与智能体内存数据,无需升级硬件即可在原生32GB内存上流畅运行80B大模型推理与智能体编程。
        MTT AICUBE是一款面向未来AI家庭场景的核心中枢,整合“智能体+AI PC+AI NAS”核心能力,内置基于Linux内核的MTT AIOS操作系统及智能体“小麦”,能支撑端侧智能体、超高清视频播放以及3D游戏等家庭应用场景,并在AI NAS模式下配备全闪SSD高速存储,支持免拆机扩容。
        摩尔线程自主研发的AI编程智能体MUSACODE能协助开发者通过自然语言指令,快速完成代码生成、调试与重构等任务,让MUSA开发更简单、更高效。
        其背后的专用代码大模型引擎MusaCoder,完整后训练流程均在夸娥智算集群上完成,专注MUSA原生Kernel自动生成与优化,在权威评测中性能达行业领先水平,是业内首个基于国产GPU算力底座完成全链路训练与验证的开源代码大模型。
        目前,摩尔线程旗下开发者平台“摩尔学院”已汇聚超过45万开发者和学习者,并将前沿技术与产业实践带入全国200多所高校。

        05.
        结语:建设三个AI工厂
        推动词元算力底座自主可控


        摩尔线程提出的三个AI工厂,分别对应算力消耗链路的三个关键节点:训练生产模型能力,推理规模化输出词元,智能体承载最终交付。
        模型训练工厂验证“国芯训练国模”的可行性,意味着中国大模型训练不再受制于单一算力来源;词元生产工厂把推理成本压进商用区间,意味着国产算力具备了规模化输出智能的经济性;智能体生产工厂打通云边端,意味着算力走进了工厂、家庭和每个人的终端。
        进入词元时代,算力底座的自主性愈发紧迫。以摩尔线程为代表的AI芯片企业正挑起大梁,联同生态伙伴一起,推动国产词元生产基础设施的发展与全链路自主可控。
        国产GPU训出世界模型,登上国际榜单,首提三大AI工厂图8
        国产GPU训出世界模型,登上国际榜单,首提三大AI工厂图9
        国产GPU训出世界模型,登上国际榜单,首提三大AI工厂图10
        国产GPU训出世界模型,登上国际榜单,首提三大AI工厂图11
        国产GPU训出世界模型,登上国际榜单,首提三大AI工厂图12

        声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。 
        AI GPU 工厂
        more
        突破传统旁侧配置,闪迪新专利将NAND闪存“垫”在GPU底下
        我国研制全球首款神经动力学芯片!较英伟达GPU提速最高达478倍
        Kimi K3上线48小时:模型爆火,GPU爆肝,会员停售
        英特尔前CEO承认:当初低估了GPU
        不靠英伟达网卡,国产GPU直通方案实测出炉:吞吐飙升、延迟砍半
        40张GPU硬刚1536颗CPU!70岁“古董”代码狂飙数十倍
        AI找出4种全新超导体,只用28个GPU时!人类此前完全未知
        40张GPU硬刚1536颗CPU!70岁「古董」代码狂飙数十倍
        告别“中转站”:GPU P2P通信,解锁多卡算力的隐形钥匙
        继燧原科技之后,又一GPU公司也要IPO了
        Copyright © 2025 成都区角科技有限公司
        蜀ICP备2025143415号-1
          
        川公网安备51015602001305号