牛来大模型来自中国!国产芯片大突破

科技每日推送 2026-08-27 18:33

作者 | 肖汝健

编辑 | 周伟鹏

8月26日晚,智谱正式认领“牛来(Ox Alpha)”大模型,确认它就是新发布的GLM-5.3-Flash。

 

它此前匿名出现在OpenRouter等平台,免费开放调用,期间累计调用量达到约62万亿Token,成为当周最受欢迎的模型。

 

消息公布后,智谱股价今日大涨12.62%,收报1160港元/股。


牛来大模型来自中国!国产芯片大突破图1

 

值得注意的是,过去一周,牛来大模型面向全球开发者的全部线上推理,都跑在国产AI芯片上。

 

据悉,这背后实际调用的国产芯片超过10万张,供应商可能包括华为、摩尔线程和海光。


这是国产算力首次以这么大的芯片规模,直接承接全球开发者的真实推理流量。

 

牛来大模型来自中国!国产芯片大突破图2

“牛来”,到底有多牛

 

免费调用确实容易吸引人,但牛来大模型能火,主要还是靠实力。


GLM-5.3-Flash,总参数320B、每次激活18B参数,支持100万Token上下文。

 

智谱公布的六项测试中,它的成绩全部超过自家上一代旗舰GLM-5.2,部分项目甚至超过Claude Opus 4.8。

 

牛来大模型来自中国!国产芯片大突破图3

更夸张的是价格。

 

每百万Token输入0.8元、输出2.8元,目前有两周限时优惠,输入0.4元,输出1.4元。


这价格是智谱旗舰GLM-5.3的1/10,Claude Opus 4.8的1/40。

 

此前公认便宜好用的DeepSeek-V4-Flash,如今涨价后,即便空闲时段输入/输出也分别要1.5/4.5元,是GLM-5.3-Flash的三倍多。

 

梁叔叔已经变成了梁子,现在上位的,是智谱首席科学家唐杰唐叔叔了。


牛来大模型来自中国!国产芯片大突破图4

在Artificial Analysis给出的图表上,大模型“斩杀线”的范围也随之更新。


折扣期间,牛来大模型完成一项测试任务的成本约为0.045美元,得分为57。同样的价格区间,它几乎没有对手;而更强的大模型,成本要高出一个数量级。

 

牛来大模型来自中国!国产芯片大突破图5

而且,牛来大模型是GLM-5系列第一款原生多模态模型,它“看得见”了。


有海外开发者给它看了《魔兽争霸3》的真实游戏截图和视频,让它直接照着复刻。


经过几轮自主编程,它最终在浏览器里做出了一个复刻版游戏菜单。


牛来大模型来自中国!国产芯片大突破图6

 

当然,它还没有做到面面俱到。


评测机构Gert Labs认为,牛来一次性解决问题的能力大约在Claude-Opus-4.5水平,而且速度更慢,需要消耗更多推理Token。


牛来大模型来自中国!国产芯片大突破图7

同时,也有开发者拿它和Qwen 3.8 Max完成相同的3D编程任务。牛来跑了约80分钟,中途一度卡死,需要重新启动;Qwen则用约65分钟一次完成。

 

不过,这些测试针对的还是匿名测试阶段的牛来大模型。智谱表示,正式版已经进一步提升了性能和稳定性。

 

牛来大模型来自中国!国产芯片大突破图8

十万国产卡,撑起一头“牛”

 

在牛来大模型发布之前,智谱已经为国产替代准备了一段时间。

 

今年6月,GLM-5.2上线时,智谱就宣布完成了对华为昇腾、平头哥、摩尔线程、寒武纪等多个国产算力平台的推理适配。

 

一个月后,又有消息称智谱落地1GW级国产AI算力数据中心建设,并完成对AI基础设施公司中科加禾的收购。

 

一个负责把卡堆起来,一个负责把卡用起来。

 

中科加禾主要做编译器、运行时和推理引擎,解决的正是不同国产芯片不好适配、利用率不高的问题。


这些动作,都在补智谱国产算力的基础设施能力。


到了牛来大模型,外界第一次真正看到了它承接大规模线上流量的结果。

 

据《晚点》消息,GLM-5.3-Flash调用的国产芯片超过10万张,供应商可能包括华为、摩尔线程和海光;过去一周,牛来大模型的全部线上推理流量,都由国产芯片承载。


这也是公开披露中,国产算力首次以十万卡级集群,直接承接全球开发者产生的大规模真实流量。

 

当然,卡多只是第一步。

 

智谱称,这批国产芯片的单卡算力、内存容量和带宽相对受限。


为此,它们重新改造推理引擎,通过任务拆分、量化、缓存优化和高速互联提高集群效率。

 

最终,相比同一硬件上的初始基线,端到端服务性能提升至原来的3倍。官方称,硬件利用率和单Token成本已经做到与主流英伟达GPU相当。

 

牛来大模型来自中国!国产芯片大突破图9

国产算力,跨过了又一道门槛

 

不过,十万张国产卡能撑起牛来大模型,并不意味着国产算力已经追上了英伟达。

 

一款大模型从开发到上线,大致要经历预训练、后训练和推理部署几个阶段。推理,是在模型完成训练之后,真正响应用户请求的环节。

 

智谱这次跑通的是大规模线上推理,但训练阶段用了什么芯片,没有披露。

 

因此,它证明的是,国产算力已经可以支撑前沿模型面向全球用户提供服务。

 

从训练到推理全部国产化,则是另一道门槛。

 

这方面,国内已经有了成果。

 

今年6月,美团发布LongCat-2.0,宣布在5万张国产算力卡上完成从预训练到推理的全流程。

 

牛来大模型来自中国!国产芯片大突破图10

这两个案例放在一起看,国产算力正在从“能适配”,走向大规模生产应用。

 

但和英伟达相比,差距依然存在。

 

从硬件和生态本身看,无论是单卡性能、显存带宽、高速互联,还是最难替代的CUDA软件生态,英伟达仍然拥有整体优势。


前路还长,但从“能不能用”到“已经能大规模用”,这本身就是一次跨越。


END•

欢迎点击科技每日推送视频号,看最新视频~

Question. Write.Narrate.  Believe. Become a story.易简传媒的愿景是提问和传播商业故事,让读者更开阔,更聪明。有 2500 万微信粉丝关注我们的账号,欢迎大家关注:

关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。
芯片 大模型
more
神秘「牛来」大模型刷屏,限时免费
SPADE自博弈框架:让大模型自己造训练环境,实现开放式自我提升
RISC-V双周报:滴水湖聚焦国产芯潮,RISC-V跨AI大模型开启宇航新境(20260821)
小米玄戒芯片沟通会曝光两款原型机,O100主打端侧大模型高速推理
澜存科技:站在大模型与智能体之间,做标准化的生意
中诚华隆发布第二代HL200推理芯片,瞄准万亿参数大模型商业化落地
中国大模型的奥德修斯时刻
471亿!全球最大的大模型中介,卖身了
AI浪潮下的就业悖论:科技巨头一边豪赌大模型,一边挥刀裁员
工业Agent不是“套壳”大模型!西门子百年经验灌进工业AI
Copyright © 2025-成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号