【区角快讯】悬念终于落地。8月26日晚间,智谱AI正式揭晓谜底,宣布上线并开源GLM-5.3-Flash(320B-A18B)。官方确认,这款模型正是此前一周在海外开发者社区引发热议的匿名模型Ox-Alpha,中文圈戏称其为“牛来”。作为GLM-5系列首款原生多模态大模型,它拥有3200亿总参数,激活参数仅180亿,采用MIT协议开放权重,发布即登陆Hugging Face平台。
回溯至8月20日,Ox-Alpha以“隐身”姿态悄然现身全球最大模型聚合平台OpenRouter。首日调用量便登顶,创下该平台单日历史纪录,同时终结了DeepSeek在OpenCode长达56天的霸榜地位。单日处理Token量高达62T,迅速成为两大平台当周最受欢迎的模型,刷新双平台多项历史数据。测试期间,独立研究员曾发布技术指纹报告,指出其分词器在25组提示词测试中与GLM-5.3的Token计数完全一致,11项探针交叉测试也与GLM家族全匹配,“99%把握”指向智谱,如今这一推测得到官方证实。
从能力端看,该模型直接对标国际旗舰水准。在Artificial Analysis Intelligence Index中,GLM-5.3-斩获57分,与Anthropic旗下备受推崇的Claude Opus 4.8持平,高于GLM-5.2的53分和DeepSeek V4 Pro正式版的53分。更令人瞩目的是价格端的突破。GLM-5.3-Flash定价仅为GLM-5.3的十分之一,限时折扣期内低至二十分之一,相当于Opus 4.8的四十分之一。具体而言,每百万Token输入收费0.8元,输出2.8元,缓存命中仅0.23元。
值得注意的是,这是国产算力首次大规模集体出海。智谱披露,“牛来”测试期间的全部线上流量,以及GLM-5.3-Flash发布后的线上服务,均由10万张国产芯片承载。这意味着国产算力芯片首次大规模直接服务于全球真实负载,此前市场关于“每天100万亿Token算力供给从何而来”的争论,至此有了明确答案。据《科创板日报》记者获悉,上述国产算力芯片可能来自华为、海光及摩尔线程。
智谱方面向媒体介绍,技术架构是成本压降的核心根源。GLM-5.3-Flash基于30T Token多模态语料完成预训练,首次在GLM系列中引入稀疏注意力与线性注意力混合架构,并创新采用流形约束超连接(mHC)。该架构使注意力计算量较GLM-5.3下降约3倍,KV缓存缩小4.4倍,从而支撑起1M上下文窗口的经济化部署。目前,GLM-5.3-Flash已面向全球开源,接入ZCode等编码平台,纳入GLM Coding Plan(每天限量发放10,000张体验卡),并同步开放API调用。
北京计算机学会AI专委会秘书长、北京大学特聘研究员张有鱼对此评价道,“匿名上线、全网实测、择日揭晓”的策略让GLM-5.3-Flash在揭晓前已完成真实流量压测并收割盲测口碑。在DeepSeek V4 Flash提价、市场对“用得起的前沿模型”呼声日益高涨的背景下,其以“前沿能力+1/40价格+国产算力底座”的组合切入,再次击穿了前沿模型的价格底线。
智谱GLM-5.3-Flash开源:国产算力扛鼎,价格击穿底线
科技区角
2026-08-27 17:01
关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。