

差距正在缩短,希望就在眼前。

过去几天,全球AI圈连续被中国大模型公司刷屏。
先是月之暗面发布Kimi K3。模型上线不到一天,冲上Arena前端编程榜首,并进入Artificial Analysis综合智能榜单前列。
消息传出的72小时内,美股AI板块合计蒸发约4700亿美元,费城半导体指数跌入技术性熊市。市场称之为“DeepSeek时刻2.0”。
紧接着,Kimi制造的震动还没有散去,阿里又放出了Qwen3.8 Max预览版,2.4万亿参数,宣称综合能力“仅次于Fable 5”。

Kimi K3上线后,最炸裂的成绩来自Frontend Code Arena。在Arena.ai的前端编程榜单上,K3以1679分登顶,超越了此前保持第一的Claude Fable 5(1631分)和GPT-5.6 Sol(1618分)。
这是历史上第一次有开源模型在权威编程榜单上超过全部海外闭源模型。

图源:Arena

图源:X
与此同时,特斯拉CEO马斯克又一次在X上为中国大模型留下了一句:“Impressive”。
并且他坦然承认,SpaceXai正在把Kimi当作自己模型追赶的目标:“我们的2万亿参数模型将在下周完成初始训练,有可能超越Kimi。”

图源:X
对于Kimi K3,外界讨论最多的还是2.8万亿参数。
按照月之暗面公布的信息,K3拥有原生视觉能力和100万Token上下文,采用混合专家架构,每次计算只激活896个专家中的部分。

图源:Kimi开放平台
简单理解,模型虽然体量极大,但不会在每次回答时调动全部参数,而是根据任务选择一小部分专家参与工作,以降低超大规模模型的计算负担。
不过,参数规模只能说明模型做得大,不能直接证明模型做得好。K3真正引发海外讨论,主要来自编程、Agent任务和长时间复杂工作的表现。
而根据多位海外开发者实测反馈,Kimi K3的实战效果似乎更出人意料,不只有一人评价“从未见过AI仅凭一个提示就能生成如此惊喜的界面”。

图源:X
然而,劝大家冷静的声音也不少。
AI测评博主Taelin发现,K3在有些题目上表现超过Fable 5,但有些题目表现很差,而且花费的时间是Fable 5的10倍。Redis作者antirez则强调,需要长期真实结果才能判断模型水平。

图源:X
好在,月之暗面自己也承认:“K3的整体用户体验与Claude Fable 5和GPT-5.6 Sol仍有明显差距”。
即便如此,K3的综合表现已经稳定超过了除上述两者之外的所有模型。

图源:Artificial Analysis
美国加州大学伯克利分校教授、Arena联合创始人Ion Stoica判断:中国开源模型与前沿闭源模型的差距,可能已缩短到2到3个月。而就在K3发布前,一位Anthropic高管还认为其技术领先中国竞争对手6到12个月。
彭博社的标题更直接:“Kimi K3正打破美国AI领先中国的固有认知”。
当然,还有一个点同样颠覆了大家的认知。
K3的API定价已经跃升至每百万Token输入3美元、输出15美元。对此,美国开发者的评价是“迄今为止中国AI实验室发布的最昂贵模型”。

发布48小时后,Kimi宣布暂停C端订阅
故事的反转来得就是那么快。
7月19日晚,距离K3发布刚过去两天多,月之暗面发布了一则让市场意外的公告:即日起暂停C端新用户订阅。
公告里写得很直白:“自Kimi K3发布以来,我们收获了远超预期的支持,但也面临始料未及的算力挑战。过去48小时,用户请求量已大幅超出我们的预估,并且逼近现有集群的承载极限。”

图源:Kimi
为了保障已有订阅用户的体验,公司将已有算力全部投入于服务已订阅用户。同时全速推进算力扩容,随着新算力陆续到位,逐步开放更多订阅名额。
这就是Kimi K3的B面。
K3发布当天,月之暗面的年化收入(ARR)从平缓波动区间陡然冲高,创下历史最大单日增幅。用户的热情超出了预期,但算力没跟上。
一个全球参数最大的开源模型,在用户涌入的48小时内,就把现有集群推到了极限。
表面上看,这是一个供不应求的故事。但往深一层想,这件事暴露的问题远比缺算力更复杂。
首先是定价问题。K3的API定价虽然只有Fable 5的三分之一左右,但在国内模型里已经是最贵的一档。相比一个月前发布的智谱GLM-5.2(输入1.4美元、输出4.4美元),K3的输出价格约是前者的3倍多。
有开发者直接吐槽“营销味重,体感配不上全球前三的名头”。成品偶尔惊艳,但比竞品慢两三倍、Token消耗猛,订阅转眼见底。
其次是商业模式的考验。K3的定位很清晰,要走高端路线。每百万Token输入20元、输出100元,已经是GPT-5.6 Terra的级别。

阿里连夜跟上,国产大模型全面起飞
而就在Kimi宣布暂停订阅的同一天,阿里通义千问发布了Qwen3.8 Max预览版。
2.4万亿参数,宣称“可能是除了Fable 5外最强大的模型”。阿里的承诺也很干脆:很快开源完整模型权重。
巧合的是,上述介绍的Kimi母公司月之暗面,背后同样有阿里的身影。Kimi K3的出现,等于阿里在自己的投资版图里又扔了一颗炸弹。
并且阿里在基础设施上比月之暗面更有优势,因此作为另一个参数超2万亿的开源大模型,Qwen3.8 Max的问世引起了更多人的兴趣。

图源:X
目前,Qwen3.8 Max预览版已在阿里旗下Qoder、QoderWork及Token Plan上线。早期反馈集中在全栈开发、数据分析、Office办公工作流等需要多步骤规划的复杂长程任务。
有开发者体验后反馈,相比Qwen3.7,幻觉明显减少,让它看具体项目地址,它真的会去看,不像3.7那样编造。有欧美网民议论它逼近了Fable的水平。

图源:X
不过,截至目前,阿里尚未公布任何独立的基准测评结果,也未披露激活参数规模、授权协议条款或完整的model card。这一点被不少开发者质疑。
早期Qwen系列大量采用MoE架构,推理时仅激活一小部分权重,2.4万亿“总参数”与实际推理开销之间的差距可能相当大。
况且,Qwen3.8同样绕不开成本与交付。2.4万亿参数只是一个开始,模型进入真实业务后,还要面对高并发、服务稳定性、响应速度和企业客户对可靠性的要求。官方演示可以在一天内制造轰动,稳定运行却需要长时间检验。
所以,Kimi暂停订阅并不否定中国大模型正在逼近全球前沿,反而说明竞争已经进入下一阶段。
过去最难的问题是能不能做出足够强的模型;现在,模型能力已经冲到牌桌中央,算力供给、商业成本和服务能力开始成为新的限制。
Kimi K3和Qwen3.8证明,中国大模型不再满足于追赶美国厂商的旧版本,而是开始与最新旗舰正面比较。
7月19日按下的暂停键也提醒所有玩家,追上之后的竞争可能更贵、更漫长。
铁粉推荐