大模型,开始集体变小

智能涌现 2026-09-18 15:52
大模型,开始集体变小图1
大模型,开始集体变小图2
李炤锋 王欣逸
编辑张雨忻

在深圳,林舟所在的AI创业公司只有十个人,大部分工作都靠AI来完成——每天数百个Agent(智能体)同时运行,它们分头写代码、做研究。

而驱动这些Agent的,一直都是OpenAI的GPT系列模型。

但随着团队交给Agent的任务越来越多,林舟发现GPT跟不上了——他们当时使用的GPT5.6,一次只能同时处理两三个任务。“GPT能处理的并发任务有限,会耽误我们的工作进度。”林舟说,团队开始寻找能让更多任务同时运行、调用价格也更低的模型。

DeepSeek V4.1 Flash成了新选择。9月以来,团队试用了Claude和几款国产模型,最后选中V4.1 Flash:它能完成手头的开发任务,反馈更快,调用费用也更低。林舟说,这是他们眼下“性价比最高”的选择。

今年更早的时候,Google CEO Sundar Pichai在 Google I/O大会上说,据他了解,有些公司到了5月,全年Token预算就已经快用完了。就以Google自己为例,其内部AI编程工具每天消耗的Token也从3月的5000亿涨到5月的超过3万亿。

而就是在这次大会上,Google推出了速度更快、成本也更低的Gemini 3.5 Flash,瞄准更日常的开发和工作场景——今年以来,OpenClaw掀起的“龙虾”热潮,让普通用户也开始用Agent处理各种工作事务,这是比编程更日常、更低门槛、更高频的需求。

与此同时,越来越多的小参数模型开始出现。因为任务越来越多,模型的调用也会更频繁,若使用几千亿甚至两三万亿参数的旗舰模型,用户要承担的费用会非常高;并且大参数模型的速度也快不起来,会大大增加用户的等待时间。

模型厂商,尤其是中国模型厂商,接连推出Flash版本的小参数模型,争的正是这批过去也在由旗舰模型完成日常需求。Flash,意为“闪电”。模型厂商通常用这样的命名来表示更快、价格更低的模型版本:它每次运行调用的参数较少,适合用来反复处理日常任务;而复杂问题仍可交给Pro等旗舰模型。

7月31日,DeepSeek发布V4 Flash正式版;8月26日,阿里Qwen团队的Qwen3.8-Flash-Next与智谱的GLM-5.3-Flash同日亮相;9月,DeepSeek又推出V4.1 Flash。这几款模型参数大小不一,均在千亿级别(从100B-500B的参数区间),远小于当前的旗舰模型万亿级别的参数。

两个月前,当DeepSeek V4 Flash正式发布后,有开发者把它的评测成绩和完成任务的成本画在一张图上,提出所谓“斩杀线”:那些性能不如V4 Flash,做同样的任务却更贵的模型,就这样被“斩杀”。

大模型,开始集体变小图3

图注:灰色区域内的模型被DeepSeek V4 Flash斩杀,来源:Artificial Analysis

8月下旬,美国编程Agent平台Cline开始免费提供一款未公布身份的模型。Cline称,不到一周,这款模型承担了平台超过11%的推理量。随后,智谱认领了这款模型,正是后来推出的GLM-5.3-Flash。此前,智谱创始人唐杰在业绩会上谈到下一代模型,他说,公司“不会做一个大而无用的模型”。

事实上,“小模型”阵营还在不断扩大。智能涌现了解到,月之暗面和腾讯混元,都在推动Flash模型版本的开发

另一方面,今年以来,资本市场已经给中国模型公司押下高额赌注,这一背景下,商业化就成了更现实的问题。

公开数据显示,到今年8月,智谱的ARR(年化收入)约为16亿美元,其市销率高达46倍;尚未上市的DeepSeek,估值更是高达其预估年化收入的163倍。而大洋彼岸的Anthropic,市销率约为20倍。中国模型公司在商业化上还有很长一段路要走。

所以,中美模型竞争也出现了另一条主线:在继续追求AGI,争夺模型能力上限的同时,谁能让性价比更高的模型完成更多真实任务、服务更多用户?谁能用高性价比的模型打开更大市场,创造更多营收?

大模型,开始集体变小图4

一场模型效率革命

切换模型后,林舟的一大体验改善是模型的响应快多

团队经常会需要几十个Agent同时写代码,他会边看进展边调整指令;发现方向不对,马上让模型修改。此前用Codex,他常要等模型输出一长段内容,才能插手纠正。“无论你是用CLI格式,还是用它原生的App,响应都要很长时间。”而一旦遇到长项目,模型需要整理此前的对话内容,使用GPT-5.6时,又要再多等上一阵。“但切换到V4.1 Flash后,你跟他说什么,他能立马反馈你。”

今年以来,Scaling Law仍是大模型研发的主线。今年发布的Qwen3.8-Max总参数达2.4T(T表示万亿个参数),Kimi K3达2.8T。按Elon Musk今年4月披露的对比推算,当时的Claude Opus约有5T,尽管Anthropic并未确认这一数字。

这些超级模型固然触碰到了更高的智能,但更大的底座需要更多训练和部署资源;Agent场景下反复调用模型时,使用模型的成本也会指数级增加。

换用V4.1 Flash后,林舟另一个明显的感受调用成本大大下降。他举了团队做小应用的例子:一名同事独自完成开发,“差不多三四美金,就成了一个小App出来”。

模型服务平台Requesty 8月的周榜单显示,DeepSeek V4 Flash占平台上实际Token用量约三分之一,排在所有模型首位而在此前的第三方评测中,它与美国GPT-5.6 Luna高推理版本的综合得分接近,完成同组任务的成本低约六成。

“模型公司也开始更多关注真实的市场需求,会更多去听开发者的声音。”一位基模研究员对智能涌现说。小模型一轮训练所需的时间和资源更少,能更快让用户看到他们用模型跑出来的东西是否可行,是否需要调整。小模型搞开发,可以更快地做版本迭代,更快拿认知。”

而在日常工作中,这位研究员自己也会按任务需求来选模型。他举例说,修改实验脚本这类简单但工作量大的任务,交给GPT处理可能要20分钟,使用DeepSeek V4 Flash就只需要2分钟。“既然任务没有那么难,我就只希望模型赶紧把这件事情做完。”

正是在这样的用户场景驱动下,近期各家发布的Flash模型大都在400B以下(B表示十亿个参数):DeepSeek V4 Flash总参数284B;GLM-5.3-Flash总参数320B;Qwen3.8-Flash-Next的主模型为125B。

“从训练的角度上来,300B和更大一些的模型,在能力上可能差不太多。”这位研究员说,自己做过不同尺寸的训练实验。在他使用的那批数据和训练方案下,约300B的模型已经能学进更大模型输出的长推理链。

2025年发表于《Nature Machine Intelligence》的一项研究分析了51个开源模型,发现要在知识、推理、数学和代码等五项测试中取得相近成绩,所需的参数越来越少。研究者称之为“能力密度”提高:同样大小的模型,能做更多事。

Qwen3.8-27B是一个近期例子。在Qwen公布的同组测试中,它在编程测试SWE-bench Pro中得61.7分,上一代同尺寸模型为53.5分;在长程办公测试CoWorkBench中得70.7分,上一代为61.0分。

模型要解决的问题也随用户变化。这位研究员举例说,编程产品常回答程序员怎样写代码、管理项目;到了办公场景,问题变成了“我Excel的公式记不住怎么办”“怎么把这个论文写了”。

底层工作仍可能是写代码,但实际要完成的工作复杂度可能是降低的。从Code到Work,一场模型的效率和成本革命正在发生。

大模型,开始集体变小图5

从“编程”到“日常办公”

“我觉得会是两条路。”对当下Agent分化出的“编程”和“办公”两种产品,一位Code Agent创业者这样评价道。编程和办公产品都需要模型理解指令、写代码、调用工具,但面向的用户群体不同。他认为,面向普通人的办公产品,“一定需要的极致地省钱,极致的性价比。”

今年1月,腾讯混元负责人姚顺雨在AGI-Next峰会上谈到用户需求的差别:企业做生产力任务时仍愿意使用能力最强的模型,但普通用户多数时候不需要。

两类用户选模型的方式也不同。“程序员会自己分辨哪些任务用更贵的模型,哪些用更便宜的。”普通用户未必知道处理表格、撰写报告需要多强的模型。上述创业者说:“这是办公Agent的产品经理要想办法去解决的问题。”

今年1月,Anthropic推出Claude Cowork,让原本主要辅助写代码的Agent也能处理桌面办公任务。OpenAI随后推出ChatGPT Work,也是让用户直接交代一项工作,而不必在对话框里逐步提问。

与此同时,国内产品也从编程走向办公。3月,腾讯云CodeBuddy团队推出WorkBuddy;8月,阿里整合QoderWork、悟空和MuleRun,推出千问办公;而在差不多时间,字节将飞书、TRAE Work等产品的办公能力整合到豆包,推出“豆包工作”。

QuestMobile报告显示,2026年7月,腾讯WorkBuddy有658.2万月活跃用户;PC客户端用户当月人均使用19次。

面对数百万用户反复交办的日常任务,办公Agent不能只按复杂编程的标准选模型。在一些WorkBuddy用户社区中,有用户这样评价DeepSeek V4 Flash和GLM-5.3-Flash:“有这两个Flash干活基本够用。”而在企业端,一位接近智谱的人士表示,GLM-5.3-Flash发布后,不少企业客户对这款总参数320B的模型表示出浓厚兴趣。

而在真实的办公Agent使用场景,执行任务的模型甚至可以更小,小到百亿级别。

聚焦办公Agent的创业公司元空智能,已经在元空AI Work中用上几十B的模型。团队基于开源模型做后训练,让它处理更垂直的任务;通用任务则调用云端的混合模型。

用户交办任务,产品替他选模型,这样的模式下,元空团队观察到用户其实对交互的速度十分敏感。一位团队成员说:我们现在系统稍微慢一点点,一分钟之内一堆用户马上就找过来了。”

事实上,一些办公任务甚至都不需要用到DeepSeek Flash的最高思考强度。一位元空团队成员说,这样做对他们的部分任务“其实是过剩的,会输出非常非常多Token,产生大量成本浪费”。

元空智能在权衡任务效果和Token消耗,千问办公也把任务分成两档:标准模式处理日常办公,高级模式应对更难的问题。8月底,千问办公将Qwen3.8-Flash应用于标准模式。

按千问办公公布的测试结果,标准模式完成单项任务的速度提高约一倍,平均Token消耗减少75%;这一模式可以完成其定义的约95%的日常任务,更难的任务则交给高级模式。

大模型,开始集体变小图6

更大,但也更卷的市场

几个月前,美国创业公司Lindy宣布开始使用一款中国模型——把由平台管理的大部分日产工作Agent调用,从Claude Sonnet、Gemini切换到了DeepSeek V4 Flash。公司披露,切换后这部分调用的模型费用下降约九成。

“这是公司成立以来,对成本结构影响最大的一次调整,产品质量没有受到影响。”Lindy的创始人Flo Crivello这样说道。

8月下旬,一款名为Ox-Alpha的匿名模型进入海外编程Agent平台OpenCode和模型平台OpenRouter,立刻引起大范围讨论。

美国编程Agent公司Cline拿自家代码库中的真实故障进行了测试:Ox-Alpha和另一款模型都修好了问题,但前者消耗的输出Token只有后者约三分之一。

这款被中国用户戏称为“牛来”的模型,上线不到一周,仅在OpenCode就有约50万人使用;8月26日,智谱认领了这款模型——GLM-5.3-Flash。“牛来”模型与智谱的旗舰GLM-5.3形成了高低搭配——难题靠旗舰,日常任务则给Flash版本。

开发者的免费试用只是第一步。显然,中国模型公司希望借Flash的能力和价格,进入全球Agent产品让用户的更多日常任务转向自己的模型。

这几乎是一个被DeepSeek带起来的市场。全球范围内,DeepSeek在V4 Flash发布后调用量一直居高不下。OpenRouter6月数据显示,DeepSeek占该平台Token用量的份额,从年初的9%升至6月初的18%;增长主要来自Agent任务。到5月底,V4 Flash已占DeepSeek系列Agent任务Token用量的70%。

DeepSeek让其他模型厂商看到,在300B-500B区间的Flash模型,有着巨大市场潜力——这是一个被拓宽出来的新市场。

不同类型的模型去打不同定位的市场,模型厂商赚钱的概率也会提升。

从市场角度看,旗舰模型和Flash模型正在形成不同的战场。但是在大模型研发团队看来,这似乎又并非是两个对立的策略。

一位业内人士表示,旗舰模型仍有继续训练的价值。他把它比作车企的赛车:“它不一定能量产,但会有一些技术下放。”在他看来,旗舰探索出来的能力和训练经验,最终可以进入服务更广泛用户的小模型。

比如,智谱上周披露,一个由GLM-5.3驱动的Infra Agent,参与了GLM-5.3-Flash推理服务的搭建与优化,并成功将GLM-5.3-Flash部署到了国产芯片上。从初步适配到投入生产,不到两周;经过优化,同一套服务处理请求的能力提高到最初的约三倍。

另一方面,Flash模型也成了下一代模型的试验场。Qwen先在Qwen3.8-Flash-Next上使用计划用于Qwen4的新架构;据团队介绍,这款模型的训练算力消耗约为Qwen3.7-Plus的九分之一。

这场竞争不只发生在中国厂商之间,美国模型公司也参与了进来。

价格战已经打响。

7月,OpenAI将较轻量的GPT-5.6 Luna价格下调80%。在OpenAI公布的客户反馈里,美国办公Agent公司Dust称,换用Luna处理同类任务后,速度提高了40%,费用降低了40%。显然,在全球范围内,模型厂商们都在试图用更小的模型,凭借速度和价格优势争取到的Agent客户。

OpenAI首席财务官Sarah Friar写道:“只要质量够用,低价模型就会被用于更多任务。”而“模型处理更多任务”给模型公司带来的收入反馈,我们或将在下一个季度见到。

*文中林舟为化名

图片来源AI生成


大模型,开始集体变小图7
大模型,开始集体变小图8
大模型,开始集体变小图9
大模型,开始集体变小图10
大模型,开始集体变小图13
大模型,开始集体变小图14

关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。
大模型
more
多模态检索头首次被锁定:揭开大模型长文档内部检索真相 | EMNLP'26
OPPO 姜昱辰:大模型的差距越来越小,AI 手机的差距才刚拉开
二十一讲 | 第 1 讲:具身智能导论:从大模型到物理世界智能体
果蝇脑电直连大模型:1500万突触在MacBook上“开口说话”
开源模型不再免费,月之暗面、阿里开始要分成,“大模型税”能落地吗?
AI支出增速骤降:当“价格战”撞上暑期淡季,大模型厂商的焦虑时刻
小米投的AI芯片创企,融资10亿,知名大模型公司投了
从“赛博义父”到价格战:大模型厂商的存量博弈新逻辑
议程发布|专题论坛八:RISC-V开放算力论坛:具身智能·大模型·数据中心
乐享科技三级跳:以太大模型,走出Physical AI颠覆技术路线
Copyright © 2025-成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号