DeepSeek转向万亿参数竞赛,MoE架构与Agent需求重塑大模型“军备”逻辑

科技区角 2026-09-22 20:32

【科技纵览】当人形机器人在赛道上刷新纪录时,AI大模型的竞争维度也在悄然发生质变。据The Information披露,DeepSeek正着手训练一款约2万亿参数的新模型,其创始人梁文锋在近期投资者会议上更透露,公司下一步计划将模型规模推至8万亿参数。这一数字在一年前尚属天方夜谭,如今却已成为头部玩家的共同目标:月之暗面Kimi K3已实现2.8万亿总参数;字节跳动被曝预训练模型上限可达10万亿;阿里CEO吴泳铭亦公开宣布下一代模型将向5万亿至10万亿参数迈进。即便是未公开数据的Anthropic,其旗舰Mythos 5也被业内估算达到8万亿量级。

值得注意的是,这场看似回归“堆料”的竞赛,底层逻辑已与上一轮Scaling截然不同。DeepSeek曾以极致效率著称,去年发布的V3模型仅消耗278.8万H800 GPU小时,成本控制在557.6万美元,凭借6710亿总参数和370亿激活参数的高效比,打破了“前沿模型必须无限烧钱”的行业迷思。然而,随着今年6月完成约74亿美元首轮外部融资,以及第二轮约500亿元人民币融资进入敲定阶段,DeepSeek的资金壁垒已被打破。加之聘请中信证券筹备科创板IPO、原高瓴创投合伙人严文韬出任CFO,资本实力的跃升使其有能力在保持高效的同时,大胆拓展参数边界。

这种转变并非简单的资源挥霍,而是技术架构演进的结果。当前超大模型普遍采用MoE(混合专家)架构,如Kimi K3虽拥有2.8万亿总参数,但每个Token仅激活1040亿参数,占比约3.7%;DeepSeek V4-Pro的激活比例也仅为3%左右。这意味着总参数代表了模型的知识容量与能力上限,而激活参数决定了实时计算成本。MoE架构使得模型可以在不显著增加推理负担的前提下,大幅扩展总参数规模,从而容纳更复杂的知识分布。

更深层次的驱动力来自Agent时代的到来。相较于Chatbot时代对单项能力的峰值追求,Agent需要处理长达数小时甚至数天的复杂任务链,涉及搜索、代码编写、工具调用及子任务协调等多个环节。任何单一能力的短板都可能导致整个任务链路中断,因此模型必须具备更广的能力覆盖面和更高的稳定性。更大的参数容量为这种“全栈式”能力提供了物理基础,而MoE则确保了其在实际运行中的可行性。从某种角度看,参数量重新成为焦点,并非因为厂商忘记了效率,而是因为效率的提升为更大规模的智能涌现腾出了空间。在这场新的军备竞赛中,算力不再是唯一的瓶颈,如何将海量参数转化为稳定、通用的Agent执行力,才是决定胜负的关键。

关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。
大模型
more
端侧大模型上车提速,AI Agent 成为新赛点!蓝皮书邀您共同作答
息壤开物获数亿元融资,押注原生物理大模型破解具身智能泛化难题
阿里大模型迈入“自我进化”新阶段,Qwen4训练启动
一场户外直播,以太大模型给具身智能立了一道新考题
Intel联手震有智联发布建筑安全AI大模型,算力下沉破解工地管理“最后一公里”难题
EMNLP 2026主会|北大×易鑫AI Lab:大模型明明「知道」,为什么还会答错?
刚刚,华为鸿蒙编码大模型来了!一句话生成鸿蒙应用与元服务
阶跃发布 Step 5 Preview,大模型开始寻找新的平衡点
体验完 Step 5 Preview,我发现阶跃重新坐上国产大模型主桌
DeepSeek酝酿本地化轻量大模型,瞄准消费级显卡市场
Copyright © 2025-成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号