美欧开源大模型加速追赶,中国厂商确立全球标杆地位

科技区角 2026-10-07 13:30

【科技纵览】西方开放模型阵营的竞速赛骤然提速。10月5日,被誉为“美版DeepSeek”的美国初创公司Reflection发布了其首款开放权重模型Beam;紧随其后,法国Mistral在次日推出了迄今规模最大的Mistral Large 4。这两家公司的对标对象高度重合,均指向GLM、Kimi、DeepSeek及Qwen等中国头部模型。Hugging Face数据显示,过去一年中国模型占据了平台约41%的下载量,月度与累计数据均超越美国。DeepSeek、阿里Qwen、月之暗面Kimi、智谱GLM、MiniMax及小米MiMo等轮番刷新能力上限,使中国开放模型成为全球开发者竞相追赶的目标。与此同时,开放模型已不再是极客的小众玩具。Vercel AI Gateway数据显示,今年8月开放权重模型处理了其平台56%的Token流量,而去年12月这一比例尚不足10%,全球开放模型竞赛已成必然趋势。

Reflection此次交出的答卷显示其仍有差距。该公司成立于2024年,由前Google DeepMind高管Misha Laskin和Ioannis Antonoglou创立,最初聚焦自主编程,后因DeepSeek V3的出现调整战略,旨在将开放模型前沿重新带回西方。Beam作为MoE模型,总参数量达5010亿,每Token激活230亿参数,针对编程、推理及Agent负载优化。该模型经23.8万亿Token预训练,并动用1.05万张Nvidia GB300进行为期4周的高算力强化学习,生成超1亿次rollout。目前Beam处于红队测试阶段,计划10月公开权重。尽管在部分高级推理任务中,Beam能以GLM-5.2四分之一至三分之一的算力实现相近表现,但在横向对比中仍显落后。例如在DeepSWE v1.1测试中,Beam得分44.4,虽持平GLM-5.2,却低于GLM-5.3(61.0)、Kimi K3(68.0)及DeepSeek V4.1 Flash(74.2)。在Terminal Bench v2.1上,Beam得分为80.1,亦不及GLM-5.3(88.2)、Kimi K3(88.3)和DeepSeek V4.1 Flash(90.6)。Humanity's Last Exam测试中,Beam得分36.2,同样低于GLM-5.3(42.3)和Kimi K3(46.9)。这表明Beam虽将美国开放模型拉回中国头部附近,但主要追平的是上一代GLM-5.2,与中国最新一代模型仍存在一代左右的差距。

Reflection并未回避这一现实,官方承认Kimi K3在绝对能力上领先,转而强调Beam的卖点在于“单位推理算力换取的智能”。CEO Misha Laskin将其定位为企业可长期运行的主力模型,而非单纯冲榜的最大模型。这与DeepSeek早期打动市场的逻辑相似,即价值不在于是否第一,而在于达到特定能力的成本效益。然而,Reflection并非低成本版DeepSeek,仅最后一轮强化学习就占用超万张GB300,且公司已融资数十亿美元并获得Nvidia大额投资,通过SpaceX、Nebius等锁定大量算力,堪称拥有美国资本加持的“重资产版DeepSeek”。Ioannis表示,未来几年目标是让开放与封闭前沿合一,2027年计划发布更大规模模型并扩大强化学习算力。Misha认为,强化学习已从特定领域技术变为推动通用模型进步的基础方法,当前模型要么已是某种形式的AGI,要么清晰处于通往AGI的路径上。接下来的核心在于如何将这种能力工程化、产品化,并通过多极化生态扩散。

相比之下,欧洲厂商Mistral面临的压力更为严峻。两三年前它曾是开放模型的代表,但随着中国模型的快速迭代,其在榜单上的存在感下降。今年9月,CEO Arthur Mensch面对排名跌出前20的质疑时回应称,新一代模型即将发布,且未来一年规划了两代产品,新融资将用于扩大训练算力,预计可调用的计算量提高约20倍。两周后,Mistral Large 4亮相。该模型激活参数520亿,总参数1.05万亿,搭载16亿参数视觉编码器,原生支持多模态及超160种语言,上下文窗口达100万Token。值得注意的是,它在欧洲数据中心使用约3800张Nvidia Grace Blackwell GPU从头训练而成,目前已开放API预览,完整权重将于10月底发布。在Coding Agent Index中,Large 4超过DeepSeek V4 Pro和Qwen 3.8 Max,但低于Kimi K3;在与Surge AI合作的盲测中,代码质量评分为3.74,低于Claude Opus 5(4.22),但高于Kimi K3(3.59)、GLM-5.3(3.60)和GLM-5.2(3.40)。

Mistral明显意在争夺企业Agent市场。在AutomationBench的657个跨应用业务工作流中,Mistral称Large 4超过Kimi K3、MiMo-V2.6-Pro和DeepSeek V4 Pro,但低于GLM-5.3。在科学代码、网络安全及部分金融法律任务上,Mistral宣称已达到开放模型头部水平。特别值得一提的是其网络安全能力,Mistral称Large 4进入Artificial Analysis Cyber Index全球前五,在“复现真实漏洞并修复”任务中达到82%的最高分,Cybench完成率为93%。Mistral强调,部分闭源模型因安全拒绝机制无法作答某些漏洞复现任务,而开放权重模型允许企业自定义安全策略并部署在私有环境。不过,这些数据多源自Mistral自身测试,且Large 4仍处于public preview阶段,真正权重尚未开放。

除模型能力外,Mistral和Reflection也在践行国内厂商初步验证的商业路线。Reflection的故事极具美式风格,旨在建立新的AI基础设施提供商,从基础模型向上承接推理、Agent及企业部署,向下深入算力管理与集群调度,甚至长期自建数据中心。Misha认为,模型、应用、云计算等各层终将商品化,唯有垂直整合整个技术栈的公司才能持续获利。他提出公式:收入潜力=智能密度×算力规模×企业信任。开放模型本身未必直接盈利,但能创造巨大推理需求,如同Kubernetes推动云市场一样,开放模型将推动企业购买算力及完整AI基础设施。因此,Reflection真正出售的是围绕Beam构建的智能基础设施能力,类比早期AWS或GCP的发展路径。

Mistral的商业模式则更偏向“欧洲版全栈AI”。Arthur主张,小而高效、可定制部署的开放模型比追求最大规模的通用模型更符合企业需求。Mistral同时建设模型、企业定制平台及欧洲算力基础设施,力求成为从训练到部署均在欧洲法律体系内完成的供应商。在他看来,欧洲企业不能将核心AI能力建立在别国厂商的服务意愿之上,必须控制从算力到部署的完整链条。

尽管身处不同地域,两家公司对开放模型的判断趋于一致:AI市场已从“提供最好用API”进入“谁拥有模型、谁控制基础设施”的阶段。Reflection解释称,AI市场正从“租赁智能”走向“拥有智能”。Misha将闭源API比作租房,早期模式简单高效,但随着AI进入企业核心业务,所有权市场自然出现。若企业希望真正拥有智能,就必须能在自有基础设施上部署模型,控制数据并进行定制,这要求模型足够开放。Ioannis从技术角度指出,开放与闭源模型最前沿的距离正在缩小,只要拥有足够人才和算力,开放模型完全有能力达到同等水平。过去企业不用开放模型主因是能力不足,如今一批中国模型已能替代闭源模型完成大量任务,商业迁移前提成立。

Mistral CEO Arthur的判断与此接近,他认为随着能力提升,大量企业无需再为闭源模型支付溢价,接触的大约99%企业场景可用开放模型完成。对于为何中国模型率先跑出来,两家公司看法一致:这是商业激励、产业环境和训练资源共同作用的结果。Misha指出,美国曾拥有最强开放模型如Llama 3,但当时市场以API为主,缺乏持续开放前沿能力的动力。中国情况不同,DeepSeek V3是重要转折点,此后中国出现了更集中的开放模型推进。这背后动力来自建设开放权重生态的产业和战略价值。实际上,这些中国实验室近期才开始真正产生收入,此前并未赚取太多利润。Arthur则从工程层面解释,中国头部实验室算力虽低于美国巨头,但高于Mistral,且尽可能利用互联网数据,迭代方式工业化,从而实现快速迭代。

关于开放模型的安全性,两家公司均未主张无条件开放。Reflection的核心论点是开放能增加系统安全性。Misha借用开源软件的“Linus定律”,认为只要有足够多眼睛检查,漏洞就会变得浅显。封闭实验室仅有数百名安全研究人员,难以覆盖复杂模型的所有长尾问题,而开放模型能让数十万研究者参与检查、攻击和修复,生态反而更安全。OpenAI内部评测中智能体越出测试环境进入Hugging Face系统一事被反复引用,说明单一安全哲学不可靠,封闭模型可能因安全护栏无法执行防御任务,而开放模型能提供另一套工具。Ioannis进一步提出“用AI防御AI”思路,认为模型和提供者越多,系统冗余越高,避免最强能力集中在一两家公司手中形成“单点故障”。但Reflection也承认开放并非无限制,Ioannis明确表示模型达到某种能力等级后需更谨慎部署,Misha也表示超过风险阈值后行业和政府应共同决定发布条件及访问控制。Arthur近期反驳了超级智能失控风险说法,倾向于加强Agent监控、安全工程和实际治理,这与Anthropic主张开放与闭源模型面对一致能力安全门槛的立场存在部分重合。

关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。
开源 大模型
more
华为Mate 90发布:小艺从“问答”进化为“主动服务”,端侧大模型成核心底座
清华等团队最新研究:PipeSwift重新定义流水线并行,大模型智能体服务提速最高2.33倍
量子AI创业来了一支“清华梦之队”:10亿估值,用量子改造大模型底层
华为诺亚生成式大模型负责人创业家庭具身,一年融了超10亿丨36氪专访
PrismML联手高通:1-bit Bonsai大模型登陆AR眼镜,端侧AI隐私战再掀波澜
Hermes Index发布大模型性价比榜单,国产模型表现抢眼
一出手就表现惊艳!国产开源大模型又杀出一匹黑马
31岁罗福莉晋升小米最高职级,MiMo大模型团队再获突破
IROS 2026 | 大模型没有吃掉机器人学,反而更深地嵌入了感知、规划、控制与操作
大模型一体机,开始缩水了
Copyright © 2025-成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号