法国 Mistral 发布 Mistral Large 4:1 万亿参数,月底开放权重

机智流 2026-10-06 22:12
法国 Mistral 发布 Mistral Large 4:1 万亿参数,月底开放权重图1

封面图来源:Mistral AI 官方发布视频截图

北京时间 10 月 6 日 21:02,法国 AI 公司 Mistral 放出了新旗舰 Mistral Large 4 的预览版。总参数约 1 万亿,每次只动用其中 490 亿,原生多模态。API 今天就能调,权重月底开放下载。

官方给它起了个外号叫「le Chonk」。chonk 是英文网络俚语,专指圆滚滚的胖猫,前面再加个法语冠词 le。简称 ML4。这是 Mistral 到目前为止最大的模型。

官方博客

https://mistral.ai/news/mistral-large-4

Hugging Face(Mistral 主页,ML4 权重还没上传,官方说月底上线)

https://huggingface.co/mistralai

官方账号的原话是:

Meet Mistral Large 4, aka Le Chonk. 1T parameters, natively multimodal. 49B active. It is the best open weights model from US or Europe on aggregated benchmarks.

来认识一下 Mistral Large 4,外号 Le Chonk。1 万亿参数,原生多模态,激活 490 亿。按综合基准,它是美国和欧洲最强的开放权重模型。

法国 Mistral 发布 Mistral Large 4:1 万亿参数,月底开放权重图2

@MistralAI 官方帖,北京时间 10 月 6 日 21:06(编辑后版本)

先认识一下 Mistral

Mistral AI 是一家总部在巴黎的 AI 公司,2023 年成立。3 位创始人里,Arthur Mensch 出自 Google DeepMind,Guillaume Lample 和 Timothée Lacroix 出自 Meta 的 AI 研究团队。

它出名靠的是开放权重。早年的 Mistral 7B、Mixtral 都能直接下载自己跑。上一代旗舰 Mistral Large 3 是 6750 亿参数,用的是 Apache 2.0 许可证。自家产品还有智能体助手 Mistral Vibe 和开发平台 Mistral Studio。

钱方面,官方博客写明:ML4 是 30 亿欧元 D 轮融资后的第一个里程碑。Mistral 称这是欧洲科技公司有史以来最大的一笔股权融资。

1 万亿参数,为什么每次只用 490 亿

关键在 MoE,也就是「混合专家」架构。

打个比方。一个普通大模型像一个全科医生,什么问题都靠同一个大脑硬算。MoE 更像一家大医院:里面有很多科室的专家,每来一个问题,门诊台只叫最相关的几位来会诊,其他人照常休息。

放到 ML4 上:官方文档写的是总参数 1.05 万亿,每处理一个 Token 只激活约 490 亿,不到 5%。另外还带一个 16 亿参数的视觉编码器,用来看图。

好处很直接。知识容量按万亿级算,算力账单却更接近一个 490 亿的模型,推理更快也更便宜。代价也有:全部参数还是要装进显存,自己部署的门槛不低。

官方说这是「细粒度」的 MoE,也就是专家切得更细、更多。具体有多少个专家,Mistral 说会跟权重一起公布。

它还是一个指令和推理二合一的模型,聊天、深度思考、当智能体干活都由同一个模型完成。训练数据覆盖 160 多种语言,包括欧盟全部官方语言。

训练和部署:主打「欧洲自己的」

官方博客写明,ML4 是在 Mistral 自己位于欧洲的数据中心里,用 3800 块英伟达 Grace Blackwell GPU 从零训练的。现在的预览版也跑在同一套设施上。

模型会在全球多个区域上线。其中有一个欧洲部署,由 Mistral 端到端自己运营,不依赖其他云服务商,适用欧洲法律。对讲「主权 AI」的欧洲政府和企业来说,这是卖点。

后训练方面,强化学习用了约 3000 块 GPU,一次训练每天能产出约 330 亿 Token,过滤后约 160 亿可用于训练。官方特别提到:这个预览版背后的强化学习还在跑,没有饱和迹象,月底的正式版还会更强。

成绩单:先看网络安全

这是 Mistral 这次最想讲的一块。以下数字来自官方博客,部分由第三方机构测出。

• Artificial Analysis 网络安全指数:官方称排进全球前 5,在中国以外的开放权重模型里大幅领先

• 复现并修补真实漏洞:这是指数里的一项测试,ML4 拿到 82%,官方称是所有模型里最高

• Cybench:40 道安全竞赛题,解出 93%

法国 Mistral 发布 Mistral Large 4:1 万亿参数,月底开放权重图3

Artificial Analysis 网络安全指数对比。浅紫色是被模型安全策略拦下、没有作答的部分。图片来源:Mistral AI 官方博客

这里有个背景要说清楚。官方博客提到,Claude Opus 5.5 和 GPT-6 Astra 在「复现漏洞」那项上接近 0 分,原因不是做不到,而是触发了安全策略,直接拒答。

Mistral 的论点是:防守方经常要先证明漏洞真实存在,闭源模型的拒答会挡住正当的安全研究。开放权重加上自己部署,企业可以按自己的规则来用。

不过这也是一体两面。分数高,部分来自它「愿意做」,而不只是「做得更好」。同时官方也给了另一组数据:在 JailbreakBench、StrongREJECT、AgentHarm 这些恶意网络请求上,ML4 的平均拒答率高于所有开源模型。

第三方 Artificial Analysis 给的口径更细:ML4 在网络安全指数上得 50 分,和 GLM-5.3-Flash 持平,落后于小米的 MiMo-V2.6-Pro(56 分)。

在月底开放权重之前,Mistral 正在和网安头部企业、经过审核的合作伙伴以及国家机构一起做红队测试。这些合作方用的是同一个模型,但审核更宽、网络安全能力放得更开。

写代码和干活

编程成绩是 Artificial Analysis 在正式公开测评框架前私下测的:

• DeepSWE v1.1:61.7%

• SWE-Atlas-QnA:59.4%

• Terminal-Bench 4:28.3%

• 编程智能体综合指数:49.8%,官方称高于 DeepSeek V4 Pro 0813 和 Qwen3.8 Max

Mistral 还请 Surge AI 做了盲评:专业标注员在不知道模型身份的情况下,给代码质量打 1 到 5 分。ML4 预览版 3.74 分,5 个模型里排第 2。第 1 是 Claude Opus 5(4.22 分),后面是 GLM-5.3(3.60)、Kimi K3(3.59)、GLM-5.2(3.40)。

智能体任务看 AutomationBench,657 个横跨 Gmail、Google 表格、Slack、Salesforce 的业务流程。ML4 得 59.9%。

法国 Mistral 发布 Mistral Large 4:1 万亿参数,月底开放权重图4

AutomationBench 成绩对比。图片来源:Mistral AI 官方博客

官方文字说它领先 Kimi K3、MiMo-V2.6-Pro 和 DeepSeek V4 Pro。但同一张图里也能看到,GLM-5.3 是 62.2%,比 ML4 高。

长周期知识工作测试 AA-Briefcase 上,ML4 拿到 1393 Elo,官方称高于 DeepSeek V4 Pro。

看图:视觉定位反超 GPT-6 Astra

ML4 是原生多模态,能读复杂文档、图表和普通照片。官方演示里,它能在千兆像素级的卫星图里找目标,也能放大机械图纸核对零件。

在密集场景的视觉定位测试 Dense 200 上,ML4 是 42.0,GPT-6 Astra 是 41.5,略高一点。

法国 Mistral 发布 Mistral Large 4:1 万亿参数,月底开放权重图5

Dense200 视觉定位成绩对比。图片来源:Mistral AI 官方博客

另据 Artificial Analysis,ML4 在文档推理测试 GDP.pdf 上得 19%,和 MiMo-V2.6-Pro 持平,低于 Kimi K3 的 22%,比 Mistral Large 3 高了 18 个点。部分原因是 API 现在一次能收 100 张图,以前只有 8 张。

科学、金融和法律

• 科学:官方称在 SciCode-Verified 上是开放权重模型第一;能一次生成完整的 Hartree-Fock 量子化学模拟程序

• 金融和法律:第三方 vals.ai 测试显示,两类任务上都高于 GPT-6 Astra;在 Harvey 的法律智能体基准上,官方称超过所有开源模型

• 人工对比:Mistral 内部请专家和 GLM-5.3 对比,ML4 在 CAD(工程制图)和理工科任务上更受偏好,金融和编程上基本打平

• 安全:Lakera 的 B3 智能体安全测试里,抵御了 93.3% 的攻击;KORA 测试 1.691 分(满分 2),是官方测到的开源模型里最高

需要提醒的是:以上大多是 Mistral 自己挑的对比项和对手,自家公布的基准,最好等更多独立测评。

第三方怎么排

独立评测机构 Artificial Analysis 的综合智能指数里,ML4 预览版得 38 分。

同一张榜上,排在前面的有 MiMo-V2.6-Pro(46)、GLM-5.3(45)、Kimi K3(44)、GLM-5.3-Flash(42)、DeepSeek V4.1 Flash(39)。GPT-6 Luna 也是 38。所以更准确的说法是:它是中美以外最强的模型,但和中国头部开放权重模型还有差距。

这个口径也和 Mistral 的说法对得上:官方强调的是「美国和欧洲最强的开放权重模型」,没有说全球第一。

多少钱,怎么用

官方文档里的 API 价格如下(每百万 Token):

• 输入:1.36 美元

• 缓存输入:0.14 美元

• 输出:4.18 美元

• 上线优惠:文档目前显示 5 折,即输入 0.68 美元、缓存输入 0.07 美元、输出 2.09 美元

据 Artificial Analysis,5 折只持续前两周。它还算了一笔账:按原价,ML4 跑一道智能指数题平均 1.13 美元,打折后 0.57 美元,仍比 GLM-5.3-Flash(0.25 美元)和 DeepSeek V4.1 Flash(0.27 美元)贵。

其他要点:

• 状态:公开预览版,现在就能在 Mistral Studio 通过 API 调用,模型名 mistral-large-4

• 权重:官方说月底放出,同时公布架构细节、更多基准和后训练方法

• 输入输出:据 Artificial Analysis,支持文本和图片输入,输出文本

• 上下文:官方文档页标的是 1M Token,Artificial Analysis 写的是 512k,两边不一致,以官方后续说明为准

• 许可证:官方还没公布。文档只标了「Open」,具体许可证一栏是空的

官方还说,ML4 会作为基座,衍生出一批面向具体行业的专用模型。

外界怎么说

Artificial Analysis(约 15.5 万关注)当晚发帖,标题就很有意思:

France is back to having the most intelligent model from outside the US and China.

法国再次拥有了中美以外最聪明的模型。

法国 Mistral 发布 Mistral Large 4:1 万亿参数,月底开放权重图6

@ArtificialAnlys,北京时间 10 月 6 日 21:45

它的评价很具体:智能指数 38,排中美以外第一,领先韩国、阿联酋等国的模型;网络安全最亮眼,但每道题的成本是同水平开放权重模型的 4 倍多。

Mistral 联合创始人兼首席科学家 Guillaume Lample(约 4.9 万关注)也发了长帖:

The RL run behind this preview is still in flight and shows no sign of saturation -- we will release a final version before the end of the month along with the weights of the model.

这个预览版背后的强化学习还在跑,没有饱和迹象。我们会在月底前发布最终版,并同时放出模型权重。

法国 Mistral 发布 Mistral Large 4:1 万亿参数,月底开放权重图7

@GuillaumeLample,北京时间 10 月 6 日 21:24

也就是说,月底拿到的权重,可能不是今天这个预览版,而是继续训练后的正式版。

一句话总结

ML4 让欧洲重新有了一个万亿级的开放权重模型。网络安全和视觉定位是它最硬的牌,自建算力和欧洲部署是它的独特卖点。但综合实力还排在中国头部开放模型之后,价格也不便宜。月底权重和许可证一出,才是真正的看点。

相关链接

• 官方博客

https://mistral.ai/news/mistral-large-4

• 官方模型文档(含价格)

https://docs.mistral.ai/models/mistral-large-4-0

• Hugging Face(Mistral 主页,ML4 权重月底上线)

https://huggingface.co/mistralai

• Mistral Studio

https://console.mistral.ai/

• @MistralAI 宣布帖

https://x.com/MistralAI/status/2107457414387622310

• @ArtificialAnlys 测评帖

https://x.com/ArtificialAnlys/status/2107467221421420919

• @GuillaumeLample 长帖

https://x.com/GuillaumeLample/status/2107461898127954001

关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。
AR
more
DeepSeek Harness桌面端上线,梁文锋开送Token了
DeepSeek Harness 新推兼容层,AI 编程工具的“插件战争”初现端倪?
DeepSeek Harness v0.2 预览版正式发布
太卷了!DeepSeek假期更新,Harness有了新版本
PearX演示日观察:当YC不再“唯一”,小而美的加速器如何重塑早期投资逻辑?
谷歌Gemini 4 Argon发布:百万Token输出与极致性价比重塑AI竞争格局
把ARRI(阿莱)装进手机,荣耀想解决的不只是画质问题
Agent Harness到底怎么选?南洋理工大学安波团队最新研究给出答案
GPT-6要“吃掉”3D公司?这家公司不到2年ARR翻百倍,破1亿美元
新品|新款宝马 X3 M50 xDrive 官图发布;谷歌日本推出 Gboard 传送带键盘
Copyright © 2025-成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号