Meta重回开源模型赛道!高速Token、单卡跑300亿参数,性能基本不减!

EETOP 2026-08-11 08:05

Meta重回开源模型赛道!高速Token、单卡跑300亿参数,性能基本不减!图1

Meta 重回开放权重 AI 模型赛道——这一大型语言模型(LLM)细分领域由它开创,却曾因优先级错位而大体搁置。此次归来相当高调:刚发布的开放权重模型 Muse Glimmer 用了不少巧思,既确保模型能塞进单块消费级 GPU,又能以极快速度响应查询。

Meta重回开源模型赛道!高速Token、单卡跑300亿参数,性能基本不减!图2

Meta 借助蒸馏使 Muse Glimmer 能装进单块消费级 GPU,并用一款微型伴生模型加快响应


Meta重回开源模型赛道!高速Token、单卡跑300亿参数,性能基本不减!图3

Meta 刚发布了 Muse Glimmer,这是一款 300 亿参数的开放权重 AI 模型,意在与谷歌 Gemma 4、阿里巴巴 Qwen 3.6 等同类产品竞争。

为方便不熟悉这一概念的读者:权重决定模型对任一概念应赋予多大重要性,也代表该模型知识库的全部广度。

Meta 的 Muse Glimmer 有两大突出之处。其一,若以全精度(fp16)运行 300 亿参数模型,仅模型权重就大约需要 60GB 内存(30×10⁹×2)。但 Meta 采用了量化——本质上是蒸馏:由更大的模型(Muse Spark)训练更小的模型,把自身许多能力灌输进去——从而把权重内存需求压到 20GB。再加上 KV cache 所需的 2GB 到 4GB,门槛已足够低,24GB 或 32GB 的消费级显卡就能轻松跑起 Muse Glimmer据 Meta 称,经蒸馏做的模型压缩对性能没有可察觉影响。

其二,为加快 token 生成(也就是响应速度),Muse Glimmer 配有一款名为 DFlash drafter 的微型伴生模型,负责预测整段文本块;随后 Muse Glimmer 一次性校验答案,保留正确部分、丢弃错误部分。校验远快于从零生成,因此这一安排可显著提速:按 Meta 公布的数据,在 RTX 5090 上可快 3.1 倍,在 M5 Max 上 1.8 倍,在 M4 Max 上 1.5 倍。

当然,对西方开放权重 AI 模型格局来说,Muse Glimmer 的到来时机再合适不过。据 OpenRouter 数据,中国大语言模型的周 token 量近期首次突破 34.25 万亿,其中 DeepSeek 的 V4 Flash 周环比增长高达 570%

根据 OpenRouter 最新数据集(对应自 月 日当周),全球 AI 模型用量达 69 万亿 token,周环比上升 21.48%。其中中国模型贡献 34.25 万亿,美国模型仅 9.17 万亿。关键在于:这已是中国模型连续第十五周领跑全球用量。


今日推荐:

IDAS 2026 IC设计自动化产业峰会

关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。
开源
more
一个开源项目,如何走到异构算力的关键接口?
黄仁勋破例入驻X平台,只为力挺开源AI联名信
Meta开源Muse Glimmer模型:扎克伯格“个人超智能”愿景的落地试探
英伟达发布Nemotron 3.5 Lightning,开源模型再提速
全球首个千亿级MoE视频模型开源!Sand.ai给视频生成Scaling找了条新路
刚刚,蚂蚁站在Kimi肩膀上开源了一款新模型
MiniMax H3开源破局:视频生成赛道迎来“价格屠夫”与生态重构
实时视频版「Nano Banana」来了!160亿参数重磅开源
京东开源JoyAI-Video-Edit:视频“边播边改”成现实,流式编辑性能全球领跑
开源版Claude Science来了!零依赖、MIT协议,内置30+项科研Skills
Copyright © 2025-成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号