
Meta 重回开放权重 AI 模型赛道——这一大型语言模型(LLM)细分领域由它开创,却曾因优先级错位而大体搁置。此次归来相当高调:刚发布的开放权重模型 Muse Glimmer 用了不少巧思,既确保模型能塞进单块消费级 GPU,又能以极快速度响应查询。

Meta 借助蒸馏使 Muse Glimmer 能装进单块消费级 GPU,并用一款微型伴生模型加快响应

Meta 刚发布了 Muse Glimmer,这是一款 300 亿参数的开放权重 AI 模型,意在与谷歌 Gemma 4、阿里巴巴 Qwen 3.6 等同类产品竞争。
为方便不熟悉这一概念的读者:权重决定模型对任一概念应赋予多大重要性,也代表该模型知识库的全部广度。
Meta 的 Muse Glimmer 有两大突出之处。其一,若以全精度(fp16)运行 300 亿参数模型,仅模型权重就大约需要 60GB 内存(30×10⁹×2)。但 Meta 采用了量化——本质上是蒸馏:由更大的模型(Muse Spark)训练更小的模型,把自身许多能力灌输进去——从而把权重内存需求压到 20GB。再加上 KV cache 所需的 2GB 到 4GB,门槛已足够低,24GB 或 32GB 的消费级显卡就能轻松跑起 Muse Glimmer。据 Meta 称,经蒸馏做的模型压缩对性能没有可察觉影响。
其二,为加快 token 生成(也就是响应速度),Muse Glimmer 配有一款名为 DFlash drafter 的微型伴生模型,负责预测整段文本块;随后 Muse Glimmer 一次性校验答案,保留正确部分、丢弃错误部分。校验远快于从零生成,因此这一安排可显著提速:按 Meta 公布的数据,在 RTX 5090 上可快 3.1 倍,在 M5 Max 上 1.8 倍,在 M4 Max 上 1.5 倍。
当然,对西方开放权重 AI 模型格局来说,Muse Glimmer 的到来时机再合适不过。据 OpenRouter 数据,中国大语言模型的周 token 量近期首次突破 34.25 万亿,其中 DeepSeek 的 V4 Flash 周环比增长高达 570%。
今日推荐: