2026-09-03 · 原推、本账号跟帖、热评与独立评测
Meta 官方账号 @AIatMeta 北京时间 9 月 3 日凌晨发了 Muse Spark 1.3。同一晚 Zuck 自己下场,Alexandr Wang 跟了一串。原推只有 57 条回复、63 条引用,但楼里真正值钱的,是官方自己跟的两条,加上外面那批带图的评测推。
先看原推。四个卖点全写在正文里:一条线程里同时撑多个 workflow;会问、会喊卡住、重大操作前会确认;对自己做不到的事更认账;对内对比 1.2,工具调用大约少 20%,Token 大约少 25%。

@AIatMeta 原推截图 · 12:36 PM Sep 2, 2026 · 10.6 万浏览

原推配图 1 · Muse Spark 1.3 视觉

原推配图 2 · 官方分数表。注意:这一列写的是 1.3 max,今天还没对公众开放
The account's own thread本账号自己跟的两条
原推下面官方立刻跟了两条。这才是 @AIatMeta 自己的「评论」。

本账号评论 1 · 今天在 Muse Code 和 Meta Model API 上线,max 还要等安全测试

本账号评论 2 · 更大模型、Muse Spark 开源权重还在后面
第二条和 Zuck 那条对得上:开源权重之外,他还写了个西瓜 emoji。TestingCatalog 把它读成下一代大模型代号 Watermelon。官方博客原话是 bigger models,没有点名。
Zuck and Wang老板和实验室负责人怎么说

@finkd(Mark Zuckerberg)· 约 115 万浏览、1.1 万赞
Zuck 的原话是 frontier performance almost too cheap to meter,并点名这是 Muse 在 coding 和 agentic 上最大的一跳。Axios 稍后引用 Meta AI 负责人 Alexandr Wang:It's very competitive with frontier models。可用性上的改动,是给扎克伯格财报里说的 24/7 personal agents 铺路。

@alexandr_wang 自己发的 1/ · 约 24 万浏览
What the blog actually says官方博客多写了什么
原推是短的。完整稿在 Introducing Muse Spark 1.3,大约 3 分钟读完。评测方法另有一页 Evaluation Methodology。
• 长任务:给一个开放目标,自己用工具从乱源里攒上下文,补计划漏洞,最后交一份可交付物。
• 协作:提示含糊会追问,卡住会喊人,重大动作前确认。长任务里能按你的偏好勤汇报,或者自己闷头干。
• 多任务:一条乱线程里,新提示要能对上正确的那个旧任务,中途改约束也不该串台。
• 校准:知道自己会什么、不会什么,少把没做成的事说成做成了。
• 写代码:相对 1.2 少说废话、少多余回合,工程师内部对比大约少 20% 工具调用、少 25% Token。
• 安全:抗注入更好;对不可逆动作更谨慎。max reasoning 还卡在额外安全测试。
博客里塞了几段 GDPVal 风格的演示:X-Wing 流场报告、修贝斯轨再混音、县商会 PPT、选区意见一页纸。不是真实产品,是模型自己做出来的样张。

官方演示 · X-Wing 流场报告草稿(模型生成,不是真实产品)

官方演示 · 贝斯错音修补与混音
The scoreboard分数怎么读
原推那张表,1.3 用的是 max。官方自己写了:今天能用的是以前那些 reasoning 档,max 还在安全测试。Hacker News 第一条补链就把这点戳破了:表上全是 max。
• DeepSWE v1.1:1.3 max 75.4,压过 Opus 5 的 74.0 和 GPT-5.6 Sol max 的 73.0。1.2 xhigh 只有 55.0。
• 长上下文 MRCR:256K–512K 98.5,512K–1M 98.1。1.2 同档只有 66.3 和 55.5。
• SWE-Atlas CodeBase QnA:59.4,高于 Sol 53.5 和 Opus 52.7。
• Terminal-Bench 2.1:88.8,和 Sol max 持平,高于 Opus 86.7。
• GDPVal-AA v2:1754 Elo,仍低于 Opus 5 的 1824。JobBench、OSWorld、AutomationBench 也是跟在 Opus 后面。
方法页还写了一句别忽略:第三方模型是 best-effort,提示和工具未必调到对方最佳;不可评分和拒答记 0,分母还在。OSWorld 上 1.3 用的是 08.08 版任务,1.2 用的是 06.24。
Independent numbersArtificial Analysis 的独立榜
官方表之外,@ArtificialAnlys 发了一条长推,约 50 万浏览。这是外面引用里传播最广的一张图。

@ArtificialAnlys · Intelligence Index 长推

AA Intelligence Index:1.3 max 62(棋盘格=尚未公开),1.3 xhigh 61,和 Sol max、Grok 4.6 high 并列
• 五个半月四次发版。xhigh 从 1.1 的 53、1.2 的 57,到现在 61。
• max 是合作方 limited preview,总分 62,只排在 Claude Fable 5.1(66)和 Opus 5 max(63)后面。
• 涨分主要来自 agent 和科学:Tau3-Bench Banking,xhigh 从 35% 到 47%,max 52% 暂列第一。
• xhigh 每道 Intelligence Index 任务约 $0.55,Sol max 约 $0.95,Grok 4.6 high 约 $0.94。定价仍是 $1.25 / $4.25 / 缓存 $0.15。
• 和 1.2 比,AA 测下来每任务输入 Token 大约多 57%,输出只多约 8%。这和 Meta 内部「少 25% Token」不是同一套活,别混着背。
• CritPt 18%→26%,GPQA Diamond 90%→94%。AA-LCR 从 83% 掉到 79%。AA-Omniscience 准确率微降,是因为更会弃权,幻觉率反而下来了。

AA 跟帖 · Tau3-Bench Banking,max 52% 暂第一
Quotes and replies热评和楼里的话
下面这些都是原推的引用,或直接回 @AIatMeta 的评论。Vincent 的 @vansinhu 这条对话里没有搜到回复,所以本账号评论只放 @AIatMeta 自己那两楼。

@testingcatalog · DeepSWE 超过 GPT-5.6 和 Opus 5,并读出 Watermelon

@DanDr1s · 把 DeepSWE 和长上下文分数摊开写

@JustinGorya · 一条 prompt oneshot 出整站,夸前端

@youjiaxuan · 拿 contributor 价和 Opus 比,写出 125x 这个数字。这是报价对比,不是 AA 的每任务成本

@vercel_dev · 已上 AI Gateway,contributor 便宜约 90%

@aimlapi · 用 1.3 vs 1.2 做维京手办 HTML

@thesoragirls · New Muse Spark just learned manners. Asks first. Burns fewer tokens. Still codes.

@ScarletKc_ · 中文长评:少说话、会确认、DeepSWE 从 55.0 到 75.4
原推楼里更能看出人在用什么。有人去问 Meta AI 自己是谁,它还说 powered by Muse Spark 1.1。API 站也有人骂打不开。官方没公布 1.3 参数量。

@n1d_all 评论 · 问 Meta AI 是哪个模型,回答仍是 Muse Spark 1.1

@n1d_all 跟帖 · 为什么消费级 Meta AI 还没升到 1.3

@YoungLiam0927 评论 · Your API site doesn't even work

@Dave_John_Smith 评论 · 更大模型?那 Spark 1.3 本身有多大?官方没给参数量

@ham_zax 评论 · 真正要测的是打断:任务 A 做到 30 次工具调用后改约束,能不能改到位还不把任务 B 漏进去

@JeffJamesMartin 评论 · 追问、升级、确认,可能比再跳一分更重要

@venicjan21 评论 · 付了 basic 计划,dev.meta.ai 上仍看不到这个模型
Hacker NewsHN 在吵什么
Muse Spark 1.3 这条发了大约 3 小时就到 300 分、200 多条评论。 pelican 还是 Simon Willison 开头。1.3 画得比 1.2 像样,xhigh 那档最贵的一次大约 7.5 美分、1 分 34 秒。
• 有人用 1.2 contributor 做日常开发,觉得它不乱加戏,只执行指令。担心 1.3 为了刷榜又开始「帮忙」。
• contributor $0.10 / $0.20 被反复拿出来:这是目前少数把「训练用你的数据值多少钱」写成价差的实验室。
• DeepSWE 75.4 被当成性价比炸弹,也有人问是不是又在 benchmaxxing。
• 有人提醒:官方分数表是 max,今天买不到。
• Muse Code 被说成和模型一起训过,换别人的 harness 会更费 Token。
• 其余大量是恨 Meta / 恨 Zuck / 道德排序,和模型关系不大。
Price and how to run it钱,和今天怎么用
• 标准价和 1.2 一样:输入 $1.25 / 百万,输出 $4.25,缓存读 $0.15。OpenRouter 上也是这个数。
• contributor:输入 $0.10,输出 $0.20。提示和输出可能被用来改进 Meta 产品。
• 上下文 1M,没变。
• 今天入口:Muse Code、Meta Model API、OpenRouter 的 meta/muse-spark-1.3 和 contributor,Vercel AI Gateway。
• 装 Muse Code(官方博客原样):curl -fsSL https://dev.meta.ai/install.sh | bash
• max reasoning 还没有。音频理解 OpenRouter 写了尚未完全支持。
Wang 对 Axios 说,定价依然 aggressive;和别的实验室不同,他们还没因为安全问题暂停过发版,但 safety 投入加了。
Open weights开源的是谁,链接在这
Muse Spark 1.3 本身没开源,权重链接不存在。官方只说了后面会放 Muse Spark 开源权重,今天没有仓库。现在能下的是 8 月 10 日放的 Muse Glimmer 30B,从 Spark 蒸馏出来的本地模型,Apache 2.0。
• 权重:huggingface.co/meta-models/Muse-Glimmer-30B · BF16,Apache 2.0
• GGUF(llama.cpp,24GB 起步):meta-models/Muse-Glimmer-30B-GGUF
• ExecuTorch:meta-models/Muse-Glimmer-30B-ExecuTorch-PTE
• 官方介绍:Introducing Muse Glimmer
• 约 29.6B,文本+图像,上下文 131K,单卡 24GB 量化能跑。不是 1.3。
What to do today今天能用的和用不上的
• 能用:xhigh 这一档的 1.3,Muse Code / API / OpenRouter / Gateway。
• 用不上:max。表上那列先当预告。Meta AI 应用/网页此刻仍自称 Muse Spark 1.1。
• 开源:只有 Glimmer 30B,链接见上一节。Spark 1.3 权重还没放。
• 别混:Meta 内部「少 25% Token」,和 AA 测的「每任务输入更多」,说的不是同一件事。
• 长上下文分数很好看。楼里 @ham_zax 要的打断测试,官方没给。
• 后面还有:更大模型、开源权重,以及 Zuck 那颗西瓜。
材料来自 原推、官方博客、AA、HN、Axios。评论只拉了一小页,没有翻完全楼。