Meta 上桌了吗?Muse Spark 1.3 来了,DeepSWE 超过 Opus 5,工具调用少 20%

机智流 2026-09-03 07:45


2026-09-03 · 原推、本账号跟帖、热评与独立评测

Meta 官方账号 @AIatMeta 北京时间 9 月 3 日凌晨发了 Muse Spark 1.3。同一晚 Zuck 自己下场,Alexandr Wang 跟了一串。原推只有 57 条回复、63 条引用,但楼里真正值钱的,是官方自己跟的两条,加上外面那批带图的评测推。

先看原推。四个卖点全写在正文里:一条线程里同时撑多个 workflow;会问、会喊卡住、重大操作前会确认;对自己做不到的事更认账;对内对比 1.2,工具调用大约少 20%,Token 大约少 25%。

Meta 上桌了吗?Muse Spark 1.3 来了,DeepSWE 超过 Opus 5,工具调用少 20%图1

@AIatMeta 原推截图 · 12:36 PM Sep 2, 2026 · 10.6 万浏览

Meta 上桌了吗?Muse Spark 1.3 来了,DeepSWE 超过 Opus 5,工具调用少 20%图2

原推配图 1 · Muse Spark 1.3 视觉

Meta 上桌了吗?Muse Spark 1.3 来了,DeepSWE 超过 Opus 5,工具调用少 20%图3

原推配图 2 · 官方分数表。注意:这一列写的是 1.3 max,今天还没对公众开放

The account's own thread本账号自己跟的两条

原推下面官方立刻跟了两条。这才是 @AIatMeta 自己的「评论」。

Meta 上桌了吗?Muse Spark 1.3 来了,DeepSWE 超过 Opus 5,工具调用少 20%图4

本账号评论 1 · 今天在 Muse Code 和 Meta Model API 上线,max 还要等安全测试

Meta 上桌了吗?Muse Spark 1.3 来了,DeepSWE 超过 Opus 5,工具调用少 20%图5

本账号评论 2 · 更大模型、Muse Spark 开源权重还在后面

第二条和 Zuck 那条对得上:开源权重之外,他还写了个西瓜 emoji。TestingCatalog 把它读成下一代大模型代号 Watermelon。官方博客原话是 bigger models,没有点名。

Zuck and Wang老板和实验室负责人怎么说

Meta 上桌了吗?Muse Spark 1.3 来了,DeepSWE 超过 Opus 5,工具调用少 20%图6

@finkd(Mark Zuckerberg)· 约 115 万浏览、1.1 万赞

Zuck 的原话是 frontier performance almost too cheap to meter,并点名这是 Muse 在 coding 和 agentic 上最大的一跳。Axios 稍后引用 Meta AI 负责人 Alexandr Wang:It's very competitive with frontier models。可用性上的改动,是给扎克伯格财报里说的 24/7 personal agents 铺路。

Meta 上桌了吗?Muse Spark 1.3 来了,DeepSWE 超过 Opus 5,工具调用少 20%图7

@alexandr_wang 自己发的 1/ · 约 24 万浏览

What the blog actually says官方博客多写了什么

原推是短的。完整稿在 Introducing Muse Spark 1.3,大约 3 分钟读完。评测方法另有一页 Evaluation Methodology。

• 长任务:给一个开放目标,自己用工具从乱源里攒上下文,补计划漏洞,最后交一份可交付物。

• 协作:提示含糊会追问,卡住会喊人,重大动作前确认。长任务里能按你的偏好勤汇报,或者自己闷头干。

• 多任务:一条乱线程里,新提示要能对上正确的那个旧任务,中途改约束也不该串台。

• 校准:知道自己会什么、不会什么,少把没做成的事说成做成了。

• 写代码:相对 1.2 少说废话、少多余回合,工程师内部对比大约少 20% 工具调用、少 25% Token。

• 安全:抗注入更好;对不可逆动作更谨慎。max reasoning 还卡在额外安全测试。

博客里塞了几段 GDPVal 风格的演示:X-Wing 流场报告、修贝斯轨再混音、县商会 PPT、选区意见一页纸。不是真实产品,是模型自己做出来的样张。

Meta 上桌了吗?Muse Spark 1.3 来了,DeepSWE 超过 Opus 5,工具调用少 20%图8

官方演示 · X-Wing 流场报告草稿(模型生成,不是真实产品)

Meta 上桌了吗?Muse Spark 1.3 来了,DeepSWE 超过 Opus 5,工具调用少 20%图9

官方演示 · 贝斯错音修补与混音

The scoreboard分数怎么读

原推那张表,1.3 用的是 max。官方自己写了:今天能用的是以前那些 reasoning 档,max 还在安全测试。Hacker News 第一条补链就把这点戳破了:表上全是 max。

• DeepSWE v1.1:1.3 max 75.4,压过 Opus 5 的 74.0 和 GPT-5.6 Sol max 的 73.0。1.2 xhigh 只有 55.0。

• 长上下文 MRCR:256K–512K 98.5,512K–1M 98.1。1.2 同档只有 66.3 和 55.5。

• SWE-Atlas CodeBase QnA:59.4,高于 Sol 53.5 和 Opus 52.7。

• Terminal-Bench 2.1:88.8,和 Sol max 持平,高于 Opus 86.7。

• GDPVal-AA v2:1754 Elo,仍低于 Opus 5 的 1824。JobBench、OSWorld、AutomationBench 也是跟在 Opus 后面。

方法页还写了一句别忽略:第三方模型是 best-effort,提示和工具未必调到对方最佳;不可评分和拒答记 0,分母还在。OSWorld 上 1.3 用的是 08.08 版任务,1.2 用的是 06.24。

Independent numbersArtificial Analysis 的独立榜

官方表之外,@ArtificialAnlys 发了一条长推,约 50 万浏览。这是外面引用里传播最广的一张图。

Meta 上桌了吗?Muse Spark 1.3 来了,DeepSWE 超过 Opus 5,工具调用少 20%图10

@ArtificialAnlys · Intelligence Index 长推

Meta 上桌了吗?Muse Spark 1.3 来了,DeepSWE 超过 Opus 5,工具调用少 20%图11

AA Intelligence Index:1.3 max 62(棋盘格=尚未公开),1.3 xhigh 61,和 Sol max、Grok 4.6 high 并列

• 五个半月四次发版。xhigh 从 1.1 的 53、1.2 的 57,到现在 61。

• max 是合作方 limited preview,总分 62,只排在 Claude Fable 5.1(66)和 Opus 5 max(63)后面。

• 涨分主要来自 agent 和科学:Tau3-Bench Banking,xhigh 从 35% 到 47%,max 52% 暂列第一。

• xhigh 每道 Intelligence Index 任务约 $0.55,Sol max 约 $0.95,Grok 4.6 high 约 $0.94。定价仍是 $1.25 / $4.25 / 缓存 $0.15。

• 和 1.2 比,AA 测下来每任务输入 Token 大约多 57%,输出只多约 8%。这和 Meta 内部「少 25% Token」不是同一套活,别混着背。

• CritPt 18%→26%,GPQA Diamond 90%→94%。AA-LCR 从 83% 掉到 79%。AA-Omniscience 准确率微降,是因为更会弃权,幻觉率反而下来了。

Meta 上桌了吗?Muse Spark 1.3 来了,DeepSWE 超过 Opus 5,工具调用少 20%图12

AA 跟帖 · Tau3-Bench Banking,max 52% 暂第一

Quotes and replies热评和楼里的话

下面这些都是原推的引用,或直接回 @AIatMeta 的评论。Vincent 的 @vansinhu 这条对话里没有搜到回复,所以本账号评论只放 @AIatMeta 自己那两楼。

Meta 上桌了吗?Muse Spark 1.3 来了,DeepSWE 超过 Opus 5,工具调用少 20%图13

@testingcatalog · DeepSWE 超过 GPT-5.6 和 Opus 5,并读出 Watermelon

Meta 上桌了吗?Muse Spark 1.3 来了,DeepSWE 超过 Opus 5,工具调用少 20%图14

@DanDr1s · 把 DeepSWE 和长上下文分数摊开写

Meta 上桌了吗?Muse Spark 1.3 来了,DeepSWE 超过 Opus 5,工具调用少 20%图15

@JustinGorya · 一条 prompt oneshot 出整站,夸前端

Meta 上桌了吗?Muse Spark 1.3 来了,DeepSWE 超过 Opus 5,工具调用少 20%图16

@youjiaxuan · 拿 contributor 价和 Opus 比,写出 125x 这个数字。这是报价对比,不是 AA 的每任务成本

Meta 上桌了吗?Muse Spark 1.3 来了,DeepSWE 超过 Opus 5,工具调用少 20%图17

@vercel_dev · 已上 AI Gateway,contributor 便宜约 90%

Meta 上桌了吗?Muse Spark 1.3 来了,DeepSWE 超过 Opus 5,工具调用少 20%图18

@aimlapi · 用 1.3 vs 1.2 做维京手办 HTML

Meta 上桌了吗?Muse Spark 1.3 来了,DeepSWE 超过 Opus 5,工具调用少 20%图19

@thesoragirls · New Muse Spark just learned manners. Asks first. Burns fewer tokens. Still codes.

Meta 上桌了吗?Muse Spark 1.3 来了,DeepSWE 超过 Opus 5,工具调用少 20%图20

@ScarletKc_ · 中文长评:少说话、会确认、DeepSWE 从 55.0 到 75.4

原推楼里更能看出人在用什么。有人去问 Meta AI 自己是谁,它还说 powered by Muse Spark 1.1。API 站也有人骂打不开。官方没公布 1.3 参数量。

Meta 上桌了吗?Muse Spark 1.3 来了,DeepSWE 超过 Opus 5,工具调用少 20%图21

@n1d_all 评论 · 问 Meta AI 是哪个模型,回答仍是 Muse Spark 1.1

Meta 上桌了吗?Muse Spark 1.3 来了,DeepSWE 超过 Opus 5,工具调用少 20%图22

@n1d_all 跟帖 · 为什么消费级 Meta AI 还没升到 1.3

Meta 上桌了吗?Muse Spark 1.3 来了,DeepSWE 超过 Opus 5,工具调用少 20%图23

@YoungLiam0927 评论 · Your API site doesn't even work

Meta 上桌了吗?Muse Spark 1.3 来了,DeepSWE 超过 Opus 5,工具调用少 20%图24

@Dave_John_Smith 评论 · 更大模型?那 Spark 1.3 本身有多大?官方没给参数量

Meta 上桌了吗?Muse Spark 1.3 来了,DeepSWE 超过 Opus 5,工具调用少 20%图25

@ham_zax 评论 · 真正要测的是打断:任务 A 做到 30 次工具调用后改约束,能不能改到位还不把任务 B 漏进去

Meta 上桌了吗?Muse Spark 1.3 来了,DeepSWE 超过 Opus 5,工具调用少 20%图26

@JeffJamesMartin 评论 · 追问、升级、确认,可能比再跳一分更重要

Meta 上桌了吗?Muse Spark 1.3 来了,DeepSWE 超过 Opus 5,工具调用少 20%图27

@venicjan21 评论 · 付了 basic 计划,dev.meta.ai 上仍看不到这个模型

Hacker NewsHN 在吵什么

Muse Spark 1.3 这条发了大约 3 小时就到 300 分、200 多条评论。 pelican 还是 Simon Willison 开头。1.3 画得比 1.2 像样,xhigh 那档最贵的一次大约 7.5 美分、1 分 34 秒。

• 有人用 1.2 contributor 做日常开发,觉得它不乱加戏,只执行指令。担心 1.3 为了刷榜又开始「帮忙」。

• contributor $0.10 / $0.20 被反复拿出来:这是目前少数把「训练用你的数据值多少钱」写成价差的实验室。

• DeepSWE 75.4 被当成性价比炸弹,也有人问是不是又在 benchmaxxing。

• 有人提醒:官方分数表是 max,今天买不到。

• Muse Code 被说成和模型一起训过,换别人的 harness 会更费 Token。

• 其余大量是恨 Meta / 恨 Zuck / 道德排序,和模型关系不大。

Price and how to run it钱,和今天怎么用

• 标准价和 1.2 一样:输入 $1.25 / 百万,输出 $4.25,缓存读 $0.15。OpenRouter 上也是这个数。

• contributor:输入 $0.10,输出 $0.20。提示和输出可能被用来改进 Meta 产品。

• 上下文 1M,没变。

• 今天入口:Muse Code、Meta Model API、OpenRouter 的 meta/muse-spark-1.3 和 contributor,Vercel AI Gateway。

• 装 Muse Code(官方博客原样):curl -fsSL https://dev.meta.ai/install.sh | bash

• max reasoning 还没有。音频理解 OpenRouter 写了尚未完全支持。

Wang 对 Axios 说,定价依然 aggressive;和别的实验室不同,他们还没因为安全问题暂停过发版,但 safety 投入加了。

Open weights开源的是谁,链接在这

Muse Spark 1.3 本身没开源,权重链接不存在。官方只说了后面会放 Muse Spark 开源权重,今天没有仓库。现在能下的是 8 月 10 日放的 Muse Glimmer 30B,从 Spark 蒸馏出来的本地模型,Apache 2.0。

• 权重:huggingface.co/meta-models/Muse-Glimmer-30B · BF16,Apache 2.0

• GGUF(llama.cpp,24GB 起步):meta-models/Muse-Glimmer-30B-GGUF

• ExecuTorch:meta-models/Muse-Glimmer-30B-ExecuTorch-PTE

• 官方介绍:Introducing Muse Glimmer

• 约 29.6B,文本+图像,上下文 131K,单卡 24GB 量化能跑。不是 1.3。

What to do today今天能用的和用不上的

• 能用:xhigh 这一档的 1.3,Muse Code / API / OpenRouter / Gateway。

• 用不上:max。表上那列先当预告。Meta AI 应用/网页此刻仍自称 Muse Spark 1.1。

• 开源:只有 Glimmer 30B,链接见上一节。Spark 1.3 权重还没放。

• 别混:Meta 内部「少 25% Token」,和 AA 测的「每任务输入更多」,说的不是同一件事。

• 长上下文分数很好看。楼里 @ham_zax 要的打断测试,官方没给。

• 后面还有:更大模型、开源权重,以及 Zuck 那颗西瓜。

材料来自 原推、官方博客、AA、HN、Axios。评论只拉了一小页,没有翻完全楼。


关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。
AR
more
我们拆了 1.1 万个 DeepSeek Harness 插件,发现官方几乎没有建立插件治理机制
Paradromics获得FDA批准,脑机接口开始接入个人设备
NVIDIA DGX Spark 加速构建面向物理 AI 的 3D 视觉平台
手把手实测!openEuler 24.03 部署 SGLang,Benchmark 数据出炉
英国车迷自制单座跑车Gasolini AR1,成本仅5万元合法上路
Harness Continual Learning:持续学习,从模型参数走向Agent Harness
如何搭建嵌入式软件工程师的专属Harness?
华硕ProArt P14上架官网,首搭RTX Spark超级芯片
AI高管“抢椅子”游戏再升级:Barret Zoph重返谷歌,OpenAI人才流失引担忧
跻身世界人形机器人运动会工业场景赛全国前三,ROSS Harness 以全自主模式突破工业具身智能落地瓶颈
Copyright © 2025-成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号