2026 年 7 月 24 日,Anthropic 正式发布 Claude Opus 5
它的 API 输入价格仍为每百万 Token 5 美元,输出价格仍为每百万 Token 25 美元,与 Claude Opus 4.8 相同;但 Anthropic 宣称,其编码、知识工作和长任务能力已接近价格高一倍的 Claude Fable 5

这次发布真正重要的地方,不是某个基准又提高了几个百分点,而是 Anthropic 正在重新划分产品层级:
Fable 5 继续承担“最高能力、超长自主任务”的角色,Opus 5 则试图成为企业和开发者每天都能调用的高能力模型。
换句话说,Anthropic 没有简单推出一个更贵的旗舰,而是在压低高水平推理的使用门槛。
跑分应该怎么看?
我们先来看下,Anthropic放出来的跑分数据,

除了上述图片中的,常规的模型能力对比,Anthropic 在发布材料里还重点展示了几项更偏实际应用的测试
其中,Frontier-Bench 主要考察模型能不能在终端环境中独立完成一整套复杂编程任务。它测试的不只是代码生成,还包括理解项目、调用工具、排查错误和连续执行多个步骤。按照公布的数据,Opus 5 的成绩为 43.3%,高于 Opus 4.8 的 18.7%、Fable 5 的 33.7%和 GPT-5.6 Sol 的 37.5%。
从这个结果来看,Opus 5 的提升不只是“更会写代码”,而是更接近一个能够持续执行任务的编程 Agent。尤其是和上一代相比,成绩提升较为明显,说明它在长流程任务、工具调用和错误修正方面可能有了较大改进。
另一项受到关注的测试是 ARC-AGI-3。这类测试主要考察模型面对陌生规则和全新问题时,能不能通过观察和推理找到解决办法,而不是依赖训练数据中的现成答案。官方验证结果显示,Opus 5 得分为 30.16%,GPT-5.6 Sol 为 7.78%,Opus 4.8 为 1.52%。
不过,ARC-AGI-3 的成绩更适合用来观察模型的抽象推理能力,不能直接等同于日常问答体验
确实很惊艳,就是你们A社之前号称最强的肥波5,怎么这么轻易就被自己的新模型超过了~
核心变化
大家还记得,上一代Opus4.8在在深度推理、长时程agent任务、多步工具调用上仍与真正的前沿 还是存在差距的,如今Opus 5的核心变化可以归纳为两点:
hinking默认开启,Effort成为主控制旋钮
在Opus 4.8上,请求默认不思考,需显式设置thinking: {"type": "adaptive"}。Opus 5反过来:同一请求默认开启Thinking,模型自己决定何时、想多深
官方文档明确指出:Opus 5把额外effort更可靠地转化成更好结果。代价是max_tokens现在要同时覆盖Thinking + 最终输出,旧工作负载如果按“无Thinking”设token上限,可能被截断。
长时程与自验证能力的强化
如今Opus 5模型自己会,更主动验证自己的工作、更愿意在工具循环中迭代,而不是一次写完就交卷。Frontier-Bench等评测上,官方给出的数字是Opus 5显著高于Opus 4.8,并在部分任务上超过Fable 5
当然代价就是,默认响应更长、agent会话中更频繁向用户汇报进度、更主动委派子agent。
另外官方提示词指南已明确建议:去掉旧模型那套“最后再加一步验证”的指令,否则容易过度验证、浪费token。所以A社干脆把 Claude Code 里预先塞给模型的系统提示词,也就是预先塞给模型的那一大段提示词,删掉了 80% 以上

这让我想到了隔壁的GPT-5.6 Sol也是这样,以前安装的Skills越多,模型反而会越懵逼,如今这些Skills的能力,已经被模型直接消化吸收了,内置这些强大的能力
这里建议大家把已经安装到本地的skills进行"瘦身",很多的约束、很多的Skill,已经变得毫无用处了
主动削弱网络安全/渗透能力
为防止高阶 Agent 被恶意利用于零日漏洞(0-day)攻击或自动编写网络武器,Anthropic 在 Opus 5 中主动裁剪了网络渗透与高风险利用代码的生成权重。毕竟全天24小时智能渗透太超模了~
这也意味着部分正规的,安全测试人员会发现其在编写漏洞利用 Poc 时也会受到了更严格的安全拦截
与GPT-5.6 Sol的使用体验对比
厂商基准并不等于真实业务表现,所以这2天,我也是疯狂使用了Claude Opus 5,这就是为什么我文章出的比较慢
体验下来,让我感觉更适合进行分析、审美、设计、规划的产品任务,Opus 5更有主见,会经常和你沟通,偶尔会偷懒给出错误的分析,响应速度快。
而GPT-5.6 Sol听话、执行力更强,思考时间比较久,擅长编程,指哪打哪,前提是你有足够的认知来驾驭,
你们用上 Opus 5 了吗?说说你们的使用体验,欢迎在评论区讨论~
END

往期精选:

请点下【♡】给小编加鸡腿
