Anthropic正式发布Claude Opus 5:实测接近Fable 5能力

21ic电子网 2026-07-28 18:20

2026 年 7 月 24 日,Anthropic 正式发布 Claude Opus 5

它的 API 输入价格仍为每百万 Token 5 美元,输出价格仍为每百万 Token 25 美元,与 Claude Opus 4.8 相同;但 Anthropic 宣称,其编码、知识工作和长任务能力已接近价格高一倍的 Claude Fable 5

Anthropic正式发布Claude Opus 5:实测接近Fable 5能力图1

这次发布真正重要的地方,不是某个基准又提高了几个百分点,而是 Anthropic 正在重新划分产品层级:

Fable 5 继续承担“最高能力、超长自主任务”的角色,Opus 5 则试图成为企业和开发者每天都能调用的高能力模型。

换句话说,Anthropic 没有简单推出一个更贵的旗舰,而是在压低高水平推理的使用门槛。

跑分应该怎么看?

我们先来看下,Anthropic放出来的跑分数据,

Anthropic正式发布Claude Opus 5:实测接近Fable 5能力图2

除了上述图片中的,常规的模型能力对比,Anthropic 在发布材料里还重点展示了几项更偏实际应用的测试

其中,Frontier-Bench 主要考察模型能不能在终端环境中独立完成一整套复杂编程任务。它测试的不只是代码生成,还包括理解项目、调用工具、排查错误和连续执行多个步骤。按照公布的数据,Opus 5 的成绩为 43.3%,高于 Opus 4.8 的 18.7%、Fable 5 的 33.7%和 GPT-5.6 Sol 的 37.5%。

从这个结果来看,Opus 5 的提升不只是“更会写代码”,而是更接近一个能够持续执行任务的编程 Agent。尤其是和上一代相比,成绩提升较为明显,说明它在长流程任务、工具调用和错误修正方面可能有了较大改进。

另一项受到关注的测试是 ARC-AGI-3。这类测试主要考察模型面对陌生规则和全新问题时,能不能通过观察和推理找到解决办法,而不是依赖训练数据中的现成答案。官方验证结果显示,Opus 5 得分为 30.16%,GPT-5.6 Sol 为 7.78%,Opus 4.8 为 1.52%。

不过,ARC-AGI-3 的成绩更适合用来观察模型的抽象推理能力,不能直接等同于日常问答体验

确实很惊艳,就是你们A社之前号称最强的肥波5,怎么这么轻易就被自己的新模型超过了~

核心变化

大家还记得,上一代Opus4.8在在深度推理、长时程agent任务、多步工具调用上仍与真正的前沿 还是存在差距的,如今Opus 5的核心变化可以归纳为两点:

  1. hinking默认开启,Effort成为主控制旋钮

在Opus 4.8上,请求默认不思考,需显式设置thinking: {"type": "adaptive"}。Opus 5反过来:同一请求默认开启Thinking,模型自己决定何时、想多深

官方文档明确指出:Opus 5把额外effort更可靠地转化成更好结果。代价是max_tokens现在要同时覆盖Thinking + 最终输出,旧工作负载如果按“无Thinking”设token上限,可能被截断。

  1. 长时程与自验证能力的强化

如今Opus 5模型自己会,更主动验证自己的工作、更愿意在工具循环中迭代,而不是一次写完就交卷。Frontier-Bench等评测上,官方给出的数字是Opus 5显著高于Opus 4.8,并在部分任务上超过Fable 5

当然代价就是,默认响应更长、agent会话中更频繁向用户汇报进度、更主动委派子agent。

另外官方提示词指南已明确建议:去掉旧模型那套“最后再加一步验证”的指令,否则容易过度验证、浪费token。所以A社干脆把 Claude Code 里预先塞给模型的系统提示词,也就是预先塞给模型的那一大段提示词,删掉了 80% 以上

Anthropic正式发布Claude Opus 5:实测接近Fable 5能力图3

这让我想到了隔壁的GPT-5.6 Sol也是这样,以前安装的Skills越多,模型反而会越懵逼,如今这些Skills的能力,已经被模型直接消化吸收了,内置这些强大的能力

这里建议大家把已经安装到本地的skills进行"瘦身",很多的约束、很多的Skill,已经变得毫无用处了

  1. 主动削弱网络安全/渗透能力

为防止高阶 Agent 被恶意利用于零日漏洞(0-day)攻击或自动编写网络武器,Anthropic 在 Opus 5 中主动裁剪了网络渗透与高风险利用代码的生成权重。毕竟全天24小时智能渗透太超模了~

这也意味着部分正规的,安全测试人员会发现其在编写漏洞利用 Poc 时也会受到了更严格的安全拦截

与GPT-5.6 Sol的使用体验对比

厂商基准并不等于真实业务表现,所以这2天,我也是疯狂使用了Claude Opus 5,这就是为什么我文章出的比较慢

体验下来,让我感觉更适合进行分析、审美、设计、规划的产品任务,Opus 5更有主见,会经常和你沟通,偶尔会偷懒给出错误的分析,响应速度快。

GPT-5.6 Sol听话、执行力更强,思考时间比较久,擅长编程,指哪打哪,前提是你有足够的认知来驾驭,

你们用上 Opus 5 了吗?说说你们的使用体验,欢迎在评论区讨论~

END


Anthropic正式发布Claude Opus 5:实测接近Fable 5能力图4



最后提一句,21ic论坛(bbs.21ic.com)正在招募原创作者,单篇文章奖励最高500元,欢迎广大网友踊跃投稿!Anthropic正式发布Claude Opus 5:实测接近Fable 5能力图5 

往期精选:


Anthropic正式发布Claude Opus 5:实测接近Fable 5能力图6
扫描二维码,关注视频号

请点下【♡】给小编加鸡腿



Anthropic正式发布Claude Opus 5:实测接近Fable 5能力图7

关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。
IC
more
西门子 EDA Forum--定制IC |数字IC设计及验证|物理设计及验证|可测性设计|芯片制造|先进封装|PCB(8月13日,上海)
【K230/K230D新技能点亮】CanMV K230 MicroPython版小智语音助手正式上线,速来体验
HKIC | 进迭时空祝贺港投公司2025年年报再创佳绩,携手共筑 RISC-V 创新生态
从“替代神经”到“重塑神经”:新型双向脑机接口登上《Nature Medicine》
上海贝岭:多轮驱动重塑国产IC竞争力
IC设计巨头调价!主力芯片产品涨价10%以上
WAIC意犹未尽?8月南京,ICDIA 2026 接棒续燃!
聚焦新质生产力,TMEIC深化在华实践
Anthropic正式发布Claude Opus 5:实测接近Fable 5能力
直播倒计时一天! | 3D IC 理想照进现实
Copyright © 2025 成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号