
最近,AI 圈天天有热闹。
昨天,黄仁勋先发了入驻社媒平台后的第一条帖子,公开力挺开源模型。

没过多久,Anthropic 紧跟着就甩出了 Claude Opus 5,号称用一半的价格,逼近 Fable 5 的表现。
这看起来像和老黄暗戳戳地较劲,毕竟 Claude 系列产品一直闭源,开源哪有赚钱香!
其实,大模型的开源和闭源,两种路线之争早就摆在明面上了。很多人觉得开源是大势所趋,闭源迟早要完,但现实没这么简单。
开源模型有成本优势,靠部署和服务赚钱,但它的天花板也很明显,最顶尖的能力,往往不会出现在开源模型里。
前沿的科研突破、最复杂的推理能力,大多时候是闭源模型先跑出来。
一边是开源阵营敲锣打鼓联名造势,一边是闭源巨头闷声降价卷性能,两相对比,相信很多人还是更关注模型的具体表现。
尤其这次更新的 Claude Opus 5 专门为日常工作设计,官方表示,它的运行效率远远高于其他型号,可以说是综合性能相当能打的模型。

比如 Opus 5 在软件工程等领域的任务上表现卓越,在 Frontier-Bench v0.1 中,Opus 5 的性能优于所有其他模型,并且在单位任务成本更低的情况下,比 Opus 4.8 的性能提升了两倍以上。

在 CursorBench 3.2 上,用最大推理强度运行模型,Opus 5 的得分仅比 Fable 5 的峰值得分低 0.5%,但单位任务的成本仅为后者的半数。

这个迭代程度,Anthropic 真是对自家模型也下死手啊!
在知识型工作和问题解决类任务中,Opus 5 的测试表现同样优异。
ARC-AGI 3,用于测试模型解决全新问题的表现,Opus 5 的得分是排名第二的模型的 3 倍。

而在 OSWorld 2.0 这一计算机性能基准测试中,Opus 5 在任何预算条件下均优于所有其他型号,其最佳成绩仅相当于 Fable 5 的三分之一不到。

除此以外,Opus 5 还拥有更为强大的视觉生成能力。
Opus 5 能够精准可视化气流在空气动力学(以及非空气动力学)物体表面的流动情况。

以及制作精致的可交互式细胞示意图。

价格方面,每百万输入 Token 收费 5 美元,每百万输出 Token 收费 25 美元,和 Opus 4.8 相同,属于加量不加价。
讲真,我第一反应是:Fable 5 还有存在的必要吗?干脆停产得了!
不过转念一想,Fable 5 和 Opus 5,或许根本就不是一个赛道的产品。
Fable 5 瞄准极致场景,超大型科研项目、跨领域巨型商业规划、长期自治的复杂 Agent,动辄几十万 Token 的长周期任务,要的是全局统筹能力和极致的深度。
而 Opus 5 覆盖的,是剩下的日常高频场景,程序员写代码改 Bug、企业做文档分析、中小型自动化办公、普通的智能体流水线。
说白了,绝大多数人花着旗舰的钱,用的其实是次旗舰就能搞定的需求。
Opus 5 完全可以精准解决这个痛点,用一半的价格,给到 99% 的旗舰体验,把中间最庞大的用户群体牢牢攥在手里。
同时,在部署前的测试中,通过自动化行为审计发现,Opus 5 比 Opus 4.8、Sonnet 5 和 Fable 5 更好地遵循预先设定的准则,并表现出最低的欺骗性行为率,并且最不容易被误导而遭到滥用。
Anthropic 认为,这可以极大程度避免可能带来的难以逆转的副作用,Opus 5 也是他们迄今为止最安全的模型。

当然,Opus 5 也并非完全没有短板。
Anthropic 刻意没有让 Opus 5 接受针对网络任务的训练,或许正因如此,在网络安全方面的表现,Opus 5 距离 Mythos 5 还有差距。
在 OSS-Fuzz 上,评估模型在无需大量人工干预的情况下,发现并利用漏洞的能力,Mythos 5 和 Opus 5 在漏洞识别方面的表现不相上下,但 Opus 5 在漏洞利用的构建能力上却远远落后于 Mythos 5。

考虑到 Anthropic 有意为之,那其实这不是 Opus 5 的能力短板,而是它针对应用场景做的一个很有意思的取舍。
网络安全赛道,Opus 5 漏洞挖掘能力很强,逼近专业的安全模型,但写漏洞利用程序的成功率差很多,并非模型做不到,是 Anthropic 主动限制了。
一旦检测到高危标记请求,系统会自动回落到权限更低的旧版本模型,相当于主动给自己上了安全锁。
在能力和安全之间主动做平衡,而不是一味堆性能,这点反而比很多只管跑分的模型,要成熟得多。
当然,也可能是 Anthropic 对模型能力做出的硬区分,以针对个人和企业的不同需求,毕竟都便宜一半了,还要啥自行车!

开源也好,闭源也罢,路线之争最终还是要落到用户价值上。
对我们普通人来说,不用纠结谁是未来,谁代表正义。模型越来越强,价格越来越实在,干活越来越靠谱,这就够了。
至于 Opus 5 这款半价旗舰的更新,到底是常规迭代,还是应对老黄影响力的见招拆招,以及闭源能不能挡住开源的浪潮,没人知道。
但可以肯定的是,大模型的内卷,已经从拼性能,卷到了拼性价比、拼落地能力的深水区。
真正的好戏,才刚刚开始。
撰稿:SC

