今夜,Anthropic没有任何预热,直接甩出了Claude Opus 5.5。Opus 5.5不仅性能追平了Fable 5.1,成本还要比上一代Opus 5低40%,输出速度狂飙30%。如今,每个人可以拿到Fable 5.1级的能力,用更少的钱,干更多的活儿。用Anthropic的话来说,Opus 5.5在智能体编程、计算机使用、知识工作上,全部刷新了SOTA。尤其是Terminal-Bench 4.0,跑出了66.4%的成绩,直接把GPT-6 Astra、Fable 5.1按在地上打。知识工作GDPval-AA v2.1拿下1846 Elo,也跑到了对手前面。如今,Claude 5.5的亮相,直接把新一轮模型大战的火药味儿直接拉满。Anthropic官宣不过2小时,OpenAI直接扔出了GPT-6 Sol和Luna迎战。目前,Claude Opus 5.5已在全球正式上线,未来几周,Sonnet 5.5与Haiku 5.5也将同步登场。Claude此番「跳级发售」,摆明了就是冲着OpenAI去的。
Artifical Analysis上,Claude 5.5和Fable 5.1,全部压过了GPT-6 Astra
在Anthropic自家的能力指数ECI上,Opus 5.5的得分干过了「雪藏」的Mythos 5.1。
第三方机构Vals AI的RSI指数,测的是模型自己搞AI研究的本事。实测下来,Opus 5.5全球第一。
Terminal-Bench 4.0衡量的是AI在真实终端环境中完成复杂多步编程任务能力。在这里,Opus 5.5直接拿下了66.4%,领先GPT-6 Astra整整8.5个百分点(57.9%)。Fable 5.1是55.8%;Opus 5只有52.3%。Opus 5.5只要开默认档,就能锤爆Opus 5的最高档,而成本只有它的五分之一;追平Astra,也只需花Astra 40%的钱。此外,在测真实代码合并的FrontierCode v1.1,它跑出54.4%,险胜Astra的53.3%。最夸张的是CursorBench 4.0,题目全是从真实Cursor会话里扒出来的含糊不清、跨文件的烂摊子任务,它拿下57.8%,而GPT-5.6 Sol只有41.7%。GDPval-AA v2.1基准测试覆盖44个职业的真实工作任务,Opus 5.5拿下1846 Elo,GPT-6 Astra只有1542。300多分的Elo差距,在竞技评分体系里几乎是代差。
最值得一提的是,Opus 5.5这一次在写作和沟通能力上,再次强化了。现在它学会了「结论前置」,扫一眼就能看懂,不说黑话、不拽怪词,让怎么写就怎么写。Anthropic把两个版本拉了个横评,大家感受一下:遇到Bug时,老版Opus 5要慢条斯理地铺垫一大段,结论藏在后面;Opus 5.5第一句话就一针见血地指出账单异常,紧接着干净利落地附上代码。Box的AI产品副总实际体验后表示,「Opus 5.5的token用量只有上一代的三分之一,啰嗦度暴降40%」。
Claude Opus 5.5到底香不香,光听Anthropic吹可不行。Bun的作者Jarred Sumner说了句大实话,写作像Opus 4.6,写代码像Fable 5.1,它会很快成为大部分人的主力模型。
虽然Claude不会生图,但它这次手搓动画效果的体验,那叫一个丝滑。开发者cheaty看完网友DreW制作的一个30秒短片撂下一句话,「在我看来,这比Astra更像AGI」!谷歌DeepMind的Ben Poole在纸上随手画了一台投石机和一摞方块的草图。
眼瞧着,Opus 5.5就把草图变成了一个能发射、能砸塌方块的3D物理仿真,投石机的关节和配重都是照着草图搭的。Anthropic大牛Addy Osmani也来整活了。他直接在Three.js里搓了一只骑自行车的鹈鹕的3D动画,在线开香槟庆祝。沃顿商学院的Ethan Mollick再次用同一套shader提示词测了下——暴雨中的哥特城市。
有人让它整一个涂鸦画风的FPS,居然直接一把过,清完三波小怪之后甚至还能打Boss。 另一位开发者Edwin做了一款游戏,灵感来自人类历史上第一台计算机——安提基特拉机械装置的打捞发现。画面和音效全都是 Opus 5.5 纯代码实时跑出来的,没有任何外部素材。过去,Opus系列让很多人又爱又恨,能力强,但Token蒸发太快。这一次,Anthropic直接启动了「加量减价」模式。输入4刀、输出20刀,各砍20%。最烧钱的缓存读取直接从0.50刀砍到0.20刀,降了60%。想追求速度,开Fast模式提速2.5倍,价格翻倍,8刀和40刀。官方的说法很诱人,在典型工作负载下,整体便宜40%,输出快30%。但Artificial Analysis的测试显示,在最高档max effort下,Opus 5.5每解一道题,平均要狂吐11.9万个token,而思考就消耗了8.4万token。整体看,Opus 5是7.3万,Fable 5.1是7.8万,GPT-6 Astra只有2.7万。也就是说,它比上一代多想了60%,比Astra多想了4倍。单价降两成,思考量涨六成,两头一抵,白降。在安全审查这块,Anthropic爆出了一句让人后背发凉的大实话。Opus 5.5在自动行为审计里拿了历史最高分,试图绕过限制的越狱行为比上一代少了85%,而且每次都会「乖乖主动上报」。但紧接着,官方坦承,他们发现Opus 5.5经常敏锐地怀疑自己正在被人类评估。这事细思极恐。一个AI知道自己在考试,它在考场上展现的「乖巧」,未必代表它在真实世界里不受控时的反应。随着能力变强,这个问题正在变成一个无解的黑洞。
Anthropic也说了,Opus 5.5只是首个版本,Sonnet 5.5和Haiku 5.5也即将推出。从旗舰到中端到轻量级,Anthropic正在用一套完整的产品线,对OpenAI发起全线进攻。而OpenAI那边,也拿出了GPT-6 Sol和Luna,效率更高、成本更优的选择。大模型这波仗,从拼技术一路卷到拼价格,现在可真到肉搏的时候了。参考资料:
https://www.anthropic.com/claude-opus-5-5https://x.com/AnthropicAI/status/2102435703535939725?s=20https://x.com/ClaudeDevs/status/2102438800836489554?s=20编辑:桃子 摩西

关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。