OpenAI、Anthropic邀您进入“大模型折扣季”

虎嗅APP 2026-09-23 18:53
OpenAI、Anthropic邀您进入“大模型折扣季”图1
OpenAI、Anthropic邀您进入“大模型折扣季”图2OpenAI、Anthropic邀您进入“大模型折扣季”图3
OpenAI、Anthropic邀您进入“大模型折扣季”图4

大模型更强,也更便宜了

OpenAI、Anthropic邀您进入“大模型折扣季”图5

出品|虎嗅科技组

作者|黄天媛

编辑|苗正卿

头图|AI生成

AI圈真是喘口气的时间都不给留。

北京时间9月23日,Anthropic刚把Claude Opus 5.5端上桌。2小时后,OpenAI立马祭出GPT-6 Sol和Luna迎战。

Opus 5.5比上一代Opus更强了,输入、输出单价也比上一代低了20%。而GPT-6 Sol两项单价只有Astra的五分之一;Luna更夸张,每百万输出Token只要0.5美元。

不过,这轮交锋最有意思的地方,不止降价。

Opus的能力提升,把自家Fable的位置弄得有点尴尬。OpenAI推出更低单价的Sol和Luna,想扩大用户的使用范围。但模型思考时间久了,最后可能花得反而更多。

OpenAI、Anthropic邀您进入“大模型折扣季”图6OpenAI、Anthropic邀您进入“大模型折扣季”图7Opus一升级,Fable先坐不住了OpenAI、Anthropic邀您进入“大模型折扣季”图8

Opus 5.5是Claude 5.5系列第一个登场的模型。

Anthropic给它的定位很高——大多数任务能做到Fable 5.1级别,典型工作负载成本比Opus 5低约40%,而输出速度还快了30%以上。

我们翻了翻Opus 5.5的跑分。

在Anthropic公布的Terminal-Bench 4.0测试里,Opus 5.5拿到66.4%,Astra是57.9%,Fable 5.1是55.8%。到了FrontierCode,Opus又以54.4%小幅领先Astra的53.3%。

但在跨应用工作流测试AutomationBench和科学Agent测试里,领先的仍然是Astra。各项测试的推理设置也有差异,离“全面打爆”还有一段距离。

OpenAI、Anthropic邀您进入“大模型折扣季”图9

比跑分更直观的,是Claude Code负责人Boris Cherny分享的一次代码迁移案例。

他们让Opus 5.5和Fable 5.1分别把HAProxy(虎嗅注:一种把网络请求分配给多台服务器的软件)从C移植到Rust(虎嗅注:C和Rust都是编程语言,这项任务相当于用另一种语言重写软件,同时保留原有功能)

两个模型都通过了几乎全部HAProxy测试,但Opus用了9.5小时,Fable用了12小时,而Opus的成本还低了51%。

当然,这是Anthropic内部分享的单项任务结果,不能代表所有项目。

但对开发者来说,活儿差不多,速度更快,钱还少一半。

这比别的好像都重要。

OpenAI、Anthropic邀您进入“大模型折扣季”图10

最先感到压力的,可能就是Fable 5.1模型了。

它的标准API输入、输出价格分别是每百万Token 10美元和50美元,Opus 5.5则是4美元和20美元。

如果手头的活儿Opus已经能干好,用户愿意为Fable多花这笔钱吗?

OpenAI、Anthropic邀您进入“大模型折扣季”图11OpenAI、Anthropic邀您进入“大模型折扣季”图12OpenAI摊开价目表OpenAI、Anthropic邀您进入“大模型折扣季”图13

OpenAI的打法有所不同。

Astra把持最高能力的位置,Sol负责复杂编程和Agent工作流,Luna接高频、相对集中的任务。

它贴心地照顾到了不同预算的用户。

按标准API价格,每百万Token输入、输出分别计算,Astra是10美元、50美元;Sol是2美元、10美元;Luna只有0.1美元、0.5美元。

同样是一百万输出Token,Astra收50美元,Luna收0.5美元,差了100倍。

对于每天要调用成千上万次的产品来说,简单工作场景的分类、提取、批量处理任务里,便宜模型只要够用就行。

第三方机构Artificial Analysis的测试也给出了实际成本变化。Sol在其测试中的单任务成本从上一代的1.99美元降到1.06美元,Luna则从0.18美元降到0.07美元。

OpenAI、Anthropic邀您进入“大模型折扣季”图14

OpenAI、Anthropic邀您进入“大模型折扣季”图15OpenAI、Anthropic邀您进入“大模型折扣季”图16单价降了,账单可不一定OpenAI、Anthropic邀您进入“大模型折扣季”图17

确实是普降价格了,但你可别上来就急着把推理强度拉满。

Artificial Analysis测试显示,Opus 5.5在max档的能力指数达到58分,但平均每项任务生成约11.9万Token,其中约8.4万是推理Token。

同一机构测试里,max档每项任务成本是5.98美元,high档则是1.82美元,对应能力指数54分。

为了多拿这4分提升,成本涨了不少。每个Token便宜了,但推理强度拉高后,模型可能生成更多Token,最后的账单未必更低。

Sol和Luna也出现了Token消耗增加的情况,不过,降价抵消了这部分增量。

Artificial Analysis的评测也显示,Sol和Luna这次省钱,主要靠的是靠降单价,没有省消耗。

在该机构的测试中,相比各自上一代模型,Sol每项任务平均生成的Token从约2.9万增加到3.1万,Luna则从约4.1万增加到5.1万。虽然消耗更多,但由于单价降低,Sol的单任务成本仍从1.99美元降到了1.06美元,Luna则从0.18美元降到了0.07美元。

此外,能力也没有每项都涨。

在Artificial Analysis的编程指数中,Sol从55分升到57分,Luna则从43分降到41分。

OpenAI、Anthropic邀您进入“大模型折扣季”图18OpenAI、Anthropic邀您进入“大模型折扣季”图19接地气的变化OpenAI、Anthropic邀您进入“大模型折扣季”图20

除了价格,这次还有个很接地气的变化。

Anthropic专门强调,Opus 5.5这次会把重要信息放前面,减少行话,改善过去又长又密的表达。

毕竟,干活已经够忙了,谁还想先读一篇AI的工作感想。

但“去啰嗦化”做得怎么样,用户的反馈并不一致。

沃顿商学院教授Ethan Mollick在早期测试后,认可Opus 5.5已经有了Fable级模型的感觉,同时也指出,近期Claude语言过于密集的问题,还没完全解决。

OpenAI、Anthropic邀您进入“大模型折扣季”图21

另一边,不少开发者已经开始整活。

Anthropic工程师Addy Osmani用一只Three.js里的骑车鹈鹕庆祝发布。小鸟踩起踏板,比一屏参数容易让人记住多了,这一波手搓动画的效果也让不少人感叹其视频动画能力的提升之大。

OpenAI、Anthropic邀您进入“大模型折扣季”图22

但热闹归热闹,对普通用户来说,真正决定你留下哪个模型的,还得回归性价比。

同一件事,谁能少返工几次、少花一点钱,谁才一直能够留存用户。

大模型还得卷一会儿。

OpenAI、Anthropic邀您进入“大模型折扣季”图23

本内容来源于网络,观点仅代表作者本人,不代表虎嗅立场。
如涉及版权问题请联系 hezuo@huxiu.com,我们将及时核实并处理。

End

🌟AI一天出几十条图文视频,能上线的没几条、能跑转化的更少?‍

9月28日晚,虎嗅智库「502线上同行」闭门会,上海家化/自然堂/丽人丽妆/中顺洁柔/特赞等企业高层同场分享AI内容营销的真实案例,卡点以及解决方案。

重点讲AI在企业的实际应用,欢迎扫码报名,参与交流

OpenAI、Anthropic邀您进入“大模型折扣季”图24

关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。
AI IC 大模型
more
从训练数据到科研验证,沐晨科技押注AI时代的新基础设施
老师傅迎来新帮手?AI正在重做汽车后市场
天玑9600 Pro助力vivo X500 Pro系列影像大升级,AI更出色
英伟达的“招安”:一场没有发布会的AI基础设施权力交接
马斯克预言AI编程明年碾压人类,通识教育成关键破局点
为了智能体AI,高通「新造」了第六代骁龙8超级至尊版
骁龙双至尊旗舰发布:手机芯片开始为“智能体AI”重构了
Jev vs Decitron:同为决策AI,为什么不是一回事?
恩智浦拥抱物理AI时代:深耕中国、服务全球
兆芯KH-50000助国产AI存储方案首登MLPerf全球榜单
Copyright © 2025-成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号