Claude Haiku 5.5 杀入低价战场,国产模型性价比还稳吗?

科技狐 2026-10-09 16:07
Claude Haiku 5.5 杀入低价战场,国产模型性价比还稳吗?图1

AI 圈的价格战,现在连小模型都不放过了。

Anthropic 正式发布 Claude Haiku 5.5,输入价格最低到每百万 Token 0.1 美元。

Claude Haiku 5.5 杀入低价战场,国产模型性价比还稳吗?图2

与此同时,它的电脑操作、编程和知识工作能力也迎来大幅升级,部分测试成绩已经能跟一批更高价位的模型掰手腕。

过去聊到小模型,大家的第一反应通常是便宜、快,但能力有限。遇到复杂任务,还是得请旗舰模型出马。

不到三周,Anthropic 连续更新 Opus 5.5、Sonnet 5.5 和 Haiku 5.5,三条产品线全部换代。

Claude Haiku 5.5 杀入低价战场,国产模型性价比还稳吗?图3

按照 Anthropic 的设想,Opus 5.5、Sonnet 5.5 负责规划和拆解任务,Haiku 5.5 进入多 Agent 工作流,接手大量重复、标准明确的执行工作。

Claude Haiku 5.5 杀入低价战场,国产模型性价比还稳吗?图4

能力暴涨,小模型不再打辅助

这次 Haiku 5.5 最明显的变化,不是某一项跑分小幅上涨,而是从过去相对薄弱的执行能力,开始向真正能完成任务的方向迈进。

在电脑操作基准 OSWorld 上,Haiku 5.5 的成绩从上一代 Haiku 4.5 的 15.7% 一路涨到 72.4%。

Claude Haiku 5.5 杀入低价战场,国产模型性价比还稳吗?图5

这项测试考验的是模型能否像人一样操作电脑,完成一系列实际任务。

相比只会回答问题的聊天模型,这类能力更接近 AI Agent 真正需要做的事。

编程方面也有明显进步。在 Terminal-Bench 4.0 上,Haiku 5.5 从上一代的 0 分升至 39.2%,而 GPT-6 Luna 的成绩为 16.4%。

Claude Haiku 5.5 杀入低价战场,国产模型性价比还稳吗?图6

知识工作基准 GDPval-AA v2.1 的成绩,也从 735 升至 1620。

Claude Haiku 5.5 杀入低价战场,国产模型性价比还稳吗?图7

当然,Haiku 5.5 还不能直接替代旗舰模型。

以 Terminal-Bench 4.0 为例,它的成绩仍明显低于 Sonnet 5.5 的 70.6%。面对复杂的多步编码、跨文件重构和长周期自主规划,能力差距依然存在。

Claude Haiku 5.5 杀入低价战场,国产模型性价比还稳吗?图8

开发者 Pawel Huryn 在两个代码库中测试模型寻找遗漏 Bug 的能力,也得到了类似结果:

Claude Haiku 5.5 杀入低价战场,国产模型性价比还稳吗?图9

Haiku 5.5 的成绩距离旗舰模型还有差距,但找到的 Bug 数量已经大幅超过上一代,成本也低了不少。

另一个值得关注的升级,是 Haiku 5.5 首次支持 Low、Medium、High、Xhigh、Max 五档思考程度设置,可以按任务需要调整推理投入。

Claude Haiku 5.5 杀入低价战场,国产模型性价比还稳吗?图10

以 OSWorld 为例,Low 档准确率为 42%,单次成本约 0.07 美元;Max 档准确率达到 72.4%,单次成本约 0.61 美元。

相比之下,上一代 Haiku 4.5 的 Max 档准确率只有 15.7%,成本却达到 1.45 美元。

也就是说,新一代模型在低档位下,已经比上一代的最高档位更能打,而且更省钱。

Claude Haiku 5.5 杀入低价战场,国产模型性价比还稳吗?图11

价格又一次打下来了

能力上来了,Haiku 5.5 的价格也相当激进。

10 万 Token 以内,输入每百万 Token 只要 0.10 美元,输出 0.50 美元。

按照 Anthropic 的估算,综合使用成本相比此前下降约 75%,短请求的标价降幅最高可达 90%,但长请求的降幅会收窄。

Claude Haiku 5.5 杀入低价战场,国产模型性价比还稳吗?图12

这个价格放在过去,确实很难想象。

但现在的问题是,AI 圈早就不缺便宜模型了。

DeepSeek、GLM、Kimi、MiniMax 都在卷性价比,Haiku 5.5 凭什么抢市场?

关键还是能力。

在 Artificial Analysis 的智能指数测试中,Haiku 5.5 得到 43 分,超过 DeepSeek V4.1 Flash 的 39 分和 GLM-5.3 Flash 的 42 分,与 Kimi K3 的 44 分也只差 1 分。

而上一代 Haiku 4.5 的成绩则只有 17 分。

Claude Haiku 5.5 杀入低价战场,国产模型性价比还稳吗?图13

也就是说,它不是单纯把价格压低,而是在低价位上,把模型能力推到了一个更有竞争力的位置。

不过,单价低不等于实际使用成本最低。把 Haiku 5.5 和几款主打性价比的模型放在一起,竞争就更直观了。

Claude Haiku 5.5 杀入低价战场,国产模型性价比还稳吗?图14

而不同模型的 Token 消耗和定价机制不一样,最终账单也会有差异。

尤其 Haiku 5.5 在超过 10 万 Token 后,输入单价会从 0.10 美元涨到 0.50 美元,长任务更需要精打细算。

Claude Haiku 5.5 杀入低价战场,国产模型性价比还稳吗?图15

可以说,Haiku 5.5 在低价位上拿出了更有竞争力的能力,但不是所有场景都变成了最便宜。

对开发者来说,模型选型要算的是完成任务的总账:调用多少次、消耗多少 Token、需要多少轮修正,以及最后能不能把任务做对。

Claude Haiku 5.5 杀入低价战场,国产模型性价比还稳吗?图16

押注多 Agent 协作,更有性价比

Agent 工作流的成本,很大程度上取决于你让什么模型干什么活。
如果每个步骤都调用旗舰模型,成本自然降不下来。
Anthropic 的思路很直接:Opus 5.5、Sonnet 5.5 负责规划,Haiku 5.5 作为 Subagent 批量执行。
Claude Haiku 5.5 杀入低价战场,国产模型性价比还稳吗?图17
大模型拆任务,小模型干活,不必每一步都花旗舰模型的钱。

官方展示过一个实验:让模型设计鸡蛋从 32 米高处安全落地的方案。

Opus 5.5 单独执行,耗时 3 分 37 秒,尝试了 25 个方案,花费 0.47 美元。

换成 Opus 5.5 搭配 10 个 Haiku 5.5 Agent 后,耗时缩短至 58 秒,尝试的方案增加到 86 个,成本降至 0.14 美元。

Claude Haiku 5.5 杀入低价战场,国产模型性价比还稳吗?图18

时间更短、探索的方案更多,成本还下降了约 70%。

这就是多 Agent 协作的价值:把任务拆开并行处理,让贵模型不必包办所有步骤。

开发者的实测,也提供了另一种观察角度。

有开发者分别用 Haiku 5.5 和 GPT-6 Luna 生成“鹈鹕骑自行车”的 SVG 动画,并制作成 H5 页面。

从分享的成品来看,Haiku 5.5 的动画效果更好。

Claude Haiku 5.5 杀入低价战场,国产模型性价比还稳吗?图19

另一组斑马场景对比中,两个模型生成的斑马,重点比较身体条纹、四肢动作、远近景层次和草地融合。

分享者认为,Haiku 5.5 在细节上更好,对照模型在条纹、四肢和地面融合上问题比较明显。

Claude Haiku 5.5 杀入低价战场,国产模型性价比还稳吗?图20

另一位开发者岚叔则用 Haiku 5.5 做了一支宣传片。

他表示,最终效果丝毫不输 Opus 5.5,模型吞吐速度达到每秒 200 Token,累计消耗 1.6 亿 Token,花费却只有 3 美元。

Claude Haiku 5.5 杀入低价战场,国产模型性价比还稳吗?图21

而工作流的总成本,恰好是中国模型厂商过去几年重点建立的优势。

DeepSeek、GLM、Kimi、MiniMax 等国产模型,靠低价和开放权重吸引了大量开发者。

如今,Anthropic 不仅把 Haiku 5.5 的短请求输入价格压到每百万 Token 0.1 美元,还通过 Subagent 和多 Agent 协作,试图把低价模型放进更大规模的任务执行流程。

这意味着,中国模型厂商面临的压力,不再只是 API 价格被追平。模型能否以更低成本完成真实任务,正在成为新的竞争焦点。

Claude Haiku 5.5 杀入低价战场,国产模型性价比还稳吗?图22

毕竟,开发者真正要算的,不只是每百万 Token 花多少钱,还包括完成一项任务需要消耗多少 Token、调用多少轮、花多长时间,以及最后要不要人工返工。

标价再低,如果任务跑不通,成本优势也无从谈起。

参考资料:claund 官网及公众号、X 等网络平台

编辑:不吃麦芽糖

Claude Haiku 5.5 杀入低价战场,国产模型性价比还稳吗?图23
Claude Haiku 5.5 杀入低价战场,国产模型性价比还稳吗?图24

关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。
AI
more
陶哲轩转发抵制声明,数学界和OpenAI彻底撕破脸
微星尊爵N16 Flip AI+ 2026开启预售,RTX Spark芯片赋能二合一形态
OpenAI带头“扫货”:195起AI并购,最大一笔110亿
高交会亚洲AI算力产业与数据中心展11月深圳举行,“算力出海”掀起全球万亿级数字贸易革命
豆包上线“生活缴费”功能,AI对话重构服务入口逻辑
豆包工作上线无限画布与Seedream 5.0 Flash,重构AI协作交互范式
苹果新品全家桶大剧透,最大的个人 AI 终端是你家
AI“伪纪录片”席卷短视频平台,低成本拟真叙事重构真实边界
《怪物史莱克》编剧、《冰雪奇缘》选角都来了:全球最大AI影视公司Utopai Studios是什么来头?
AI原生座舱加速落地,行业迈入端云协同量产新阶段
Copyright © 2025-成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号