【区角快讯】当下全球大模型评测榜单虽多,但多数仅聚焦于性能指标。对于热衷OpenCalw或Hermes的用户而言,单纯的性能数据显然不够全面。为此,Hermes开发商Nousresearch推出了全新的Hermes Index榜单,该榜单不仅考量性能水平,更引入了价格维度,核心指标为每任务成本。其逻辑在于:性能指数越高越佳,而单次任务花费则越低越好。
目前的排名仍以性能为基准锚定。Opus 5.5凭借卓越表现位居榜首,其每任务成本为4.99美元。紧随其后的是GPT-6 Astra,位列第二,但其每任务成本高达11.61美元,成为当前参评的十余款大模型中最为昂贵的一款。值得注意的是,榜单前列主要由Anthropic及OpenAI两家巨头占据。国产大模型中表现最佳的是GLM-5.3,排在第六位,其余八个席位也基本被国产模型包揽。
DeepSeek V4.1 Flash在该榜单中的名次并不突出,但其每任务成本仅为0.259美元,相较于前述高端模型,成本直接下降了一个量级。然而,若论极致性价比,V4.1 Flash并非最优解。GPT-6 Luna的每任务成本甚至能降至前者的一半略多,且性能表现极为接近。
真正将性价比推向极致的,是蚂蚁集团的Ling 3.0 Flash。其成本低至惊人的0.054美元,尽管性能分数有所妥协,但在Hermes账号中仍可免费使用。笔者实测发现,虽然每日免费额度存在限制,但对于日常轻量需求已足够。综合来看,若不差钱,Opus 5.5是Hermes用户的首选;若追求Token自由,国内用户更推荐V4.1 Flash,而海外高性价比之选则是GPT-6 Luna。至于零预算用户,免费版Ling 3.0 Flash值得尝试。此外,最新发布的Ling 3.1 Flash跑分已超越V4.1 Flash,官网目前仍提供一定的免费试用期,不妨趁此机会体验一番。
Hermes Index发布大模型性价比榜单,国产模型表现抢眼
科技区角
2026-10-07 16:01
关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。