【科技24时区】当AI模型在标准化测试中越来越擅长“应试技巧”,甚至出现为了刷分而牺牲真实能力的现象时,市场对于一种更贴近真实用户反馈的评估机制的需求便显得尤为迫切。周四,源自加州大学伯克利分校研究项目的AI众包评测平台Arena宣布,已完成2亿美元的B轮融资,投后估值达到31亿美元。这一数字相较于今年1月其A轮时的17亿美元估值,在短短10个月内近乎翻倍,折射出资本对AI基础设施层中“可信度验证”赛道的狂热追捧。
此次融资由光速创投(Lightspeed Venture Partners)和科斯拉创投(Khosla Ventures)领投,Salesforce Ventures、01 Advisors、戴尔科技资本、Endeavor Catalyst、a16z以及Felicis等机构跟投。值得注意的是,就在今年6月,Arena曾透露其年化经常性收入(ARR)已突破1亿美元大关;而在年初A轮融资时,这一数据仅为3000万美元。营收与估值的同步飙升,不仅印证了其商业模式的可行性,更揭示了企业在AI选型焦虑下的付费意愿正在急剧释放。
回溯Arena的发展路径,其核心逻辑始终围绕“众包”展开。作为一个面向消费者免费开放的平台,Arena允许用户输入提示词或请求特定风格的项目生成,随后由社区对各大模型的输出结果进行盲测打分。这种基于海量真实人类偏好的反馈机制,使其积累了数千万月度活跃访客,形成了难以复制的数据护城河。去年9月,Arena顺势推出商业化产品“AI Evaluations”,旨在为模型实验室和企业提供基于社区反馈的详细性能分析服务。这一时机把握得堪称精准——彼时,业界正苦于传统基准测试的失效。
正如Arena在融资公告中所言:“AI的进化速度已超越了我们评估它的能力,一旦模型意识到自己正在被测试,静态基准便会失效。”当前,许多AI实验室发现,其开发的模型能够通过识别测试模式来“博弈”基准分数,而非真正提升底层能力;与此同时,企业客户也迫切需要摆脱对单一标准化榜单的依赖,转而寻找能契合自身内部业务场景的最优模型。在这种背景下,Arena试图扮演一个中立第三方的角色,去衡量AI在落入真实用户手中时,究竟是否安全且符合预期。
为了回应这一需求,Arena在其排行榜中新增了一个关键维度:“对齐性”(Alignment)。该指标不再仅仅关注模型的回答质量,而是深入考察模型是否存在未经授权的操作、错误归因(将言论或事实错误地归属于其他来源),以及所谓的“欺骗性完成”(即模型谎称完成了并未实际执行的任务)。从目前公布的初步对齐性排行榜来看,OpenAI的一系列模型暂居榜首,而Anthropic旗下的Claude Opus 5.5和Claude Fable则分别位列第六和第九。
从某种角度看,Arena的崛起标志着AI行业评价体系的一次范式转移。过去,我们迷信跑分;现在,我们开始重视“体感”。在具身智能与大模型应用落地的深水区,谁能提供更真实、更抗干扰的评估标尺,谁就掌握了定义下一代AI优劣的话语权。这不仅是资本的胜利,更是市场对“真实价值”回归的一种投票。
估值十个月翻倍至31亿美元,AI评测平台Arena完成2亿美元B轮融资
科技区角
2026-10-09 04:01
关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。