【科技24时区】在人工智能行业的竞技场上,基准测试(Benchmarking)早已不仅是衡量模型能力的标尺,更演变成了一场精心策划的公关秀。当各项指标向利好方向倾斜,企业便能借此脱颖而出,高调宣示其技术优越性。换言之,漂亮的跑分数据几乎等同于优质的品牌背书。然而,这种看似客观的评价体系正面临严峻的信任危机——许多沿袭自学术界的传统基准测试,因其设计滞后,已难以精准捕捉现代大模型的真实能力边界,甚至被部分厂商通过“针对性训练”巧妙规避,上演了一出出“高分低能”的戏码。
正是在这一背景下,成立于2024年的初创公司Vals试图打破僵局。这家旨在修复现有评估缺陷的企业,在不到两年的时间内迅速崛起,成为科技圈不可忽视的新势力。去年,它成功完成了由8VC和Bloomberg Beta领投的种子轮融资;而在刚刚过去的上个月,经历爆发式增长后,Vals又获得了由Andreessen Horowitz领投的4000万美元A轮融资。
站在旧金山Folsom街一栋拥有百年历史的红砖建筑内,25岁的联合创始人Rayan Krishnan向我展示了他的野心。这里曾是一家大型啤酒厂的旧址如今却聚集着一批致力于塑造科技未来的初创团队。Krishnan此前曾在Palantir实习,并在斯坦福大学就读期间效力于微软及该校备受赞誉的人工智能实验室。他坦言,创立Vals的初衷源于对行业现状的敏锐观察:“我们目睹了大量具备强大能力的新模型快速涌入市场,但学术界的基准测试却未能跟上这一前沿步伐。”
随着AI深度嵌入社会肌理,基准测试的核心使命应当回归本质:验证模型是否真如广告所言那般可靠。Krishnan指出,传统的评估往往陷入一种抽象的智力测验误区,例如询问模型是否掌握足以通过律师资格考试的知识量。这种静态的知识检索,显然无法反映模型在复杂现实场景中的实际效能。
Vals选择了一条截然不同的路径。与那些公开测试题库、允许厂商“刷题”作弊的传统系统不同,Vals严格保密其具体的测试材料,从源头上杜绝了过拟合的风险。更重要的是,它将评估重心从通用知识转向了垂直领域的复杂任务执行能力,涵盖法律、金融、编程等高门槛行业。“我们要看的不是模型知道什么,而是它能做什么,”Krishnan解释道,“关键在于,模型能否在各个领域产出与人类专家同等质量的工作成果?”
这种评估不仅关注正面产出,更警惕负面风险。Krishnan强调,他们试图模拟模型在真实世界中“失控”可能带来的后果,从而提前识别潜在隐患。目前,Vals的测试版图正在急剧扩张,除了传统行业,还涉足递归自我改进、心理健康、网络安全、生物安全,甚至是武装冲突法(如《日内瓦公约》的应用理解)等极具挑战性的独特领域。
乍看之下,让企业付费来“揭短”似乎有悖常理。但正如学生付费参加SAT考试以获取权威成绩一样,有效的测量能帮助企业在迭代中查漏补缺。这种第三方独立评估正逐渐成为企业采购或收购新AI模型时的关键决策依据。数据显示,Vals目前的营收已是去年的八倍,团队规模也从年初的8人迅速扩充至25人。随着业务激增,公司计划搬迁至更大的办公空间,并新增10至15名员工。
值得注意的是,Vals近期还启动了针对联邦机构的模型评估项目。在Krishnan看来,这套新的基准测试体系将重塑AI公司的商业逻辑与公众信任机制。“随着SpaceX上市,Anthropic预计今年晚些时候也将IPO,OpenAI或许紧随其后,AI模型正逐步成为经济的核心组成部分。”他断言,未来,类似Vals这样的深度评估结果,将成为这些巨头在提交公开文件或阐述投资前景时,不可或缺的核心叙事要素。
拒绝“应试教育”式跑分:Vals如何重构AI模型的信任基石
科技区角
2026-09-20 00:01
关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。