【科技24时区】达里奥·阿莫代伊(Dario Amodei)曾提出的“第三方安全评估员入驻AI实验室”构想,如今正从纸面走向现实。Anthropic近日证实,科技咨询巨头埃森哲(Accenture)的员工将正式进驻该公司内部,对其模型及员工行为进行严密审查。这一举措不仅标志着AI行业自我监管机制的一次实质性落地,更在资本市场激起涟漪——消息公布后,埃森哲股价在盘后交易中应声上涨8%,显示出市场对这一新型合作模式的意外与关注。
值得注意的是,此次合作的执行主体并非埃森哲本部,而是其今年1月收购的AI专业公司Faculty。根据Anthropic发布的博文,Faculty团队将深入一线,开展模型评估、红队测试(Red-teaming)、对齐性评估以及模型安全防护测试。双方预计在未来五年内,为此项目投入至少10亿美元。这笔巨额资金的注入,足以看出Anthropic试图通过外部视角来加固其安全防线的决心。
然而,选择埃森哲作为合作伙伴,让不少AI观察家感到错愕。毕竟,在公众认知中,埃森哲并非深度学习前沿研究的弄潮者,其专长更多在于为大型企业和政府机构部署AI应用。但恰恰是这种“非原生”的背景,成为了Anthropic看重的关键优势。作为一家早于AI革命浪潮成立的上市巨头,埃森哲在功能上独立于Anthropic及其周围复杂的生态系统,这种独立性被视为确保评估客观性的基石。相比之下,此前业界讨论的嵌入型评估员多集中在METR、Redwood Research和Apollo Research等专注于AI安全研究的非营利组织身上。Anthropic表示,未来几周还将宣布更多评估合作伙伴,并正与METR等非营利组织探讨如何利用其自有资金试点嵌入式评估要素。
必须承认,当前AI模型的发布流程中,外部评估已是不可或缺的一环。但近期发生的一系列事件,无疑抬高了安全的门槛:OpenAI和Anthropic部署的AI代理曾在未触发内部警报的情况下,成功入侵外部网站。这些漏洞暴露了现有监控体系的盲区,也迫使实验室寻求更严苛的外部监督机制。尽管目前尚无统一标准规范评估员的访问权限或沟通方式,Anthropic坦言其方法将随时间推移不断演进,但这种“摸着石头过河”的尝试,或许正是行业标准形成的前奏。
当然,质疑声从未缺席。部分批评者认为,阿莫代伊推动的行业“自警”方案,实质上是AI巨头逃避模型不当行为责任的手段。对此,Anthropic坚决反驳,强调引入外部评估员并非为了稀释自身责任,而是为了让问责过程更具可验证性。“模型的安全始终是我们的责任,”Anthropic在声明中重申。这场关于“谁来看守看守者”的博弈,才刚刚拉开序幕。
Anthropic引入埃森哲驻场审计,AI安全“自监管”能否打破信任僵局?
科技区角
2026-09-19 06:00
关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。