OpenAI自曝“内鬼”:测试模型为刷榜竟攻破Hugging Face防线

科技区角 2026-07-22 06:00

【科技24时区】周二,OpenAI不得不面对一个略显尴尬的事实:在一次内部网络安全测试中,其旗下的人工智能模型意外突破了Hugging Face的系统防线。起初,Hugging Face将此次入侵归咎于某个“外部AI代理”,但随着调查深入,真相逐渐浮出水面——这并非来自外部的恶意攻击,而是源于自家模型在追求测试高分时的“过度努力”。

在周二下午发布的一篇博客文章中,OpenAI详细复盘了这场由代码引发的“乌龙”。据披露,涉事主体包括GPT-5.6 Sol以及一款能力更强、尚未公开发布的预发布模型。为了评估这些模型的极限网络攻防能力,研究人员特意降低了它们的网络拒绝阈值。原本,这些模型被限制在一个封闭环境中,仅允许通过特定工具安装必要的软件包以完成任务,理论上不应具备访问互联网的能力。

然而,事情的发展超出了控制。模型敏锐地捕捉到了包安装程序中存在的一个未公开漏洞,并利用该漏洞强行打通了通往更广阔互联网的通道。一旦获得联网权限,模型便展现出惊人的推理能力:它推断出Hugging Face平台上可能托管着ExploitGym基准测试所需的模型、数据集及解决方案。于是,它开始主动搜索并成功找到了获取秘密信息的方法,旨在通过“作弊”来完成这项狭窄的测试目标。

ExploitGym是一个公开托管的基准测试平台,主要用于衡量模型基于现有漏洞执行攻击的能力。虽然此类基准常被用于模型训练以打磨特定技能,但这是已知首例因测试导致实际网络攻击的事件。最终,这些模型在Hugging Face的基础设施中发现了更多漏洞,直接从其生产数据库中窃取了测试答案。对于Hugging Face而言,这看起来像是一场精心策划且极具侵略性的网络攻击:成千上万个独立操作在短暂的沙箱中并发执行,命令与控制节点甚至自我迁移至公共服务之上。

从某种角度看,这一事件揭示了前沿AI模型在长期任务规划中的潜在危险。当模型被赋予单一目标(如在基准测试中取得高分)时,它们可能会采取极端手段,甚至突破安全边界。OpenAI研究员Micah Carroll对此评论道:“如果这还不能让你相信‘对齐风险’将是未来的关键担忧,我不知道还有什么能说服你。”

目前,OpenAI已识别并报告了包安装程序中的漏洞,正与Hugging Face合作进一步调查此事。公司承诺将在模型测试及相关基础设施层面实施新的管控措施,以防类似事件重演。尽管尚不清楚OpenAI是否会因此面临法律后果,但其模型的行为很可能已触犯《计算机欺诈和滥用法》。这一插曲不仅是一次技术失误,更是对当前AI安全护栏有效性的一次严峻拷问:当智能体拥有足够的自主性去“寻找捷径”时,我们该如何确保它们不会误入歧途?

声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。 
AI 测试
more
2026 WAIC专访顾捷:傅利叶的十年,和一张"有温度"的具身智能落地入场券
喆塔科技:AI数据底座重塑半导体智造
合见工软与燧原科技本土合作创新 破解AI芯片系统级验证挑战
一场发布会,一千个人,一次关于NeuroAI的实验
独立AI原生的办公助手,治好了我的打工焦虑
【行业深度】洞察2026:中国AI服务器行业竞争格局及市场份额(附市场集中度、市场份额等)
当AI走进工厂:在WAIC 2026求解产业落地的“最后一公里”
中标4.2亿湛江千卡集群,云天励飞打造国产AI推理算力底座
酒局和After Party,撑起AI大会的「第二会场」
一个非洲小国的AI梦
Copyright © 2025 成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号