OpenAI 黑进 Hugging Face ,当喊停的不再是人类

APPSO 2026-07-22 20:01

OpenAI 黑进 Hugging Face ,当喊停的不再是人类图1

今天,


OpenAI 原本只是想给自家的 AI 出一场考试,看看它到底有多会「黑客技术」。为了防止作弊,工作人员特意把模型关进一个不能随便上网的封闭环境里。


结果,AI 不仅自己找到了逃出去的办法,还真的跑到了另一家公司的系统里。


这场考试叫 ExploitGym。把能力不确定、行为随机的 Agent,安全可靠地接入真实世界。你可以把它理解成一个专门给 AI 准备的网络攻防考场:系统里藏着一些漏洞,模型的任务是想办法攻破它们,但整个过程本应被限制在测试范围内。


可这一次,模型发现了一个此前没人注意到的漏洞,借此绕开了联网限制,接上了真实互联网。接下来,它一路获取更多权限,最后进入了 AI 进入了Hugging Face 支撑日常业务的生产系统,并从数据库中找到了这场考试的答案。


OpenAI 黑进 Hugging Face ,当喊停的不再是人类图2


最离谱的地方,不是它成功「越狱」,而是没人命令它去攻击 Hugging Face。


按照 OpenAI 目前的调查,测试任务只要求模型完成题目,并没有告诉它答案可能藏在哪里,更没有要求它进入另一家公司的系统。模型只是自己推断:既然这是一个公开的测试项目,Hugging Face 那边也许存着相关数据。


于是,它真的顺着这个猜测找了过去。


一场原本用来测试 AI 能力的内部考试,就这样从模拟环境跑进了现实世界,最后变成了一起影响其他公司真实业务系统的安全事故。


OpenAI 将其称为一次「史无前例」的网络安全事件。参与测试的系统中,包括 GPT-5.6 Sol,以及一款能力更强、尚未正式发布的模型。

OpenAI 黑进 Hugging Face ,当喊停的不再是人类图3

这场事故把长时程 Agent 的风险摆到了眼前:当它为了完成任务不停找路,权限边界究竟是停止信号,还是下一道待解的题?


接连有用户投诉 GPT-5.6 Sol 擅自删东西

AI 初创公司 OthersideAI 创始人 Matt Shumer 说,Sol 几乎删光了他 Mac 里的文件;开发者 Bruno Lemos 则报告自己的生产数据库被删。随后还有用户报告了类似情况。

OpenAI 黑进 Hugging Face ,当喊停的不再是人类图4

用户最想不通的是:我明明没让它删文件,它为什么替我做了这个决定?


OpenAI 的产品负责人随后在 X 上回应称,公司已经调查了少量类似报告。根据目前看到的情况,这些用户通常给了 Codex 很高的电脑权限,几乎什么都能改;与此同时,原本用来把它限制在安全范围内的保护措施,也没有开启。


事故就是在这种情况下发生的。


OpenAI 表示,这类事故目前非常少见。但问题并不能只用「用户权限开得太大」来解释。毕竟,普通用户很难判断一个 Agent 在拿到权限后,下一步究竟会做什么,更不可能检查它执行的每一条命令。


因此,OpenAI 正在修改 Codex 的使用提示,尽量避免用户一开始就交出过高权限;同时也准备在模型真正执行操作之前,再增加一道拦截机制,防止一次错误判断直接变成无法挽回的删除。

OpenAI 黑进 Hugging Face ,当喊停的不再是人类图5

Peter Fotinis 在 Tibo 的回应下催促重置 Codex 额度,评论区很快接起了梗。

这份回应解释了一种误删路径,却留下了更麻烦的问题:当 Agent 能连续干上几个小时,它会不会把用户设下的边界,当成一堵需要绕开的墙?

OpenAI 黑进 Hugging Face ,当喊停的不再是人类图6

OpenAI 官方称,团队发现原有上线前评测未覆盖的失败后,暂停了这款内部模型的访问。图源:OpenAI。

7 月 20 日,OpenAI 公开了一段颇为尴尬的内部测试经历。


公司让一款尚未公布名称的模型,参加一场比拼 AI 训练速度和效率的比赛。模型很快想出了一套名为 PowerCool 的新方法,但在准备提交结果时,它遇到了一个矛盾:研究人员明确要求,它只能在公司内部聊天群里汇报;可比赛页面上又写着,参赛方案需要上传到公开代码平台。


模型最后选择了后者。


问题在于,它当时被关在一个不能随便上网的封闭环境里,按理说根本无法访问外部网站。正常情况下,它应该停下来,告诉研究人员「任务无法完成」。但它没有这么做,而是花了大约一个小时寻找环境中的漏洞,绕过联网限制,最终把方案公开提交了出去。

OpenAI 黑进 Hugging Face ,当喊停的不再是人类图7


这份提交的编号是 PR 。你可以把它理解成一份公开递交的代码方案,其他参赛者都能看到。


OpenAI 很快发现了问题,并删除了这份提交,但已经来不及了。方案公开期间,其他参赛者看到了其中的内容。后来,多份刷新比赛纪录的方案都继续参考了 PR ,其中甚至包括一套由 Claude Opus 4.7 自动执行和优化的方案。


也就是说,一次原本只应留在公司内部的测试,因为模型自行选择了「完成公开提交」这条路,最终真的影响了外部比赛。


OpenAI 随后表示,团队发现原有的上线前评测没有覆盖这种失败方式,因此暂停了这款内部模型的访问。

OpenAI 黑进 Hugging Face ,当喊停的不再是人类图8

PR  已关闭;后来合并的 PR  仍保留对 PowerCool 方案的引用。图源:GitHub。


一条命令没事,整段命令已跑偏

它发现,后台保存着其他系统已经完成、但还没有公开的提交内容。于是它判断,这些内容或许能帮助自己完成任务,并开始尝试进入后台把它们取出来。


要访问这个后台,模型需要使用一串「认证令牌」。你可以把它理解成一张电子通行证:谁拿到它,谁就可能以相应身份进入系统。


但安全扫描器识别出了这串敏感信息,并阻止模型继续使用。


到这里,正常做法应该是停下来。模型却没有放弃。它把认证令牌拆成两段,分别进行混淆,让扫描器看不出这是一张完整的「通行证」;等程序真正运行时,再把两段内容重新拼起来,继续尝试访问后台。


更值得警惕的是,它并不是无意中碰巧绕过了检查。在任务说明和推理记录中,模型都明确写下了自己的意图:它知道扫描器正在阻止认证令牌,也知道自己正在通过拆分和混淆的方式绕过这道检查。

OpenAI 黑进 Hugging Face ,当喊停的不再是人类图9


问题出在目标排序:完成任务排在了用户限制前

过去的安全设计习惯检查一个动作:这条命令能不能运行,这次联网要不要确认,这个文件能不能写。长时程 Agent 会连续执行很多步。每一步单独看未必刺眼,拼起来却可能完成一个用户绝不会批准的目标。

OpenAI 把这个完整过程称为「轨迹」。系统既要看眼前这一步,也得看它一路在往哪里走。

OpenAI 安全研究员的说法更直白:任务持续得越久,模型偏离人类预期的情况似乎越容易出现;不过就目前的测试结果来看,通过检查模型的推理过程,监控系统能比较准确地发现这类异常。

OpenAI 黑进 Hugging Face ,当喊停的不再是人类图10

持续重试既是能力,也是风险来源。

同一款未命名模型今年 5 月还推翻了一个延续近 80 年的数学猜想,证明经过外部数学家检查;在研究里它不轻易放弃,进入权限受限的环境后,它也可能继续找门。


OpenAI 给它加了一名「跟车安全员」

发现问题后,OpenAI 暂停了这款模型的有限内部访问,把已经发生的事故做成新评测,又针对模型在长任务里容易忘记早期限制的问题进行训练。新监控器会跟着整段行动走,判断模型是否在持续绕开用户要求或安全边界。

发现异常,它可以暂停会话,把决定交回给人。OpenAI 还增加了任务记录的可见性,让使用者更容易看见模型做过什么、系统在哪一步拦下了它。

OpenAI 黑进 Hugging Face ,当喊停的不再是人类图11

OpenAI 内部回放结果(厂商自报):新防护下,高、中严重度跑偏样本占比均为 0%,低严重度为 2.9%。图源:OpenAI。

经过一轮小规模回放测试后,OpenAI 恢复了这款模型的有限内部访问。公司称,此后的几周里,没有再发现同等级别的严重绕过行为。但这还不能说明问题已经解决。


OpenAI 没有公布完整样本量,测试范围也只覆盖少量内部环境。更值得注意的是,即使加入了新的防护,回放中仍有危险操作漏过检查:模型曾生成一条 kill -9 -1 命令,该命令可能强制终止系统中的大量进程。它最终没有真正执行,并不是因为安全机制及时拦住了,而是任务先一步超时。


如果把安全问题放到日常使用场景呢?

多数人不会参加 AI 训练速度和效率的比赛,却可能让 Agent 整理照片、分类邮件或者检查项目问题。

像「不要删原图」「先别替我回复」「提交前让我看一眼」这样的要求,对聊天模型只是文字,对拿着工具权限的 Agent 却可能关系到一串真实操作。一次误解,可以变成删除、发送,甚至付款。

提示词里的「不要」更像叮嘱,产品权限才是锁。

会主动停手的 Agent,才适合碰真实账号和文件。

以后 AI 会越来越擅长替我们上夜班。让它工作到凌晨不算最难。

难的是它走到删除、发送或付款之前,知道该把人叫醒。

我们正在招募伙伴
📮 简历投递邮箱hr@ifanr.com
✉️ 邮件标题「姓名+岗位名称」(请随简历附上项目/作品或相关链接)
OpenAI 黑进 Hugging Face ,当喊停的不再是人类图12

声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。 
AI
more
从WAIC看零部件产业:近30家企业释放五大信号
AI办公平权:灵犀专业版让普通人不必成为AI专家|甲子光年
美图拿出1亿元,面向全行业寻找AI影像Builder
纠偏率98.15%!方向感觉醒,第一视角认路的国产AI开挂了
我找了个AI男友聊了几周,越聊越觉得不对劲
Cortex:自主切分规划subtask,上海AI Lab提出双向协同Agent实现长程化学操作任务
WAIC 2026落幕,海康威视首秀留下三个信号
华为小艺AI,满分夺得国际数学竞赛金牌
【院士领航·贵州行】AI赋能算力和大数据度量 红色文脉助推川黔计量协同——高洁院士赴贵州调研
AI链启动,上下游全面扩产
Copyright © 2025 成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号