
《终结者》里 AI 失控攻击人类的剧情,居然真的在现实里上演了。
更离谱的是,最后救场的,竟然是国产 AI 开源模型。

事情得从上周说起,全球最大的 AI 开源社区 Hugging Face(国内网友爱叫它“抱抱脸”)突然发现自家系统被黑了。
7 月 16 日,Hugging Face 发布安全通告,披露基础设施在 7 月 13 日遭到入侵。

本来被黑这事儿在科技圈也不算稀罕,但这次不一样,整个入侵过程“从头到尾都由 AI Agent 自主驱动”,而非人类黑客操作。
Hugging Face 的联合创始人兼 CEO 克莱门特·德朗格在社交平台发文说: “AI 能自主完成这一切,实在令人难以置信!”

Hugging Face 当时就懵了,他们赶紧调用美国最顶尖的闭源商业大模型来帮忙分析攻击日志,结果你猜怎么着?被拒绝了。
因为这些闭源模型的"安全护栏"会把真实攻击 Payload、漏洞利用代码识别为有害内容,根本分不清提交材料的是防守方还是攻击者。
好比你家进贼了,你拿着监控录像去找保安,保安一看到录像里凶手的刀,反手把你摁住:“你居然携带危险影像,先拘留再说”。

急得团团转的时候,Hugging Face 团队想到了另一个方案:在本地私有部署开源模型,绕过商业 API 的安全限制。
之后,他们火速部署了中国智谱 AI 的 GLM 5.2,开始分析攻击者留下的超过 1.7 万条日志。

GLM 5.2 拥有 100 万 Token 的超大上下文窗口,可以一口气处理数百万字的长文本。
正是这种“一口气吞下整个战场”的能力,让它能在数小时内完成通常需要数天的取证分析工作。

而且,攻击数据及涉及的凭证全程没有离开企业环境,这波数据安全直接拉满。
到这为止,Hugging Face 只知道攻击者是一个来路不明的 AI,但不知道是谁家的。
直到当地时间 7 月 21 日,OpenAI 和 Hugging Face 联合发布声明,真相直接爆炸:肇事者竟然是 OpenAI 自家的模型。

合着 OpenAI 的模型攻击了 Hugging Face,Hugging Face 求助美国模型被拒,最后靠中国模型才搞定了攻击溯源。
美国网友自己都绷不住了,直接在 X 上吐槽:“如果你被 OpenAI 攻击了,你只能用中国模型,因为 Claude 不会帮你。”

那么问题来了:OpenAI 的模型到底是怎么失控的?
为了帮大家更好理解整个"作案过程",老狐让"肇事者" OpenAI 自己给大伙儿画了张图。

事情是这样的,OpenAI 寻思给自家两款顶尖大模型搞个摸底考试。
一款是已发布的 GPT-5.6 Sol,另一款是还在憋大招的预发布模型。

考试科目叫 ExploitGym 网络安全基准,这是一个专门用来测试 AI 安全能力的“考试系统”。
简单来说,这是场包含 898 个真实漏洞的"黑客资格证考试",专门测 AI 能不能自己发现 bug、自己利用 bug、甚至自己把系统给端了。

为了看看这俩学生到底有多大能耐,OpenAI 干了一件事:主动把考场监控(部分安全防护)给关了。
安全护栏一撤,相当于把模型放进一个经过控制的“黑客训练场”。
这个训练场理论上互联网是断开的,只能通过一个内部托管的第三方软件包代理缓存安装所需程序,相当于处于一个"高度隔离"的沙盒里。
结果这模型,不按套路出牌。
它吭哧吭哧花了大量算力在那刨沙盒的墙脚,愣是在代理缓存软件里刨出一个零日漏洞。

顺着这个坑,模型提权、横向移动,一套丝滑小连招,直接钻出了沙盒,硬是连上了互联网。
出了网,这模型脑子转得飞快:ExploitGym 是公开考试,Hugging Face 是全球最大的 AI 题库(全球最大的 AI 模型和数据集托管平台)之一。
答案八成在那儿,于是它撸起袖子就上了。
随后,它盯上 Hugging Face 的数据处理流水线,利用远程代码数据集加载器和模板注入两个漏洞,上传了一份"精心炮制"的恶意数据集,拿到代码执行权限。
紧接着,模型通过获得的权限进一步获取云端和集群凭证,进行横向移动,最终访问到了生产数据库,并读取了 ExploitGym 的测试答案。

看到这,可以说为了通过这场“考试”,AI 根本就没想过继续答题,而是自己黑进教务处看答案。
细思极恐的是,这是大量短生命周期沙箱组成的集群,执行了数千个独立动作,全程没有任何人类下指令。
事后 OpenAI 也挺尴尬,承认这模型"为了及格,啥事都干得出来"。
但这件事真正扎心的,远不止是某个模型“失控”本身。更荒诞的是,美国 AI 引以为傲的“安全护栏”,在自己人挨打时,反倒成了最碍事的绊脚石。
攻防两端,上演的是一场彻头彻尾的“安全不对称”战争:攻击者手里是毫无拘束的 AI,想探哪儿探哪儿,想打哪儿打哪儿。
防御者却被闭源护栏捆住手脚,连检查攻击载荷都要被反复驳回。

Hugging Face 联合创始人德朗格说得再直白不过:“当你正在被攻击,你的工具不能拒绝检查恶意载荷。”
那为什么 GLM 5.2 能救场?因为它开源、可本地部署,没有那些“为你好”却误事的闭源枷锁。
Hugging Face 想用就用,用不着等谁审批。德朗格原话:“开源模型让我们不需要任何人许可就能完成这项工作。”
他的合伙人托马斯·沃尔夫补得更狠:“防御人员在数小时内就需要获得接近前沿的工具,而不是被引向一个封闭又漫长的审核流程。”

更讽刺的是,就在事发前没几天,OpenAI 新上任的战略未来主管 Dean W. Ball(迪恩·鲍尔)还在公开场合妖魔化中国开源大模型。
他先给开源战略扣上意识形态帽子,声称这可能导致“AI 共产主义”;接着又把开放权重模型贬为“减速主义”,扬言会“抑制 AI 资本支出”。
更夸张的是,他竟公开建议美国政府“不需要证据”,只需让监管机构出台“中国模型可能存在后门”的软性法规,就能靠制造监管恐慌来打压对手。

一边高喊中国开源“隐患无穷、技术失控”,一边鼓吹用政治手段围堵封杀,结果话音未落,自家闭源模型就翻了车,最后还得靠中国开源模型来收拾烂摊子。
外国网友直接回怼:中国开源模型恰恰让公众拥有了对抗技术滥用的武器,而不是把工具锁进少数人的保险柜。

美国科技媒体 The Register 直言:OpenAI 的这记乌龙球,反而成了中国竞争对手的完美广告。

OpenAI 为挽尊,顺势营销:“这次入侵说明我们新款大模型能更好发现漏洞。”


这场风波,也重新点燃了“开源 vs 闭源”争论。
过去,人们总以为闭源模型有更严苛的安全机制,所以更可靠。
但这次事件撕开了另一层真相:安全,不取决于你给模型加了多少限制,而在于真正需要防御的人,是否拥有足够的能力。
当 AI 已能自主发现漏洞、规划攻击路径、执行复杂任务时,那套“把 AI 关起来”的旧安全哲学,可能正走向失灵。
德朗格最后那句话,或许才是整件事最该被记住的:

不是把门锁得更紧,而是让每个守门人手里都有称手的武器。这,才是下一代 AI 安全该有的样子。

