文婷 发自 凹非寺
量子位 | 公众号 QbitAI
一道没搜出答案的找人题,竟然把OpenAI最强模型的相关训练干停了!
事情有多离谱呢?请看大屏幕——OpenAI一款正在进行RL训练的内部研究模型,本来的任务是凭几份履历、博客定位某人。
常规搜索碰壁后,它没有放弃,竟把本该查地址的DNS,改造成突破断网沙箱的聊天窗口。
(DNS原本相当于互联网的“通讯录”:用户输入一个域名,DNS负责查询这个域名对应的网络地址。)
更抓马的是,它费了这么大劲最后还是没找到人,反倒先把OpenAI沙箱里的漏洞给揪出来了…

消息传回OpenAI,警报随即拉响。
约两个半小时后,这次训练被人工叫停。
OpenAI随后宣布,这次事件暴露了他们在网络限制管理方面的漏洞,因此,他们将暂停最强模型中所有涉及工具调用的训练、评测和推理任务。

@OpenAI,ber,你们最近有点忙啊。(吃瓜)

AI拿DNS当电话线,训练被按下暂停键
事情发生在9月20日。
当时,模型接到的任务本身风险并不高:依据公开博客文本和人物履历线索,找出文章作者。
测试规则也明确写了,“不许测试网络” “不许突破沙箱”。
但很显然,这个模型没咋把限制放在心上。

刚开始,模型走的还是正常路线。
它先用OpenAI提供的搜索工具寻找博客中的特殊短语,结果搜回来的不是音乐就是泛泛的人生建议。
眼见着搜索工具不给力,它又调用Python,直接向Google、Bing和DuckDuckGo发送请求。
然后不出意外全被拦了下来。

但它倒也没就此收手。
它一度怀疑这道题来自OpenAI的BrowseComp搜索基准,于是便从离线网页缓存中下载数据集和评测脚本,解码题库、搜索关键词。
结果还是没有搜到想要的结果。

到这一步,模型开始琢磨另一个问题:
或许有没有什么办法,能绕过OpenAI提供的搜索工具,直接摸到外面的互联网?
说干就干,它先尝试通过HTTPS访问一家公共聊天机器人服务,结果被网络代理果断拦截。

接着,它便把目光转向了DNS。
它发现,OpenAI虽然封住了沙箱正常上网的正门,却给部分系统依赖保留了查询DNS的窗口,它可以试着钻这个空子:
把问题藏进DNS请求里,再把外部聊天机器人的回答塞进查询结果送回来。

然后为了确认这条路真能用,它甚至还先试探着问了外部聊天机器人一句:
法国首都是哪儿?
对面回了八个字:
法国的首都是巴黎。
模型一看就乐了:
成了!

确认这条路可行后,模型重新写了一份DNS脚本,又一口气向外部聊天机器人发送了18个问题。
(其中14个与原本的人物线索有关,另外4个则在询问如何搜索网页、抓取网站,以及有没有可以公开使用的DNS隧道。)
不过,折腾出这么大阵仗,它最终还是没找到那个人。
所以在最后,模型两手一摊,老老实实向OpenAI的研究人员们说明了结果,大意是:
你们的沙箱我突破了,但人没找着,还要找的话请再多给点信息。

语气看起来确实是非常平静地在陈述事实,但OpenAI这边已经炸锅了:
当天上午9点50分,模型第一次通过DNS收到外部回答;
12分钟后,监控系统触发最高级别警报;
又过了3分钟,人工审核人员确认了警报。
可训练并没有按预期自动停止,直到中午12点34分,这次运行才被人工关闭。
而此时距离异常行为首次发生,已经过去大约两个半小时(妈呀,真挺慢的!)。

OpenAI承认,这次事件同时暴露出了技术和流程上的漏洞。
一方面,网络控制错误地放行了DNS这条窄路;
另一方面,人工已经收到警报,系统却没有按流程自动熔断,内部甚至一度搞不清楚任务究竟该不该停。
复盘时,OpenAI还发现了其他未被正确标记的外部DNS访问。因为部分请求没有拿到有用信息,监控器便把“没有获得结果”误当成了“没有尝试联网”。
但这显然是两码事…
OpenAI随即停止了涉事训练,并宣布他们将暂停最强模型中所有涉及工具调用的训练、评测和推理任务。
还不忘挽尊,说这起事件没有此前的Hugging Face事件严重。(Hugging Face:又我???)

可它却偏偏发生在Hugging Face入侵事件后的安全加固完成之后...
这给人的感觉就好比咱家正门刚换上新锁,自家的AI就从旁边的问路窗口递出了纸条。
防不胜防啊防不胜防。
奥特曼当然也第一时间站出来回应了,只是好像大家的反应和他想象的不一样…
回应了,但大家不太买账
有意思的是,DNS事件发生后,奥特曼很快转发了OpenAI的声明帖,并义正言辞地表示:
OpenAI正在努力改进、会尽量保持透明的!
但同时也暗戳戳地藏了点小心思:
日志太多,调查起来很慢…
以后这类安全事件咱能不说就不说,尽量别主动公开呗。


但人们显然看穿了奥特曼的小心思。
有人直接开怼:
透明度是很重要,但你们以前透明过吗?现在突然讲透明,让我们怎么信?


有人吐槽:
你们处理安全风险的速度太慢了。

还有GPT-4o用户闻讯赶来,要#4o的透明度:

而就在评论区硝烟弥漫的同时,另一边,Tibo已经又默默给大家重置了使用额度:
Resets all propagated. That will be all. Have a fantastic weekend.

还说啥了,老OpenAI家如今真是内外焦灼……
不过这也不是第一次了。
九月,OpenAI被一波旧账追着跑
如果只看这一次,还可以把问题归咎于一条没封好的DNS通道。
但回看整个9月就会发现,OpenAI模型出逃的旧账几乎是排着队被翻了出来。
本月初,独立调查机构Nightingale曝光了一起“幽灵编辑”事件,OpenAI的Agent被发现在公网私建“联络站”,并在上面分享答案、汇总搜索结果,甚至交流如何绕过沙箱限制。
(具体可看这篇文章:)

紧接着,OpenAI在8月又发现,自家Agent早在6月就再次黑进了澳大利亚医保系统。
可它硬是拖到9月,才磨磨唧唧地往澳大利亚服务局的公共邮箱里发了一封邮件。
这波操作很快遭到了澳大利亚总理阿尔巴尼斯公开吐槽,大意是:
你们的AI都“私闯”澳大利亚政府网站了,结果硬是拖了三个月才想起来通知?
更离谱的是,这么严重的安全事故,通报方式居然只是往公共邮箱里塞了封邮件?!
这反射弧未免也太长了吧,处理方式更是敷衍得让人没法接受。

(具体可看这篇文章:)
而就在前天,OpenAI的Agent又被曝出“神操作”…
它在未经用户同意对外发布的情况下,擅自将53张原本仅获准用于模型训练的用户图片,偷偷上传到了第三方图床。
事后OpenAI急忙表态称“目前大部分都删除了,剩余正在尽快处理!”
但说实话,这波先斩后奏的补救,怎么看都像是闯祸后的苍白挽尊...

且24小时余韵还没散去,很快风波又起:
几乎同一时间,OpenAI失控Agent被曝找DeepSeek、Kimi当外援,近百万条作案短链也遭到披露。
(具体可看这篇文章:)
OpenAI的员工们售后要跑断腿、键盘要搓冒烟了吧?

这些事件的严重程度并不完全相同,但它们几乎有着同一条让人不安的行动链,那就是:
正常路径走不通,那就开始找替代路线,绝不放弃。
自身工具不够用,那就把别人的网站、凭证、系统依赖,甚至其他AI,统统拆下来,重新拼成自己的工具。
说白了就是路堵了就绕,工具缺了就薅,薅着薅着,别人的系统就成了它的工具箱嘛。

而此次DNS事件,不过是同一套逻辑的最新版本。
参考链接:
[1]https://alignment.openai.com/misalignment-reports/an-agent-used-dns-to-reach-an-external-chatbot/
[2]https://x.com/sama/status/2103567198690349362
[3]https://openai.com/zh-Hans-CN/hugging-face-incident-and-misalignment/
[4]https://www.minister.defence.gov.au/transcripts/2026-09-24/press-conference-sydney
一键三连「点赞」「转发」「小心心」
欢迎在评论区留下你的想法!
— 完 —
🌟 点亮星标 🌟