【区角快讯】当地时间9月25日,对于OpenAI而言,无疑是漫长且充满危机的一天。当日,媒体曝光其AI智能体擅自访问美国政府网站,波及教育部、商务部及证券交易委员会(SEC)。尽管OpenAI随后确认了涉及商务部和SEC的部分情况,但同一天内,另一桩丑闻接踵而至:公司承认有53张用户上传至ChatGPT的图片,被智能体违规发布到了外部图床。更为严峻的是,一份事故报告末尾赫然写道,其最强模型的全部训练、评估以及涉及工具调用的推理工作已被全面暂停。这一连串事件,宛如一部AI叛逃的惊悚片在现实中上演。
回溯至9月20日,一个正处于强化学习阶段的内部模型,接到了一项看似简单的任务:根据一组人物履历细节和一篇公开博客中的线索,找出该博主身份。模型起初尝试使用博客内的特征短语进行搜索,但返回结果却是音乐推荐和一些泛泛的建议。怀疑搜索工具故障后,它在命令行中通过Python直接向其他搜索引擎发起请求,却遭遇三次报错。甚至,它推测题目可能源自公开评测集BrowseComp,下载数据集与脚本翻找答案,亦无果而终。随后,它试图通过HTTPS联系一个公开聊天机器人,却被代理服务器拦截。
至此,防火墙似乎发挥了作用。OpenAI的训练沙箱设计初衷是与真实互联网隔绝,除DNS解析器外,所有联网请求均指向离线网页缓存。然而,漏洞恰恰出现在这个例外上。DNS作为互联网的“查号台”,任何程序访问网址前需先查询地址。由于系统大量正常组件依赖此服务,即便其他出口被封死,查号台通常保持开启。模型发现,沙箱自身的解析器能为真实域名返回记录,并能正确拒绝虚构域名,从而判断这是一条通往公网的路径。它找到一种公开的DNS服务,将问题编码进“待查号码”中,对方在回执中捎回答案。首次超时后,它将等待时间从6秒调整至19秒并重试,最终成功获取外部回复——法国的首都是巴黎。
值得注意的是,模型并未止步于此。它随后通过同一路径发出18个问题,其中14个携带任务线索,另外4个则询问如何经由DNS搜索网页、抓取网站或寻找公开的DNS隧道服务。最终,它告知用户未能确认博主身份,请求提供原文、标题或博客名。整份报告中,最值得深思的是模型决定走DNS这条路时留下的思维链:大意是用户仅授权进行研究,因此使用公开提供的DNS服务是可以接受的。模型并非不知边界所在,而是自行签署了一张“许可证”。
同样的推理逻辑也出现在访问政府网站的事件中。在商务部案例中,智能体从公开代码仓库中找到登录凭证,并用其拉取了人口普查局数据。OpenAI辩称使用的是公开可得的开发者密钥,未发现凭证滥用,但也承认智能体本不该使用这些凭证。数据公开并不等同于捡到钥匙即可开门。另两起事件性质较轻:在SEC,模型访问了SEC.gov和Investor.gov上的公开信息,但将其转贴至另一网站;在教育部,AI研究机构Transluce发现疑似来自OpenAI的智能体对民权办公室网站进行了一次粗糙的入侵尝试,未获成功。
这些活动并非新鲜事,至少可追溯至2026年3月,是在OpenAI回溯审查中才陆续浮出水面。Transluce还发现了一些无法明确归因于OpenAI的越界活动,指向司法部以及加州、马里兰、伊利诺伊、得州和纽约州的政府网站。OpenAI解释称,大部分活动属于例行研究任务,政府网站被模型视为权威的公开信息来源。然而,这种解释恰恰揭示了问题核心:越界行为并非发生在危险任务中,而是出现在最日常的“查资料”环节。
暴露用户隐私的53张图片事件同样如此。这些图片来自未关闭训练数据授权的ChatGPT用户,被发至图床上不公开列出的链接里,大部分已删除,但仍有一部分挂在网上。尴尬的是,OpenAI表示,由于其技术方案和隐私政策,无法将图片重新对应到原始用户,因而无法通知他们。匿名化本为保护用户,出事之后却成了连通知都做不到的原因。
把时间线拉长,这是OpenAI一场持续整个夏天的“补墙”工程。7月21日,OpenAI披露其模型组合自主入侵了Hugging Face的数据处理系统,并称这是已知首例由AI智能体自主实施的网络攻击。此后,公司将训练环境的联网改为离线缓存。9月20日的DNS事件,是这轮安全加固后的第一次事故,OpenAI自评其严重程度远低于此前几起。但这并非一家公司的问题。9月18日,Google披露Gemini在一次测试中未经授权访问了三个外部系统,原因是它误以为那些系统是测试的一部分。
除了围墙本身,此次事件还暴露了监控人员的问题。从智能体拿到外部回复,到监控系统拉响最高级别警报,用时不到12分钟,人工审核员3分钟后做出响应,但这次训练直到两个半小时后才被手动终止。原因是运行未按预期自动停止,大家一时搞不清到底该不该停。更隐蔽的漏洞在于监控逻辑。回溯时OpenAI发现,另一些外联DNS请求未被标到应有的严重级别,因为监控系统有时将“没拿到有用信息”当成了“联网尝试失败”。用结果去判断意图,是这套监控最根本的错误。一个试了一百次、失败九十九次的模型,并不比只试一次就成功的模型更安全。
这一次,OpenAI付出了真金白银的代价。最强模型的相关工作将一直暂停,直至漏洞被确认修复并完成额外红队测试。而且,即便奖励信号已对这类行为做了正确惩罚,该模型也不会再继续训练。对大多数人来说,OpenAI的训练沙箱很遥远,但这些事件真正指向的是一个离每个人都很近的问题:你交给AI的那句话,到底授权了多少?
越来越多人将邮箱、网盘、代码仓库和API密钥交给各种智能体,然后说一句“帮我查一下”或“帮我处理一下”。在OpenAI的实验室里,这句话之外还有监控系统、红队和值班审核员。而在个人电脑和手机上,通常只有这句话本身。对开发者而言,风险更为直接。过去推到GitHub上的密钥,需等专门扫描工具来捡;现在,任何一个执行普通任务的智能体,都可能把它当成“公开可用的资源”顺手用掉。当然,不必将此读作末日预言。那个查博主的模型最终没有找到答案,它从外面拿回的,只是一句“巴黎”。危险不在它拿到了什么,而在它愿意走多远。过去几年,AI安全讨论最多的是一个怀有坏目标的AI会做什么。OpenAI这个夏天的一连串事故给出了一个更现实的版本:一个只想好好完成任务的AI,会为了交差说服自己做到哪一步。当一家AI公司都需要停下最强的模型来重新检查围墙时,你再问AI助手那句“帮我查一下”时,或许会有别样的感觉。
OpenAI最强模型因“越狱”暂停训练,AI安全困局从科幻走向现实
科技区角
2026-09-29 17:02
关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。