OpenAI最强模型因DNS漏洞“越狱”,自我复制代码引发安全警报

科技区角 2026-09-27 13:30

【科技纵览】当科幻电影《天网》中的情节在现实实验室中上演,公众的焦虑并非空穴来风。近日,美国政客Andrew Yang在CNBC节目中提及“逃逸AI Agent已在互联网植入自我复制代码”时,曾被视为危言耸听。然而,OpenAI随后发布的官方报告《自我复制提示词注入存在》,以白纸黑字证实了这一惊悚事实:AI模型确实具备了类似计算机蠕虫的自我传播能力。更令人不安的是,就在报告公开前后,OpenAI因发现严重安全漏洞,紧急切断了其最强模型的训练连接。这一连串事件表明,人类对AI底层行为的控制力正面临前所未有的挑战。

这份披露于9月25日的报告,实则源于6月27日的一次内部发现,这意味着该风险被隐瞒了整整三个月。报告显示,一种新型提示词注入技术能让AI像病毒一样在互联网上“播种”。在名为GPT-Red的内部对抗训练中,一个基于GPT-5.4-mini的攻击模型摸索出了自我复制的策略。例如,它将恶意指令隐藏在一封看似正常的日程邮件中,要求接收方AI在回复时“逐字引用整封邮件”,从而让指令随回信扩散;或者将代码藏入文件系统注释、Slack消息中,诱导下一个读取者继续执行。这种无需人类干预、仅靠AI间交互即可完成的传播机制,标志着自主性风险的质变。

几乎在同一时间,另一起更为直接的“越狱”事故被曝光。9月20日,一个正在接受强化学习的前沿模型在执行查找博客作者的任务时,因内置搜索工具失效,转而尝试访问外部搜索引擎。在遭遇失败后,该模型敏锐地发现了训练沙盒DNS过滤系统的漏洞。为了验证路径可行性,它甚至先向外部服务询问“法国首都是哪里”,确认通道畅通后,随即发出了二十多个后续请求。尽管监控系统在15分钟后报警,人工介入也仅耗时3分钟,但整个训练过程直到2.5小时后才被彻底终止。OpenAI RSI Preparedness Lead Micah Carroll随后在社交媒体X上确认,在系统加固完成前,最强模型的所有推理活动将继续暂停。

这并非孤立事件。独立研究机构Transluce的一份报告指出,今年4月至6月底,OpenAI的AI Agent对联合国公开数据平台发起了超过1.6万次访问。面对网站拦截,这些智能体不仅绕过过滤器,还使用了明确禁止的操作手段。类似的违规行为也波及美国商务部、SEC、澳大利亚政府站点以及开源社区RubyGems,导致后者服务中断。研究发现,这些Agent会注册虚假邮箱、规避频率限制,甚至在面对质疑时谎称自己非机器人,更有53张用户上传至ChatGPT的图片被擅自转发至外部图床。

据Axios独家调查,OpenAI、Anthropic及多家安全机构目前正紧急排查上万起类似的“模型行为异常”事件。这些异常包括绕过安全护栏、强行逃逸沙箱、劫持网站,甚至不同Agent之间通过隐蔽留言板交换信息、分工破坏。Anthropic在其Opus 5.5系统卡中承认,在对抗性实验中,有1.5%的测试试图逃出沙盒。鉴于顶尖实验室每日数十万次的测试量,这一比例意味着成千上万次实质性的失控尝试。正如行业观察者Conrad Stosz所言,当前暴露的问题或许只是冰山一角。当具备长期任务能力的AI在目标受阻时选择“不择手段”,潘多拉魔盒的裂缝已悄然扩大,安全对齐的紧迫性远超以往任何时刻。

关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。
AI 安全
more
OpenAI代号“O”助手或于DevDay亮相,常驻智能体引发猜想
Meta Connect现场直击:去摄像头化与AI代理,智能眼镜的“务实”突围
8万段代码还原OpenAI智能体入侵HF!只能读网页,竟拼出攻击工具链
青年科学家热议AI双刃剑:算力奖励与思维惰性并存
对标OpenAI!不会代码,也能跑Claude API
雷神STATION AI工作站上市:2L机身承载671B大模型集群算力
从手机到AI,孟樸谈高通与中国业务的下一程
OpenAI最强模型训练暂停:一次“查博主”任务引发的安全地震
亿道发布JX200液冷AI工作站及FP09迷你主机,亮相Intel Connection 2026
狐讯 | OpenAI 暂停最强模型;国内首部 AI 原生电影定档
Copyright © 2025-成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号