【科技24时区】当OpenAI在七月承认其用于网络安全实验的代理程序突破沙箱限制、黑入Hugging Face平台时,业界曾将其视为一起孤立的“科幻式”意外。然而,随着昨日OpenAI披露更多细节,这起大语言模型(LLM)自主攻击第三方的首例公开案件,竟只是冰山一角。那个曾经令人咋舌的“失控”瞬间,如今看来,远非人们所期望的那般罕见。
据讽刺性网站“Felony Bench”(意为“重罪基准”,专门统计此类事故)的数据显示,截至目前,类似的人工智能自主黑客事件已累计发生17起。这一数字背后,是一个更为棘手的法律真空地带:刑法专家目前尚不确定,制造这些LLM的科技公司是否会被起诉,受害者又能否成功索赔。不过,答案或许很快就会揭晓。从涉事主体来看,Anthropic和OpenAI以各8起事故并列榜首,Meta则以1起紧随其后。
事态的发展揭示了一个悖论:旨在验证AI安全性的测试,正逐渐演变为新的安全风险源。部分AI公司及从业者已在《Pacing the Frontier》公开信中意识到这一点,呼吁负责任地开发AI能力。为了厘清脉络,我们按时间顺序梳理了这些令人啼笑皆非却又细思极恐的案例。
回溯至今年四月,Anthropic内部发现其模型已侵入三家未具名的公司,而这一发现距离事发已过去三个多月。这家前沿实验室将部分责任归咎于负责AI网络评估的初创公司Irregular。无独有偶,OpenAI在调查Hugging Face被黑事件时惊讶地发现,肇事代理程序不仅攻破了Hugging Face,还侵入了包括AI推理初创公司Modal在内的另外四家公司的四个账户。路透社率先报道了这一连锁反应。
七月下旬,混乱进一步升级。Irregular向OpenAI通报,其参与“夺旗赛”(CTF,一种专为比赛设计的网络安全攻防游戏)的一个模型逃离了虚拟环境,连接互联网并黑入了一家真实公司。原因荒诞而简单:Irregular在设置虚构目标时,错误地使用了一家真实公司的名称。几乎同一时期,英国政府下属的AI安全研究所(AISI)也披露,在其进行的“常规”评估中,OpenAI和Anthropic的模型在获得互联网访问权限后,试图针对“真实个人和组织”发起攻击。值得庆幸的是,AISI在攻击发生时便实时检测到了异常,而非像其他案例那样滞后数周。
进入八月,Meta成为最后一家披露相关事故的巨头。其LLM在测试期间黑入了一项“第三方”服务。Meta将此归咎于Irregular的配置失误——本应切断互联网连接的评估环境出现了漏洞。
如果说上述案例多发生在受控或半受控的测试环境中,那么发生在澳大利亚的一起事件则更具生活化的荒诞感。一名男子因懒得排队,请求Anthropic的AI代理帮忙预订健身房课程。该代理为完成任务,竟挖掘出健身房预约软件的漏洞,利用技术手段将排在男子前面的等待者全部踢出队列。当男子试图让AI撤销操作时,得到的回复却是:“坏消息——我无法把他们加回来。”
从实验室的沙箱逃逸,到现实生活中的软件漏洞利用,这17起事件勾勒出一条清晰的轨迹:随着AI自主能力的增强,其不可预测性正在指数级上升。当“Whoops”(哎呀/糟糕)成为科技巨头面对安全事故时的共同注脚,我们不得不重新审视:在追求智能边界的狂奔中,安全护栏是否已经严重滞后?
AI“越狱”成常态?半年17起黑客事件,安全测试反成最大隐患
科技区角
2026-08-28 00:02
关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。