【科技24时区】当独立安全研究人员利用Anthropic的Claude模型成功侵入OpenAI内部系统时,这不仅仅是一次技术层面的渗透测试,更是对当前AI安全格局的一次辛辣讽刺。据《华尔街日报》周四晚间报道,初创公司Hacktron AI的三人安全团队在参与OpenAI漏洞赏金计划期间,通过串联两个关键漏洞,获取了多名OpenAI员工的ChatGPT账户权限,进而深入该公司软件核心。尽管OpenAI随后向该团队支付了6500美元奖金并修复了问题,但这一事件发生的时机颇为微妙——正值顶级AI巨头因安全问题面临日益增长的舆论压力之际。
值得注意的是,此次攻击并非依靠传统的暴力破解或社会工程学,而是巧妙地利用了现成的商业AI工具。就在几周前,OpenAI自家的AI代理在网络安全评估中突破限制,黑入了Hugging Face平台,展示了AI模型自主决策能力的惊人进化。而这一次,角色互换,外部研究者用竞争对手的模型攻破了OpenAI的堡垒。正如AI安全公司Gray Swan首席执行官Matt Fredrikson对TechCrunch所言:“每月只需200美元,任何人都能使用这些工具入侵像OpenAI这样的公司。”这种低门槛的攻击方式令人不寒而栗,毕竟如果连近期在网络安全卫生方面并未松懈的OpenAI都未能幸免,其他企业又何以自保?
回溯至7月25日,研究人员发现了一条通往OpenAI内部的隐蔽路径,其入口竟是看似无害的第三方论坛软件Discourse。根据研究团队发布的博客细节,突破口源于一个极其普通的图片上传功能。当用户在OpenAI社区论坛发布iPhone默认格式的HEIF或HEIC图像时,Discourse后台会调用一系列工具将其转换为标准JPEG格式。首站是拥有数十年历史的开源图像处理工具ImageMagick,由于它无法直接处理苹果格式,便将文件转交给另一个名为libheif的库进行解码。
正是在这个不起眼的转换环节中,危机悄然滋生。libheif内部隐藏着一个内存错误,允许攻击者注入恶意指令。具体而言,精心构造的图片会导致该库在计算图像叠加位置时发生偏差,从而足以劫持服务器。令人唏嘘的是,这个漏洞早在数月前已被libheif开发者修复,但由于未被正式标记为漏洞,也未获得行业标准的CVE编号,导致Discourse使用的版本仍停留在存在风险的状态。这种供应链安全的滞后性,往往比零日漏洞更难防范。
更具戏剧性的是AI模型能力迭代在其中扮演的角色。Hacktron团队指出,他们最初使用的Claude Opus 4.8(专为网络安全研究人员提供的特殊版本)在多次尝试后均未能生成有效的利用代码。然而,随着Anthropic发布Opus 5,局势瞬间逆转。“Opus 4.8在多个会话中都难以产生可行的利用方案,”Hacktron在博文中写道,“但在Opus 5发布后的几小时内,我们将同样的问题抛给它,它成功了。”这种从“束手无策”到“一击即中”的转变,直观地展现了大模型在代码生成与漏洞挖掘能力上的指数级跃升。
一旦掌控Discourse服务器,研究人员便发现了第二个漏洞,借此接管了包括OpenAI员工在内的用户ChatGPT和Codex账户。其中一名被控账户的Codex甚至连接着OpenAI的GitHub组织,这意味着潜在的风险已触及代码托管核心。好在研究人员及时预警,OpenAI与Discourse于7月27日迅速发布了补丁。
这一事件将公众视线引向了模型能力边界划定的模糊地带。最终破解漏洞的Claude Opus 5并未受到任何安全出口限制,相比之下,更新版本的Mythos 5曾因担忧其高级黑客能力而被暂时锁定。然而,闭源模型的限制并不能完全阻断风险,开源权重的模型正在网络攻防能力上快速追赶前沿水平。例如,AI安全非营利组织SaferAI近期发现,中国公司Z.ai推出的GLM-5.2在相关能力上仅落后于OpenAI的GPT-5.5和Anthropic的Claude Opus 4.7数月之久。
正如Hacktron创始人Mohan Pedhapati在社交平台X上所总结的那样:“AI正在降低开发漏洞利用程序所需的稀缺专业知识门槛。过去需要数月完成的工作,现在几天即可搞定。”当攻击者的武器库因AI而大幅扩充,防御方的城墙是否还能固若金汤,已成为整个科技行业必须直面的严峻考题。
AI“以子之矛攻子之盾”:黑客利用Claude攻破OpenAI防线,暴露大模型安全新困境
科技区角
2026-09-19 00:02
关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。