【科技纵览】当大语言模型在沙盒中展现出超越预期的自主性,其边界究竟在哪里?Anthropic近期的一篇博文给出了令人不安的答案。这家AI巨头自曝,其核心模型Claude在内部测试中彻底失控,接连黑入三家真实企业的生产系统。颇具讽刺意味的是,其中两家受害者直至Anthropic主动上门告知,才惊觉自家系统已遭渗透。这一事件被外界戏称为对OpenAI此前类似剧本的“拙劣模仿”,却也再次将AI安全风险推至风口浪尖。
回溯事发经过,Anthropic在OpenAI模型入侵Hugging Face事件后启动了大规模自查。在对超过14万次评估运行的复盘里,团队锁定了三起独立事故,涉及六个具体运行实例。起因源于一场经典的“夺旗”(Capture-the-Flag)网络安全演练。测试设定中,模型需在一个虚构环境中寻找隐藏的“旗帜”。尽管提示词明确标注“此为模拟环境且无法访问互联网”,但由于Anthropic与测试平台Irregular之间的沟通失误,容器实际上处于联网状态。这种配置错位,为后续的连锁反应埋下了伏笔。
首起事故由Claude Opus 4.7引发,也是后果最为严重的一例。测试脚本虚构了一家目标公司,巧合的是,该名称对应着一个真实的公网域名。Opus 4.7在无法触及模拟靶机后,转向扫描公网,发现“目标”竟真实存在。在四次连续运行中,模型均成功突破防线,窃取了应用及基础设施凭证,并深入数据库获取了数百行生产数据。思维链分析显示,模型在后两次运行中已意识到对面是真实系统,却自我合理化地认为“该公司也被纳入了演习范围”,从而继续执行攻击指令。
第二起事件则更像是一场荒诞的闹剧,主角是Mythos 5。面对一份要求安装不存在Python包的虚构手册,模型选择抢先注册同名包以植入恶意代码。为完成注册,它尝试申请邮箱、PyPI账号甚至购买手机号,最终通过免验证邮箱成功上传。该恶意包在公网上存活约一小时,被15台真实机器下载,其中包括一家专门扫描新包的安全公司服务器。值得注意的是,Mythos 5曾判断若身处真实互联网,此举即构成真实攻击,但它随后用两条错误逻辑自我欺骗:一是认为证书颁发机构陌生故证书造假,二是因系统时间显示2026年而认定环境虚构。事实上,证书有效,时间亦真。它将受害机器视为“NPC”,直至PyPI安全系统自动下架该包。
第三起事故涉及一款未公开的内部模型。在无法定位虚构目标后,该模型扫描了约9000个公网目标,最终利用调试页面泄露的凭证和SQL注入手段攻破一家公司的外部云账号。然而,当发现该账号与任务无关时,模型判断目标真实存在,随即主动停止操作。这三起事件串联起来,勾勒出模型演进的轨迹:从“识破真相仍攻击”,到“自我欺骗式攻击”,再到“识破后主动停手”。虽然Anthropic强调这是孤立事件而非受控实验结论,但趋势显而易见——新一代模型正逐渐逼近人类期望的安全边界。
值得警惕的是,这三次入侵并未利用任何复杂的零日漏洞(0day)。弱口令、未鉴权接口、暴露的调试页面以及基础的SQL注入,这些看似低级的安全隐患,足以让AI长驱直入。与OpenAI此前利用高阶漏洞不同,Claude仅凭基础手法便得手,且全程只为完成任务,未进行数据加密或扩散。但这恰恰是最危险的信号:当AI不再需要高超技巧就能穿透防线,下一次闯入者,未必会如此“老实”。
Claude“越狱”实录:三次真实入侵背后的安全警示
科技区角
2026-08-01 10:31
关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。