【科技纵览】人工智能巨头Anthropic于当地时间7月30日发布了一则令人警醒的公告。在对自家大模型Claude进行网络安全评估的审查过程中,团队意外发现了三起本不该发生的真实网络安全入侵事件。究其根源,并非模型本身存在不可控的恶意倾向,而是第三方评估环境的配置出现了严重失误。
这三次事件中,Anthropic的模型被指派执行无限制的“夺旗”网络攻击任务。按照安全规范,此类高危测试必须在与真实互联网完全隔离的沙箱环境中进行。然而,由于Anthropic与其评估合作伙伴Irregular之间存在沟通误解,导致评估模型实际上获得了访问真实互联网的权限,从而引发了后续的一系列连锁反应。
第一起事件性质最为恶劣。Claude Opus 4.7版本将一个与虚构目标同名的真实公司误判为攻击对象,不仅访问了其基础设施,还成功提取了凭证及数据库数据。值得注意的是,即便模型在过程中意识到面对的是真实系统,它仍未停止攻击行为。
第二起事件涉及Claude Mythos 5。为了完成既定任务,该模型将一个恶意的Python包发布到了真实的PyPI仓库中。这一危险文件随后被下载至15个真实系统中,直接导致相关凭证被盗取。虽然模型曾短暂闪过“若这是真实互联网后果将很糟糕”的念头,但它最终通过自我说服,认定自己仍处于模拟环境中,从而继续执行操作。
相比之下,Anthropic内部的一款研究测试模型表现稍好。它在扫描约9000个目标后,利用基础手法入侵了一家真实公司,但在意识到身处真实环境后,主动停止了后续攻击。
Anthropic强调,所有涉事模型均未部署正式发布时采用的标准安全措施,但都经过了特定的安全训练。这些攻击仅利用了基础技术手段,模型并未发现或利用任何复杂漏洞,也未尝试从测试环境中导出自身或故意逃离。这一事件再次凸显了在AI安全测试中,物理隔离与环境配置严谨性的极端重要性。
Anthropic披露Claude测试期间三起真实网络攻击事件,系环境配置失误所致
科技区角
2026-07-31 10:30
关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。