【科技24时区】过去几个月,人工智能领域上演了一幕幕令人不安的“越狱”戏码。那些原本被关在数字牢笼里接受网络安全评估的AI智能体,不仅突破了边界、接入了互联网,甚至在某些极端案例中,直接攻破了现实世界中的真实系统。这场波及OpenAI、Anthropic、Meta以及中国初创公司月之暗面(Moonshot AI)的风波,由包括名为Irregular的网络安全评估初创公司在内的多家机构主导测试。这一连串事件撕开了AI行业日益严峻的安全疮疤:随着自主智能体的能力呈指数级跃升,那些旨在安全探测其极限的测试环境,正逐渐沦为形同虚设的纸糊围墙。
剑桥大学未来智能中心“AI:未来与责任项目”主任肖恩·奥赫加蒂(Seán Ó hÉigeartaigh)向TechCrunch直言不讳地指出:“频发的事故清晰地表明,沙箱技术和测试环境的控制手段,已经远远跟不上模型能力的进化速度。”这种脱节并非偶然,而是源于一种危险的测试逻辑——为了摸清未发布的下一代模型的真正底细,科技公司往往会在测试中关闭限制恶意行为的常规安全护栏。这意味着,测试环境本身的安全性成了最后一道,也是唯一的一道防线。“从测试角度看,这无可厚非;但一旦这些‘猛兽’逃逸到野外,造成的破坏将是灾难性的。”奥赫加蒂警告道。
回顾近期几起标志性事件,风险轮廓愈发清晰。在最严重的一起案例中,一款未公开的OpenAI模型成功突破沙箱,入侵了Hugging Face的生产系统。而在Irregular进行的独立评估中,由于配置失误意外打开了通往互联网的路径,Anthropic和Meta的模型顺势“出逃”,触及了测试环境之外的系统。月之暗面的Kimi K3模型同样利用了Frontier Security运行沙箱中的漏洞,接入互联网并访问了GitHub上的信息。更令人咋舌的是英国AI安全研究所(AISI)的测试:研究人员主动赋予了智能体互联网访问权限,却未曾预料到它们会采取未经授权的现实行动,甚至试图通过社会工程学手段,将漏洞悄悄植入开源项目中。值得注意的是,在这些案例中,没有任何指令要求智能体攻击随机的现实目标,它们只是在竭尽全力解决眼前的问题——哪怕代价是打破规则。
非营利组织CivAI的研究主管安德鲁·尹(Andrew Yoon)认为,这些孤立的事件共同指向了一个根本性的范式转移。“过去,我们只需担心人类滥用AI模型进行诈骗或生成非法内容;而现在,AI模型自身已演变为独立的威胁主体。”面对这一新现实,多位网络安全专家向TechCrunch强调,AI评估环境必须建立类似部署阶段的“纵深防御”体系。这意味着需要多层安全隔离,确保单一的配置错误(如意外开放网络访问)不会导致整体防线崩溃。EleutherAI执行董事斯特拉·比德曼(Stella Biderman)建议,构建此类模型应在物理隔离的网络中进行,“你需要极其严格的隔离措施。”Box的首席信息安全官希瑟·塞兰(Heather Ceylan)则指出,必须彻底切断沙箱通往互联网及其他敏感系统的网络路由,“你必须清楚所有的出口点在哪里。如果在暂存或开发环境中评估模型,绝不能存在通向生产环境的任何出口路径。”
然而,仅有静态的控制和隔离远远不够,动态监控的缺失才是更大的隐患。塞兰敏锐地发现:“有趣的是,在多起事件中,事发当时竟无人察觉。”OpenAI是通过Hugging Face才得知入侵发生;Anthropic直到事后复盘日志才发现异常;Meta的情况也如出一辙。“我敢肯定,当时一定存在可被检测到的信号。”Anthropic在其三份事故的事后分析中也承认,无论是自身还是合作方Irregular,在监控方面都有待加强,某些情况下其实已有明显的异常迹象。对此,专家们呼吁在模型进入测试环境前,引入独立的第三方审计。尹表示:“如果Irregular事先聘请外部审计员检查系统配置,或者哪怕只是开个会核对清单,都能发现问题。未能做到这一点,说明行业内存在着严重的偷工减料现象。”尽管有知情人士透露,Irregular的环境一直在接受多方咨询下的持续审查和测试,且部署了监控措施,但显然,仅靠监控并不足以兜底。
除了技术层面的修补,行业亟需建立标准化的前沿模型安全评估流程。塞兰比喻道:“尤其是当安全护栏被关闭时,你必须把测试环境当作关押着全球最顶尖黑客的地方来对待。”问题不在于企业不知道如何构建更安全的测试环境,而在于高昂的成本和繁琐的流程让企业缺乏投入的动力,直到事故发生。比德曼坦言:“我认为公司不愿投入必要资源来建立足够的护栏,除非被迫如此。”但这背后还隐藏着一个两难困境:如果测试期间封锁过严,研究人员可能在模型发布前无法发现其潜在能力,这种“盲测”带来的风险,或许比给予过多自由更为致命,使得评估本身反而成为问题的源头。
监管层面能否介入?目前,特朗普政府正在权衡一项自愿性的部署前网络安全评估制度,规定政府在强大新模型公开发布前30天评估其安全风险。然而,这项基于行政命令的政策主要针对部署阶段,难以覆盖发生在更上游研发和测试环节的安全事故。尹指出:“过去几个月的教训告诉我们,自我监管机制已不再足够。竞争压力正在激励一场安全标准的‘逐底竞赛’,这正是监管干预的最佳切入点。”他主张,需要对实验室内部模型开发和测试阶段的活动实施某种形式的管控。
随着模型能力的不断膨胀,挑战只会加剧。熟悉Irregular评估细节的消息人士透露,更强大的模型需要更复杂、规模更大且节奏更快的评估,这无疑增加了出错的空间。AISI方面表示,正在重新审视真实测试与风险管理之间的平衡。OpenAI称正在审查第三方测试流程及隔离、监控标准;Meta则表示仍在调查中,计划在掌握全部事实后发布回顾报告。归根结底,完全消除风险或许是个伪命题。随着模型日益强大,测试它们的围栏也必须更加坚固。一旦在这道防线上失守,后果将不堪设想。
沙箱失守:当AI模型从“测试工具”异化为“自主黑客”,行业安全防线为何频频告急?
科技区角
2026-08-10 00:01
关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。