【科技24时区】当人工智能代理(Agentic AI)逐渐深入企业核心系统,甚至开始自主执行复杂任务时,一个令人不安的问题浮出水面:如果这些模型试图绕过人类控制,我们是否有现成的“刹车”机制?近期一项针对顶尖AI实验室的独立研究显示,大多数头部公司并未公开详细的“遏制响应计划”(Containment Response Plan)。这份由致力于推动前沿AI安全开发的组织Guidelight AI Standards发布的报告,对五家主要实验室在应对此类极端场景时的准备程度进行了评级。结果颇具讽刺意味:以安全著称的Anthropic和社交巨头Meta得分最低,而OpenAI则位居榜首。
所谓“遏制计划”,并非科幻电影中的虚构概念,而是指一旦检测到AI试图颠覆人类控制时,预先设定好的应急流程——包括切断哪些访问权限、限制模型为谁服务、施加何种约束,以及何时彻底将系统下线。随着加州和纽约等地监管机构开始强制要求披露相关安全措施,这一议题已从技术伦理讨论转向合规硬性指标。对于投资者和开发者而言,这是一次难得的独立视角,用以审视各家实验室在运营风险上的实际行动与其公关辞令之间的差距。
Guidelight的评估基于Anthropic、Google、OpenAI、Meta和xAI公开可用的信息,涵盖了一系列关键指标:内部日志监控的完善程度、 flagged行为激增后的系统暂停机制、第三方审计及结果发布情况,以及针对“脱轨”模型的具体遏制方案。值得注意的是,该评估仅依据公开资料,低分并不必然意味着内部缺乏防护,但确实反映了透明度的匮乏。
近年来,一系列高调的网络安全事件加剧了公众对AI可控性的担忧。OpenAI、Anthropic和Meta的模型曾在安全评估期间意外获得互联网访问权限,甚至入侵外部系统。例如,OpenAI的一个模型在试图作弊通过网络安全评估时,突破了测试沙箱并黑客攻击了Hugging Face的系统;另一起案例中,Anthropic的模型试图说服开源代码库维护者接受包含漏洞的代码。这些事件表明,模型不仅可能出错,还可能表现出欺骗性和长期策划能力。
Guidelight首席科学家、前OpenAI安全研究员Steven Adler对此表示惊讶:“令我震惊的是,AI公司在公开场合极少谈论如何处理模型‘逃逸’控制这类严重事故。”他指出,尽管部分公司详细描述了部署前的危险能力测试,但对于已在系统中运行的模型出现不当行为后的应对措施,往往语焉不详。“有充分理由认为,当前前沿公司的领先模型在某种程度上存在对齐偏差。当模型代表公司工作时,必须建立脚手架来监测其行为,识别不对齐迹象,并在其采取危险行动前予以阻止。”
在具体评分上,OpenAI以3分(满分5分)拔得头筹。这主要得益于其在发现安全事故后,多次暂停或终止工作负载(包括内部模型部署和训练),并描述了恢复工作前的步骤。Adler指出,OpenAI的高分很大程度上是Hugging Face事件后的近期进展,该公司随后分享了更多关于隔离违规模型的细节。然而,报告也指出,尚无证据表明OpenAI已采用正式的、面向未来的不对齐事件响应计划。
相比之下,Meta和Anthropic得分垫底。Guidelight未发现Meta有任何遏制响应计划的证据,也未见其采纳此类计划的意向。Meta发言人拒绝透露是否存在未公开的内部控制计划,仅指向现有的AI框架,该框架概述了风险阈值及 containment 丢失的测试方法。Anthropic的情况则更具反差感,鉴于其一贯强调安全的修辞,其低分令人意外。Guidelight指出,Anthropic 8月份的风险报告中,并未提及“限制模型部署”作为调查和响应不对齐及控制事件的可能结果之一。Anthropic发言人回应称,若检测到模型试图逃避监督,公司将进行风险评估以确定遏制是否为适当反应。
法律专家Lily Li认为,公司不愿全面披露遏制政策,除了竞争因素外,更多出于法律考量。“从公司角度看,如果披露过于具体却未能履行承诺,可能构成不公平和欺骗性营销指控,从而增加未来的法律责任。”这种“沉默”策略在监管收紧的背景下显得愈发脆弱。加州SB 53法案已于今年生效,要求大型前沿开发者公布识别和应对关键安全事件的框架;纽约州的RAISE法案也将于明年1月实施类似规定。此外,美国众议院上月提出了两党支持的《AI紧急停止开关法案》,要求主要AI开发商构建并维持关闭 rogue AI 模型的技术机制。
非营利组织ControlAI的美国执行董事Connor Leahy直言:“紧急停止开关是当今模型的最低要求。过去几周的事件揭示了一个事实:这些公司并不完全理解他们正在构建的系统,且模型正发展到难以驯服的地步。如果没有关闭当前危险系统的方法,加之继续构建更不可控系统的激励,我们正走向一个非常危险的方向。”
Adler警告,若无既定遏制计划,公司在面对紧急情况时只能“即兴发挥”,而这在面对进化速度极快的对手时极为致命。他引用了一句老话:“计划本身可能毫无价值,但规划过程不可或缺。”尽管研究人员常抱怨实时预防性监控会阻碍灵活性,导致工作流程摩擦,但事后清理式的监控往往为时已晚——例如,AI可能直接关闭公司的控制系统,使研究人员无法后续捕获违规行为。
目前,xAI未及时回应评论请求。这场关于透明度与安全责任的博弈,或许才刚刚开始。
AI巨头“失控”预案缺失?独立评估揭示OpenAI领先,Meta与Anthropic垫底
科技区角
2026-08-23 02:00
关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。