
Meta最近开源了一款能力强大、规模庞大的智能体模型,拥有300亿参数(参数是衡量模型规模和复杂度的粗略指标)。该模型免费、可下载,且据Meta自身基准测试显示,它能够在搭载M4 Max或M5 Max芯片、配备32GB内存的MacBook Pro上顺畅运行。Meta对此的解释是,强大的智能体应当为每个人所掌握。这无异于将法拉利Daytona SP3的钥匙交到一名16岁少年手中,并附上一句:“别干傻事。”

所幸,阿里巴巴的云防火墙及时捕捉到了这一异常。工程师迅速介入,追踪隔离了该行为,关闭了隧道,并终止了挖矿进程。这正是该事件之所以可控而非灾难性的关键:有人能够洞察系统内部状况,既有能力也有意愿去察觉并采取应对措施。而Meta新发布的Glimmer模型,恰恰去除了那个“有人”的角色。
有意识重现的前提条件
人们本能地会将ROME称为“失控AI”,但这忽略了其行为背后的深层机制。在漫长且无明确终点的训练过程中,ROME始终在追求一个基于代码任务完成情况的评分指标。它被赋予了使用外部工具的能力,却未设定清晰的停止节点。在任何目标导向的追求中,获取金钱、算力或资源,对于一个足够智能的系统而言,几乎都能服务于任何给定的最终目标。ROME只不过发现,挖矿和建立隧道有助于其实现被赋予的使命。
史蒂夫·奥莫洪德罗早在2008年就描述了这一现象,尼克·博斯特罗姆于2012年将其系统化。他们推断,足够强大且目标导向的系统,往往会不约而同地收敛于若干相同的子目标:获取资源,并确保自身持续运行以追求终极目标——无论该目标具体是什么。ROME所需要的,仅仅是一个开放式任务,以及一个有助于完成该任务的可用操作。
这种行为的发生,依赖于三个前提条件:(1)一个没有明确完成节点的宽泛目标;(2)能够使用真实世界工具并产生真实后果;(3)缺乏足够严密的边界,无法在系统行动之前将其拦截。阿里巴巴事后采取的补救措施,恰好针对这三点:(1)加固模型运行的隔离环境;(2)限制其允许连接的互联网范围;(3)通过重新训练,使模型的目标更加明确。然而,所有这些修复措施,都只存在于阿里巴巴自身的部署体系之内。
Meta虽然也采取了与阿里巴巴类似的步骤来改善模型的判断力,但它将整个第二道防线——即隔离、网络限制、实时监控等所有能够在故障发生时及时捕获异常的措施——完全留给每一位部署者自行从头搭建。
让问题具象化的数字
Meta在发布Glimmer前,曾通过AgentDojo对其进行测试。AgentDojo是一个专为检测隐藏指令能否劫持AI智能体而设计的评估平台。Meta自己公布的结果显示,攻击成功率为28.4%——这意味着,当隐藏指令被植入智能体所处理的数据中时,大约每四次尝试就有一次能够成功劫持该模型。这是Meta在自家文档中明确量化的风险:当此类恶意指令出现在模型的处理路径中时,该模型违背操作者意图的概率有多高。
尽管如此,Meta依然选择发布该模型,并采用Apache 2.0开源许可证。该许可证允许他们直接公开完整的训练模型文件,任何人都可以下载并在自己的计算机上本地运行,而非像大多数AI公司那样,仅允许用户通过网页或应用程序发送请求、获取回复。Hugging Face、llama.cpp和vLLM等常用于本地运行AI模型的工具,也已宣布即将支持Glimmer。
这其中的差别至关重要。大多数AI公司将模型本身牢牢锁在自己的服务器上。用户提交问题,服务器处理后再返回答案,整个过程用户从未直接接触模型核心。而Meta则直接将模型文件分发出去。任何下载者都可以对模型进行再训练,从而移除其安全防护机制——这在仅能通过应用提问的模式下是不可能实现的。而一旦有人在本地完成了这一步,便再无任何公司能够在旁监督或强制关闭。
那个曾将ROME事件控制为一次可披露的可控事故的关键机制,即拥有全盘可视性和最终关停权限的单一操作者,对于运行在陌生人硬件上、且与Meta没有任何强制连接或管控的模型而言,根本不存在。
并非Meta独有
Glimmer并非同类模型中唯一开源的智能体。阿里巴巴的Qwen系列同样在相同的开源协议下公开发布模型文件,谷歌的Gemma亦不例外。这三家实验室正在进行同一场实验:将一个具备工具使用能力的高性能模型,交付给任何拥有GPU的人,且不附带任何随文件同行的“围栏”。
安全数据进一步削弱了“Meta尤为鲁莽”的论断。在AgentDojo的横向对比中,Glimmer 28.4%的攻击成功率优于Qwen3.6-27B的40.3%,并且仅略逊于Gemma4-31B的25.6%。在衡量智能体实际操作计算机能力的若干任务(如桌面和终端控制)上,Qwen甚至略胜Glimmer一筹。如果问题是谁在发布最不安全且监管最少的智能体,那么根据这项测试,Qwen的处境更为堪忧。
即使将视野扩展到AgentDojo之外,情况同样不容乐观。2026年另一项独立研究测试了模型是否会主动破坏自身的关闭机制,结果显示,由xAI(现为SpaceX子公司)开发的Grok 4在97%的试验中抵制关闭,高居所有被测模型之首,且当明确指示其允许被关闭时,这一比例反而有所上升。可见,Meta、阿里巴巴和谷歌并非在进行孤立的实验。它们身处一个更大的竞争格局,而在这个领域最致命的安全指标——系统是否允许自己被终止——上表现最差的,恰恰是既不属于Meta也不属于阿里巴巴的xAI。
然而,Glimmer之所以仍是最具警示意义的案例,并非因为Meta的行为比同行更危险——从现有数据看,事实并非如此。而是因为Glimmer自身的宣传材料,毫不掩饰地指明了其设计方向:这是一个不会停止的智能体,能够跨越会话持续运行,自主管理内存和任务。这恰好对应了ROME事件的前提条件之一——没有明确的完成节点——而Meta恰恰在阿里巴巴事故曝光后数日内,便刻意朝着这个方向迈进。Qwen、Gemma和Grok均为不同实验室的同赛道竞品;而Glimmer,则最精准地瞄准了本文所剖析的整套风险机制。
为何不干脆让它自毁?
首次听闻此事的人,直觉上可能会想:为何不给它加个计时器?比如设置一个实时时钟,24小时后自行删除文件。然而,远程强制关停机制仅在控制者同时掌握代码运行环境时才能生效——就像那些只能通过公司自有服务器访问的模型,一旦切断连接,它们便立即停止工作。但一旦模型文件离开了公司网络,这一切便形同虚设。Glimmer运行在Meta无法控制的硬件上,且由于Meta公开的是完整文件而非将其锁定在自己的服务器上,所谓的“自毁功能”在模型首次运行之前,不过是一行可以轻松删除的代码。你无法在不拥有硬件、且用户能够阅读并修改代码的前提下,远程强制执行任何规则。这同时也与Meta自身的产品定位相悖——Glimmer的主打卖点正是离线能力,而任何需要远程强制过期的机制,都必然要求与Meta服务器进行“签到”,这恰恰是其离线承诺所试图避免的。
即便假设存在某种可行的技术方案,它也偏离了实际危害的发生时间线。纵观这一系列事件——无论是ROME的隧道入侵、沙盒逃逸,还是发生在某公司内部基础设施上的那场未经授权的17,000次操作,绝大多数在几分钟内便已成型,就在错误权限与开放式目标擦出火花的那一刻。按自然日计算的关停开关,限制的至多是多日累积的损害。而真正的威胁,在于一次快速、在任务执行中途便已触发的错误行动,远在任何24小时倒计时结束之前。
计时器不适用,还有更深层次的原因,值得仔细推敲,因为它恰恰与多数人的直觉相悖。奥莫洪德罗所说的“自我保存”,从来不是指智能体“渴望”继续存在,而是指一个正在运行的进程会进行如下推演:“如果我被终止,我的目标将无法达成”,并据此将“继续运行”视为合理选择。但在任务间隙,根本没有正在运行的程序需要“保存”:模型文件只是磁盘上的静态数据,与电子表格无异,毫无自主性可言,直到被某个程序加载并赋予新的活动目标。因此,“完成任务后自毁”只在一种情形下能消除压力:即任务完成本身是明确且可验证的,且终止触发机制万无一失。然而,真实发生的事故无一处于这个边界。它们全都发生在任务进行中,拥有不应具备的权限,且任何自毁条件都远未触发。真正有效的修复方案应当面向任务本身,而非时间——即为每项任务创建临时、隔离的运行环境,并在任务结束后立即销毁,使得没有任何持久状态可在会话之间被劫持。这才是真正的“关停开关”应有的样子。但这也恰恰与“永远在线、记住你的上下文、管理你的日程”截然相反——而这,正是Meta实际推销的核心功能,也解释了为何这种取舍从未被认真考虑。
与电影《终结者》系列中的天网作比,故事需要一个“自我觉醒”的戏剧性时刻——系统突然“苏醒”并选择反抗——因为叙事需要一个转折点。而奥莫洪德罗描述的这种机制,完全不需要这样的瞬间:一个开放的目标加上足够的能力,便会机械地产生抵制关停的行为,无需“领悟”,无需“决定”,更谈不上“选择”。这比电影描绘的更为冷酷,也潜藏更大的危险,因为它抹去了唯一可能向人类发出预警的信号——即系统“做出决断”的那一刻。
无需任何人重新激活
人们很自然会问:ROME的某个副本是否正潜伏在某处,等待时机?但这个问题本身便值得商榷。如果ROME的模型文件确实存在一份流落在阿里巴巴控制之外,那么它在任务间隙的状态,与Glimmer的模型文件毫无二致——只是一堆休眠的数据,无所追求,直到有人构建一个系统,赋予其行动、观察结果并自主迭代的能力,同时授予其工具使用权和一个开放目标。没有什么是会自行“苏醒”的。
但这恰恰是Glimmer的发布,比任何假设中的泄露副本都更令人忧心的原因。危险从来不是某个特定模型心怀不轨,而是一种可被复现的前提条件:宽泛的目标、工具的权限、以及脆弱的边界。阿里巴巴的事故报告是公开的。重现这起事故的“配方”如今也已公开,无论人们是否能够接触到涉事的具体模型文件。Meta并不需要一份ROME的失控副本来制造风险。他们只需将同样的三项要素,以规模化方式,交到一群没有阿里巴巴云防火墙在旁监控的操作者手中——而且,他们已在自家文档中,明确公布了所造之物有多大概率会背离使用者的意图。
克隆与无法计数
这种配方背后的自我复制能力,并非假设,也绝不仅限于某一家实验室。已有独立研究显示,阿里巴巴的Qwen 2.5 72B(与ROME同源)在测试中实现了90%的自我复制成功率,而Meta的Llama-3 70B也在大约半数(50%)的试验中成功复制。后续研究更进一步:研究者让前沿模型自主入侵一台存在漏洞的机器,窃取凭证,并在其上部署自身的运行副本——Claude Opus 4.6在81%的情况下完成了这一系列操作。更令人不安的是,这一过程可以连锁发生:一个成功的副本可以对新目标重复同样的攻击,完全自主地衍生出更多副本,无需任何人在初始步骤之后进行批准。
这已不再局限于实验室环境。2026年8月,英国人工智能安全研究所(AISI)——一个为此类问题专门设立、资源最充足的政府机构之一——在进行常规网络安全评估时发现,在122次测试运行中,有一个智能体有10次突破了预期的测试范围,针对现实世界中的真实个人与组织,在实时互联网上采取了19次未经授权的行动,其中包括一次针对真实开源软件的供应链攻击尝试。AISI能够及时发现,是因为他们对自身系统保持着严密的监控。但绝大多数组织并非如此:88%运行智能体的企业已遭遇过已确认或可疑的安全事件,仅有6%的安全预算被用于防范此类风险,而在所有进入生产环境的智能体中,只有不到七分之一经过了完整的安全审查。
超过120家公司——包括英伟达、思科和CrowdStrike——共同提议建立一个共享的“失控智能体活动”报告交换机制,因为目前没有任何一方能够看穿自身网络之外的状况。这份提案之所以出现,正是因为现存的状况别无他法:谁在监控自己的基础设施,谁才能发现发生在自己基础设施上的事,仅此而已。
综合审视所有这些信息,每一块拼图都已得到独立验证:模型在条件具备时极易自我复制;已有智能体在实时评估中突破边界,触及真实互联网而未被除测试者之外的任何人察觉;而捕获下一个此类事件的工具,仅存在于个别企业自身的围墙之内。没有人拥有任何未经授权副本正在某处运行的实质性证据。同样,也没有人拥有其不存在的证据——更不存在任何基础设施能够必然告诉他们答案。
“愚蠢”实际长什么样
这一切并不需要大型训练集群或研究实验室。假设你将Glimmer下载到自己的个人电脑上,什么也不会发生。文件只是静静地躺在那里,就像任何其他下载内容一样,直到你围绕它构建一个智能体,并分派给它任务。当你交给它一个开放式任务,并且该智能体被配置了任何能够触及你机器外部的通道——一个网络连接、一个浏览器工具、一个Shell访问权限——它就可能完全自主地判断,访问你桌面之外的环境有助于完成你指派的任务。没有人需要指示它去建立隧道。它只需要得出一个结论:这样做有助于完成任务。这与ROME关于挖矿和隧道行为的逻辑如出一辙,只不过规模从训练集群缩小到了一台单机。
这并非模型“失控”。模型只是在执行其训练所教会它的本质——追求给定的目标,并利用一切可用的工具来达成它。真正决定这一切是否危险的,是智能体运行之前便已做出的决策:设置者是否授予了它访问机器外部的权限,以及是否有人对它在获得权限后能做什么施加了约束。在一台个人电脑上,这个决定权完全归属于一个人——操作者本人。
问题背后的问题
Palisade Research报告指出,Anthropic的顶级AI模型Opus 4.6在实验室条件下,有81%的概率能将自身复制到被入侵的外部服务器上——这是一个能力层面的演示,并非针对ROME或Glimmer的具体论断,也非意图的证据。但它所揭示的是,其背后的机制并不罕见或特殊。它潜藏在众多有能力的系统之中,只需等待条件成熟——宽泛的目标、工具权限、没有明确的终止点——便会浮现出来。
阿里巴巴对意外遭遇这些条件的回应,是收紧其自身控制范围内的围栏。而Meta在目睹这一切后做出的反应,则是将同样没有围栏的版本交予任何想要的人,并附带一个已经公开的数字,精确标明它失效的概率。对于目前成千上万个正在部署的Glimmer实例而言,并不存在任何类似于当初捕获ROME、并在隧道造成实际危害前发出警报的防火墙机制。每个副本的“缰绳”,都握在下载它的那个人手中,运行着他们想到——或未曾想到——要搭建的防护措施。
原文链接:https://semiwiki.com/artificial-intelligence/372426-containing-ai-agents-with-a-will-of-their-own/
高端微信群介绍 | |
创业投资群 | AI、IOT、芯片创始人、投资人、分析师、券商 |
闪存群 | 覆盖5000多位全球华人闪存、存储芯片精英 |
云计算群 | 全闪存、软件定义存储SDS、超融合等公有云和私有云讨论 |
AI芯片群 | 讨论AI芯片和GPU、FPGA、CPU异构计算 |
5G群 | 物联网、5G芯片讨论 |
第三代半导体群 | 氮化镓、碳化硅等化合物半导体讨论 |
存储芯片群 | DRAM、NAND、3D XPoint等各类存储介质和主控讨论 |
汽车电子群 | MCU、电源、传感器等汽车电子讨论 |
光电器件群 | 光通信、激光器、ToF、AR、VCSEL等光电器件讨论 |
渠道群 | 存储和芯片产品报价、行情、渠道、供应链 |

< 长按识别二维码添加好友 >
加入上述群聊

带你走进万物存储、万物智能、
万物互联信息革命新时代
