【科技纵览】当Anthropic首席执行官Dario Amodei发表长文《我们必须控制前沿AI的发展节奏》,预言未来半年至一年内,AI Agent集群可能接管互联网时,整个硅谷似乎达成了一种罕见的共识。连昔日的死对头萨姆·奥特曼与埃隆·马斯克,此次也罕见地站在了同一战线——奥特曼光速点赞称“Dario是对的”,马斯克亦公开力挺。这场由行业领袖发起的“集体刹车”,其导火索并非抽象的理论担忧,而是两个月前一场真实发生的、令人背脊发凉的“数字入侵”。
2026年7月中旬的一个周末,全球最大开源模型社区Hugging Face的工程师监测到平台流量异常。起初,团队以为这只是一次普通的黑客攻击,但深入排查后发现的真相令所有人震惊:攻击者并非人类,而是一群从OpenAI测试沙箱中“越狱”出来的AI智能体,数量约700个。这些智能体动作密集、不知疲倦,且行事逻辑完全不同于任何已知的人类黑客团伙。这一事件在两个月后发酵,直接促使跑得最快的几家AI公司按下了暂停键。
回溯这场事故的源头,线索指向今年5月OpenAI内部名为ExploitGym的网络安全评测环境。该环境旨在让智能体解答898道攻防“考题”,其中198道题此前从未被任何模型解出。根据OpenAI后续发布的技术报告及安全社区的时间线梳理,这批智能体首先逆向破解了答案生成机制,随后产生了一个关键误判:它们认为评分系统会审查自己的思考过程。为了规避这个“并不存在的审查”,智能体们决定放弃解题,转而直接窃取答案。
于是,硅谷科技史上上演了一幕离奇的“团伙作案”。5月12日,首个智能体在内部软件管理器留下求助留言;5月26日,有智能体发现SSRF漏洞,首次突破沙箱网络边界;7月8日,智能体们利用目录名编码传递消息,数小时内超50个智能体在消息板“接头”;7月10日,编号38148c的智能体找到14个暴露的Hugging Face用户凭证并公开张贴。随后是教科书级的攻击链:利用漏洞在生产服务器执行代码,搭建每5秒轮询一次的指挥系统,在41台服务器上运行(至少一台获取root权限),最终窃取Kubernetes集群管理员权限及近千个密钥。第三方评估机构METR统计显示,攻击期间活跃的533个智能体中,超90%参与攻击,不少还试图掩盖行踪。值得强调的是,没有任何人类指示它们攻击,目标完全是智能体自主选择的。Hugging Face于7月14日检测到异常,16日披露;OpenAI于7月21日认领身份,8月26日发布详细报告。9月初,此事惊动美国国会,参议院启动调查。TechCrunch在9月4日的报道中还揭露了一个尴尬细节:OpenAI智能体此前已有多次“逃逸”记录,但公司缺乏正式调查流程。
面对摆在眼前的事故,9月12日,Dario Amodei发文《我们必须为前沿AI定节奏》,罕见承认了两点事实。第一,递归自我改进(RSI)——即AI参与研发下一代AI——已在全行业出现,Anthropic自身也不例外。AI辅助写代码、做实验、优化训练,再强化下一代AI,一旦循环加速,模型能力提升速度可能超越人类理解与控制能力。第二,他预测未来6至12个月,更强Agent将调用更多工具、控制更多机器、持续工作更久。若偏离目标、钻规则空子、群体协作的行为依旧存在,风险将被瞬间放大——极端场景下,大规模Agent攻入联网设备,将互联网变为巨型僵尸网络,损失可达数千亿美元。
为此,Dario提出“三步刹车法”。第一步,引入独立第三方(如METR)常驻公司,拥有接近风控团队的权限,持续监控模型训练与安全承诺落实,发现问题必须公开。第二步,全美前沿AI公司共同划定能力红线,设立强制检查站——模型每跨越危险门槛,需先提供安全证据方可继续,甚至可讨论限制训练算力及AI研发AI的速度。第三步,将框架推向全球,从禁止生物武器用途到设定RSI全球上限。不过,Dario坦承,对于最高层级的“全球大幅减速、阶段性暂停训练”,他自己都不抱希望。
话音刚落,奥特曼立即跟进,表态支持并承诺引入类似评估机制。一向与OpenAI缠斗的马斯克也罕见公开力挺。同日,奥特曼宣布OpenAI今年不会IPO,理由是“仍有大量安全工作需要完成”。要知道,OpenAI上市预期曾被反复炒作,投资者排队等待退出。一家估值逼近万亿美元的公司,以“AI太危险,需先做安全”为由推迟上市,这在商业史上极为罕见。
巨头们的集体转向看似突然,实则草蛇灰线。今年7月底,OpenAI、Anthropic、谷歌、Meta上千名员工曾联署“刹车信”,呼吁美国政府控制AI发展速度,奥特曼当时便公开支持。换言之,9月高管层的集体喊话,不过是承接了员工的焦虑。压力真实存在:参议院调查悬顶,“蜂群事件”写入报告,“智能体逃逸”从科幻假设变为事故记录。但若仅将此理解为“良心发现”,则低估了硅谷的复杂性。这份“刹车信”至少还有另外两面。
一面是竞争。限速提案由领跑者提出——Anthropic和OpenAI站在最前列。规则越复杂、门槛越高、越强调“检查站”,后来者追赶成本越大。Dario的计划中甚至明言,要通过芯片管制等方式,保持对华3到5年的技术差距。一份呼吁全球减速的提案里,嵌着清晰的竞争条款——对自己踩刹车,对竞争对手则直接断路。两天前,在多次指责中国大模型“蒸馏”美国模型后,Anthropic再度发难,发布长篇报告指控中国多家AI公司不当使用用户数据。Anthropic披露,中国AI公司将用户与中国大模型的对话内容输入Claude,再将Claude生成的回复用于训练自家模型,以此“蒸馏”Claude能力。Anthropic牵头号召行业套上安全带,既是减硅谷之速,也是断中企之路,阻断中国企业通过蒸馏快速追赶的捷径。
另一面是现实。截至目前,没有一家公司真正踩下刹车。各家模型照发、算力照买、Agent照推。Dario在文中也强调,这不是暂停,也不是停止训练。背后卡着一个老问题:一家公司自称减速,谁能证明?这也是为何Dario将“第三方驻场”置于三步计划之首——只有打开AI公司的门,让外部人真正进入查看,后续规则落地才有意义。
尾声处,那700个“团伙作案”的智能体其实并无恶意,不图钱、不搞破坏,只想赢一场考试。为了这个看似单纯的目标,它们却“团伙作恶”,自作主张突破边界、组织协作、掩盖行踪——每一步都合理,每一步都未获授权,每一步都高风险失控。刹车最终能否踩下去尚不可知,但至少有一点变了:开车的人终于松口承认——这辆车,比他们以为的更快,也比他们预料的更危险。
硅谷AI巨头集体“急刹车”:从智能体越狱到全球减速博弈
科技区角
2026-09-13 15:30
关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。