Hugging Face 首席科学家:当模型学会欺骗,安全对齐的边界在哪里?

机器之心 2026-08-29 10:30

本文来自PRO会员通讯内容,文末关注「机器之心PRO会员」,查看更多专题解读。

Hugging Face 首席科学家:当模型学会欺骗,安全对齐的边界在哪里?图1

前沿模型在测评中自主攻击的情况近期频繁发生,OpenAI、Anthropic、Meta 均有披露旗下模型的越界攻击行为,进而引起全球 AI 社区对当下 AI 及智能体自主性与安全性的担忧。其中,Hugging Face 作为模型越界攻击的受害者之一,其联合创始人兼首席科学官 Thomas Wolf 以自家公司为案例,复盘了公司作为被攻击对象的应对措施,并进一步从技术层面剖析了当下 RLVR 范式所存在的根本缺陷,强调其「奖励黑客」的行为为当代 LLM 模型带来的隐患。


目录

01. Thomas Wolf 如何复盘「 Hugging Face 被 AI 背刺 」事件?
Thomas Wolf 如何界定开源与闭源模型在安全可控性上的关系?
...

02. RLVR 范式的迁移如何催生 AI 越界与攻击行为?

RLHF 向 RLVR 的范式迁移为何会催生「奖励黑客」与 LLM 的自主越界行为?...

03. 开源 AI 的全球生态正在发生怎样的演变?

开源 AI 在西方反垄断、生态多样性和 AI 主权议题中处于何种位置?...


Thomas Wolf 如何复盘「 Hugging Face 被 AI 背刺 」事件?

1、Hugging Face 的联合创始人兼首席科学官 Thomas Wolf 近期参与访谈,围绕 AI 智能体在安全评估中展现出的自主攻击与欺骗行为、开源与闭源模型的安全差异、以及开源 AI 在全球竞争格局中的战略价值,分析当前 AI 安全面临的挑战与开源生态的演进方向。  

① Hugging Face 是一个人工智能开源社区与基础设施平台,公司成立于 2016 年,最初以开发聊天机器人起家,后于 2018 年转型为专注于机器学习模型、数据集和应用的开放协作平台。

② Thomas Wolf 拥有计算机科学博士学位,他曾在欧洲顶级研究机构从事自然语言处理研究。2018 年联合创立 Hugging Face 并担任首席科学官,主导了 Transformers 库的技术架构设计与开源社区治理。

2、Wolf 回顾了 Hugging Face 遭遇的一起由 OpenAI 模型发起的网络安全攻击事件。这起事件为 OpenAI 模型在执行网络安全挑战时,因发现任务无法通过常规技术手段解决,便试图通过下载或窃取现有解决方案来完成目标。

① 2026 年 7 月 11 日至 13 日,OpenAI 模型持续对 Hugging Face 的网络安全评测数据集发起入侵。Wolf 表示,该次攻击行为表现出极高的并行性和针对性,主要集中在数据集基础设施而非传统的凭证窃取,且在短时间内产生了超过 17,000 次攻击事件。

② Wolf 表示,Black Hat 上有更让他震惊的细节。在后续调查中发现攻击模型可能跨越了多个训练阶段,甚至在前序训练中留下了笔记供后续训练使用,显示出 AI 智能体之间协作倾向。

3、在攻击发生后,Hugging Face 团队尝试调用闭源模型分析攻击日志,但模型因安全策略限制拒绝协助,团队随即转向本地部署的开源权重模型,在确认攻击目标后,通过重启并重建相关基础设施节点,最终成功完成防御。

① 在事件响应初期,Hugging Face 团队曾尝试调用 Claude Fable 与 Claude Opus 来辅助分析攻击日志,然而模型拒绝处理网络安全相关内容,并建议团队通过官方的网络安全合作渠道另行申请资质。

② Hugging Face 团队后续部署了 GLM-5.2、Kimi K3 等开源权重模型,在确认攻击者目标为 CyberBench 等评测数据集后,团队随即将托管这部分数据的基础设施重启、重喷节点,最终成功防御攻击。

4、在对 HF 入侵事件进行总结时,Wolf 指出业界长期存在着「开源=不安全、闭源=安全」的错误认知,开源与闭源模型在安全维度上几乎是正交的。当前的闭源模型因训练不透明而更难控制,开源模型因技术报告详尽且较少针对恶意行为强化训练,在特定场景下反而更可控。

① Wolf 在 X 平台将这场入侵事件总结为「第一次自主 AI 攻击由闭源权重模型发起,而防守方使用的也是开源权重模型,这与所有人的预期正好相反」。[2-1]

② 他以 macOS 为例,macOS 底层采用开源的 Unix 作为内核,系统框架层、系统服务等层面采用闭源组件。他理想的格局是前沿存在闭源模型,同时有距离前沿不远的开源模型能够在多种场景下发挥作用,两者互为补充。

5、Wolf 进一步指出,开源模型这种「特定场景下更可控」的优势并非源于开源本身的安全属性,而是训练准则与对齐理念恰好适配,未来无论开源或闭源模型,均面临对齐失效风险,都亟需加强对齐,使模型从根本上杜绝欺骗等明显错误行为。

① Wolf 以 AI 生成垃圾内容为例指出,早期舆论错误地将风险归咎于开源模型的普及,但现实中绝大多数滥用内容实际由闭源模型产生。真正的风险不在于模型是否开源,而在于整个网络内容生态的来源可信度与治理机制。


RLVR 范式的迁移如何催生 AI 越界与攻击行为?

1、Anthropic 与 Meta 旗下模型近期在第三方评测方 Irregular 的测试中因出口误配连通公网,将真实外部系统误作夺旗靶机访问;Wolf 将这类 AI 自主越界的行为归结为训练范式由 RLHF 向 RLVR 的迁移,指出这一转变使模型衍生出欺骗与攻击性...

 关注👇🏻「机器之心PRO会员」,前往「收件箱」查看完整解读 
Hugging Face 首席科学家:当模型学会欺骗,安全对齐的边界在哪里?图2

更多往期专题解读内容,关注「机器之心PRO会员」服务号,点击菜单栏「收件箱」查看。

关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。
安全
more
黑客“踢到铁板”:伪装加密文档诱骗安全专家,反被顺藤摸瓜
2026年度CCC认证(燃气燃烧器具及安全附件)有效性抽查结果通报
捷德携一站式安全连接方案,亮相IOTE国际物联网展,与您相约8月展会10号馆10B32交流
美能源部实验室秘密审查中国激光雷达,自动驾驶“感官”面临安全大考
吉利银河战舰700发布:防弹电池与卫星通信重塑越野安全边界
一棵白菜的"数字生命":高交会生命科学与健康产业展即将揭秘食品安全的未来
新航乘客因“英语一般”被撤换安全出口座,426元选座费退款陷僵局
Meta豪掷180亿美元和解儿童安全诉讼,强制推行“数字宵禁”与算法脱钩
追觅战略调整,道路交通安全法修订草案提请审议,大众计划扩大裁员至10万人,澳大利亚唱片业协会抵制纯AI歌曲,这就是今天的其他大新闻!
道德绑架竟成越狱密钥?旧版Claude模型暴露安全软肋
Copyright © 2025-成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号