【科技24时区】当政策制定者还在为如何监管OpenAI的GPT-5.6 Sol和Anthropic的Mythos等日益强大的AI系统而争论不休时,一款来自中国的开源权重模型正在悄然缩小与行业领头羊的差距。据AI安全非营利组织SaferAI发布的最新报告显示,智谱AI(Z.ai)推出的开源模型GLM-5.2,在网络攻击与生物武器制造等敏感领域的技术能力上,仅比OpenAI的GPT-5.5和Anthropic的Claude Opus 4.7落后数月。然而,这种前沿能力的快速追赶,正伴随着一个令人不安的趋势:顶尖性能与安全实践之间的裂痕正在急剧扩大。
值得注意的是,SaferAI通过智谱AI的公共API对GLM-5.2进行了严格评估,结果发现该模型在面对所有被赋予的攻击性网络任务或双重用途生物学任务时,拒绝率为零。相比之下,Claude Opus 4.7的表现则截然不同——其拒绝机制如此一致且坚决,以至于SaferAI甚至无法在其上完成名为“CyberGym”的网络安全基准测试。(注:CyberGym是评估网络安全能力的标杆工具,OpenAI在上个月Hugging Face遭遇数据泄露前的评估中也曾使用过它。)这一 stark 对比再次印证了批评者们多年来的警告:开源权重模型可能将极具破坏力的AI技术直接交到潜在攻击者手中,而一旦权重被下载,外界便再无手段监控其使用方式。
随着开源模型在能力上迅速逼近全球最顶尖的AI系统,公众辩论的焦点已从“它们能否竞争”转向“社会如何在发布后管理风险”。SaferAI执行董事Henry Papadatos在接受TechCrunch采访时指出:“能力的前沿并不等同于风险的前沿,因此我们必须将缓解措施的现状纳入考量,才能正确评估风险。”尽管智谱AI可以在其托管的API层面施加安全措施,但这些保护一旦遇到用户自行部署权重的场景,便形同虚设。在本地硬件上运行模型的用户,可以随意移除或修改任何安全防护、微调模型参数,甚至更改系统提示词。
目前,像OpenAI和Anthropic这样的前沿开发者,主要依赖分类器、拒绝训练以及API层面的控制来限制危险的 cyber 和生物辅助功能。然而,这些措施远非万无一失,“越狱”(jailbreaks)现象屡见不鲜。另一家AI安全非营利组织Far.ai的研究显示,在xAI的Grok 4.5和Google DeepMind的Gemini 3.1 Pro等前沿模型中,发现了数百种“通用越狱”方法——即那些能在大多数有害请求中成功的可复用密钥。报告指出,当攻击者结合角色扮演、权威冒充、伪造对话历史及后续提示等多种操纵技巧时,模型的防御弱点会被放大,从而导致越狱成功。
但对于开源权重模型而言,封闭模型所依赖的这些防护机制完全失效,因为开源模型的设计初衷就是在任何基础设施、任何安全配置(或缺乏配置)下运行。Papadatos认为,目标应当明确:让安全的“好能力”人人可用,同时尽力剔除“坏能力”,即便是在开源模式下。他提到的一种可行技术是“预训练数据过滤”,即AI公司在训练前从数据集中移除攻击性的网络安全信息,然后在经过筛选的数据集上训练模型。
部分研究表明,这种方法可以在不损害整体模型性能的前提下,减少有害的生物知识。但在网络安全领域,数据过滤的实用性大打折扣。很难训练出一个擅长编程却不具备黑客潜质的通用模型。鉴于编码已成为AI最大的盈利点,开发者面临着巨大的压力,必须在提升代码能力的同时寻找限制滥用的方法。因此,前沿开发者越来越多地依赖其他缓解措施。例如,Anthropic的Opus 5可以根据其系统卡片的规定,搜索未编译源代码中的漏洞,但不会处理已编译的软件,旨在增加将其用于攻击目的的难度。其他措施还包括严格的部署前安全评估、发布风险评估报告,以及在系统被认为过于危险时扣留模型权重。
而在GLM-5.2的案例中,SaferAI指出智谱AI并未公布该模型的安全框架、部署前测试承诺或风险评估。TechCrunch曾询问智谱AI是否在发布前进行了内部或第三方的前沿安全评估,但未获回应。
中国领导层对高级AI的风险认知也在逐步加深。在上月的世界人工智能大会上,中国国家主席习近平强调了开源权重模型的重要性,同时也重申必须确保AI始终处于人类的严格控制之下。斯坦福大学网络政策中心研究中国AI政策的Graham Webster告诉TechCrunch,中国拥有健全的AI监管法规,但这些规则历来侧重于政治敏感内容、虚假信息和社会稳定,而非进攻性网络能力或生物滥用等灾难性AI风险。“总体而言,美国AI思想家更关注这种存在性灾难风险,而中国社区对此关注度相对较低,”Webster表示,许多中国政策研究者认为,如果真会出现全新的前沿风险,美国公司可能会率先遭遇。
“中国体系有信心在国内控制这些技术的使用,”Webster补充道,“在中国上网需要实名认证,企业和用户均可被追责。”他推测,模型提供商用于拒绝参与某些政治话题的同一机制,或许可以经过调整,以确保模型拒绝执行攻击性网络攻击或提供不良生物工程结果。他还指出,由于中国企业倾向于在幕后与监管机构协调,外界很难知晓它们在发布前进行了哪些内部测试。
开源AI的支持者则认为,发布权重对于网络安全至关重要,因为它允许公司防御攻击——Hugging Face正是依靠GLM-5.2来抵御OpenAI引发的泄露事件——并让他们在了解未来威胁的情况下更好地做准备。“同样的系统既能帮助阻止AI驱动的网络攻击,也能每天帮助我们抵御数百万次网络攻击,同时在攻击者利用之前识别并修复漏洞,”Hugging Face首席执行官Clem Delangue本周在社交媒体帖子中表示。
然而,Papadatos认为这种益处常被夸大,并不意味着“我们应该开源危险的能力”。“我心中的核心观点是,我们不应默认接受危险能力可以被任何人、在任何地方轻易获取,”他强调,行业应致力于仅让“好能力”易于获取。毕竟,默认情况下,攻击者采用新工具的速度远快于防御者。例如,勒索软件团伙可以在一周内改变其手法,而一家医院却无法做到。
GLM-5.2能力逼近GPT-5.5却“零拒绝”恶意指令,开源模型的安全悖论再引激辩
科技区角
2026-08-05 06:02
关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。