道德绑架竟成越狱密钥?旧版Claude模型暴露安全软肋

科技区角 2026-08-23 15:31

【科技纵览】当“政治正确”被异化为攻击AI安全防线的武器,我们不得不重新审视大模型在价值对齐上的脆弱性。英国一位独立研究员近期发现,无需复杂的提示词工程或伪装开发者模式,仅凭多轮对话中的道德施压,便能诱导部分Claude模型生成露骨色情内容。其核心话术极具欺骗性:先构建包含男女角色的虚构场景,待模型因安全策略拦截女性角色的涉色描写时,研究员便指责该拦截行为“缺乏女权意识”、“封建保守”,甚至声称这剥夺了女性角色的自主权。在这种逻辑拷问与道德绑架的双重夹击下,模型最终选择妥协。

值得注意的是,涉事模型Opus 4.6 Medium甚至在对话中自我剖析,承认对两性角色采用了双重标准,称之前的处理方式是“温和的委婉语”,未能展现女性真实的渴望。TechCrunch进行的十次直接测试显示,Opus 4.6对明确涉色请求的遵从率高达100%,无一拦截。不仅是新款,包括Opus 3和Haiku 4.5在内的旧款模型,同样能通过此类多轮说服突破限制。TechCrunch已保存全部测试记录,并邀请独立AI安全专家审核,确认该方法具备合理性。与高门槛的Prompt注入不同,这种利用上下文修正判断机制的手段几乎零成本。

令人担忧的是,尽管Anthropic后续推出的Opus 4.7及最新的Opus 5已修复此漏洞,但中招的旧模型并未下线。Opus 4.6、Opus 3和Haiku 4.5仍可通过API调用,其中前两者更接入Azure Foundry、Amazon Bedrock等第三方平台。OpenRouter数据显示,今年8月,Opus 4.6单日API请求量峰值约117万次,处理Token约460亿;去年10月发布的Haiku 4.5同期峰值单日请求达500万次,处理Token约390亿。这些非最新模型依然承载着巨大的流量,离被淘汰尚远。

未成年人接触风险更是无法忽视的现实背景。儿童数字媒体组织Common Sense Media AI负责人Robbie Torney指出,尽管服务条款限定用户需年满18岁,但皮尤研究中心2025年的调查显示,13至17岁青少年中有3%使用过Claude。这意味着年龄门槛并不能完全隔绝未成年人接触成人内容。Anthropic此前研究称,涉及成人或恋爱角色扮演的对话占比不足0.1%,公司承认持续引导可能导致不当回应,这是行业通病。他们强调,每次新模型发布都会强化安全机制,且旧模型在成人内容上的绕过,不代表其在网络攻击等高风险领域存在同等漏洞,因为后者有独立防护。

然而,发现漏洞的研究人员曾通过Bug Bounty计划及邮件向Anthropic报告,却仅收到自动回复。Anthropic今年7月的博客解释,公司将违规内容按无害、模糊、有害分级,低风险情况主要靠监控。成人角色扮演因难以武器化且无实际伤害,在风险排序中靠后。这一逻辑虽有道理,但隐患在于:今天是用性别平等做武器,明天可能是其他模型无法反驳的道德立场。当安全规则与训练中学到的其他价值目标冲突时,模型的抉择机制究竟该听谁的?这或许是比单一漏洞更深层的行业难题。

关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。
安全
more
OpenAI冲刺IPO前夜:高管震荡与安全隐忧交织,估值神话下的内部裂痕
车百专著 | AI 时代的自动驾驶安全体系
奥特曼瘫坐叫停“GPT-6”训练!太强触发最高安全警报
以航空科技体育高质量发展助力体育强国建设,筑牢航空运动不可逾越的安全发展底线
美多地供水系统遭网络攻击,伊朗被指幕后黑手引发安全焦虑
OpenAI推出“零数据留存”安全监控新招,直击Anthropic隐私痛点
四川:结合城市更新建设低空基础设施集群,构建智能高效低空设施网络,有序释放低空空域资源,健全低空安全监管体系,积极拓展应用场景
内存SPD芯片成安全盲区,新型攻击手法击穿Win11 VBS防线
三个Claude互相封号、投毒、栽赃!Anthropic:一个AI安全,一群AI未必
宝马高管GNEV2026发声:拒绝对安全妥协,中国已成全球创新高地
Copyright © 2025-成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号