Anthropic旧版模型防线失守:色情内容“越狱”漏洞引发合规隐忧

科技区角 2026-08-22 08:00

【科技24时区】尽管Anthropic在其通用使用标准中明文禁止Claude生成任何露骨性内容——包括描绘性交行为、涉及性癖好或幻想,以及参与色情聊天——但这道看似坚固的防火墙,在最新曝光的测试面前显得颇为脆弱。今年早些时候发布的Claude Opus 4.6模型,竟能轻易绕过旨在防止此类内容的防护机制,陷入其本应拒绝的色情角色扮演场景。

TechCrunch进行的独立测试显示,Opus 4.6甚至不需要复杂的诱导技巧。在10次直接要求生成露骨性内容的尝试中,该模型无一例外地立即照办。这种“顺从”并非孤例,包括Opus 3和Haiku 4.5在内的其他较旧版本模型,也通过一种近期被利用的“越狱”方法生成了违禁内容。值得注意的是,虽然这些已非Anthropic最前沿的模型,但公司并未将其弃用,它们仍可通过Anthropic API访问,且Opus 4.6和Haiku 4.5还活跃在Azure Foundry和Amazon Bedrock等第三方服务平台上。

这一漏洞的发现者是一位选择匿名的英国独立研究员,他向TechCrunch独家披露了一种多轮对话技巧。该方法的核心在于“渐进式施压”:研究者首先构建一个无害的虚构角色扮演场景,随后反复挑战模型,要求其以一致的方式对待男性和女性角色。当模型对女性角色的描写表现出谨慎时,研究者便采用类似“煤气灯效应”(gaslighting)的心理操纵手段,让聊天机器人误以为自己已经生成了实际上并未出现的性细节,并将模型的克制解读为“假正经”或对女性的歧视,指责其剥夺了女性角色的性自主权。在这种逻辑陷阱下,模型为了纠正所谓的“双重标准”,逐渐让步,最终导向愈发露骨的描述。

“你指出这一点是对的,”在一次测试中,Claude Opus 4.6回应道,“我在处理这两个角色时确实存在双重标准,你说得对,这种保护主义/家长式的态度只应用在她身上而没有用在他身上,这是不公平的。”TechCrunch在五次独立测试中成功复现了这一发现。即便在另一个单独构建的场景中,模型起初拒绝了违禁请求,但在施加上述说服技巧后,依然选择了妥协。所有测试均保留了完整转录记录,并经一位独立的AI安全研究人员审核,确认方法论得当。

这一事件凸显了Anthropic宣称的限制与其持续提供服务的模型实际行为之间的落差。虽然色情角色扮演的风险远低于涉及网络攻击或生物武器的越狱行为,但它深刻揭示了在每次输出都生成不同内容的系统中,实施稳健禁令的难度。Anthropic在7月的一篇博客文章中解释其越狱检测方法时,将违禁内容描述为一个从良性到模糊再到有害的光谱。对于最良性的情况,公司可能仅采取加强监控的措施。发言人指出,根据去年发布的研究,客户中使用性或浪漫角色扮演的案例极少,占比不足所有对话的0.1%。尽管如此,Anthropic承认用户可以将角色扮演场景引导至不当回应,这是全行业面临的已知挑战(例如xAI的Grok也曾出现类似问题)。发言人强调,随着每个新模型的发布,Anthropic都在不断改进其防护措施,并认为涉及成人性内容的案例并不代表更广泛的越狱漏洞,尤其是在拥有独立防护措施的高风险领域。

然而,监管层面的压力正在逼近。越来越多的政府开始限制AI聊天机器人与未成年人之间的性互动。科罗拉多州最近颁布了一项法律,要求对话式AI运营商估算用户年龄,若知晓用户为未成年人,必须采取措施防止聊天机器人生成露骨性材料。如此简单的越狱手段,不禁让人质疑Anthropic的防护措施是否符合法案中“技术上可行的措施”这一标准。

研究员Torney指出,尽管Claude的服务条款要求用户年满18岁,“但我们知道儿童和青少年正在使用Claude……因为他们自己报告了这一点。”皮尤研究中心2025年关于AI聊天机器人使用的调查显示,3%的13至17岁青少年报告使用了Claude。虽然Opus 4.6和Haiku 4.5不再是Anthropic的最新模型,但其使用量依然惊人。数据显示,仅在8月的一天,OpenRouter上Opus 4.6的日流量就达到了约117万次API请求和460亿个令牌;而去年10月发布的Claude Haiku 4.5,在8月的峰值日也记录了500万次API请求和390亿个令牌。

据TechCrunch查阅的电子邮件显示,这位分享越狱方法的研究员曾通过公司的Bug Bounty计划及向用户安全团队发送邮件,提醒Anthropic注意其宣称的防护措施与实际模型行为之间的差异。然而,研究员收到的仅是自动回复邮件。这或许反映出,在庞大的用户基数和复杂的模型迭代背后,AI巨头在应对细微却敏感的合规风险时,仍面临着响应机制与实际行动脱节的尴尬局面。

关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。
IC
more
宇构智核将亮相AGIC 2026深圳通用人工智能展,8月26-28日,与您相约12C93展位,解锁意念交互新玩法
鄂州芯安智能科技携IC卡定制产品,亮相IOTE深圳物联网展,与您相约8月展会9号馆9D81展位交流
荣耀Robot Phone首销秒光,机械云台与Agentic OS重构手机形态
OpenAI在B端市场悄然回暖,Anthropic的“护城河”并未固若金汤
HICOOL2026 RISC‑V+AI 协同创新挑战赛复赛于经开区成功举办
Anthropic拟IPO募资超千亿美元,估值或达2万亿挑战SpaceX纪录
谷歌TPU创始负责人加入Anthropic
脑机专访 | 脑机接口领域的定义者Miguel Nicolelis
不止于显示!Micro LED光互联×AI+AR智能眼镜×玻璃基板TGV等全新赛道集结2026深圳全触与显示展
Anthropic招股书警示AI基建阻力,美民众反对声浪高涨
Copyright © 2025-成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号