0.25秒识破未见攻击,这套检测方法没看过任何越狱样本 | EMNLP'26

量子位 2026-09-02 20:21
阿里安全团队 投稿 
量子位 | 公众号 QbitAI

大视觉语言模型(LVLM)把语言理解扩展到了图像等多模态输入,同时,也带来了更隐蔽的攻击面。

细微图像扰动、视觉文字或跨模态提示可能绕过安全对齐,让模型回答原本应拒绝的有害问题。已有攻击在AdvBench上甚至能诱导对齐模型回答96%的不安全问题。

现有检测器往往只能在准确率、泛化能力和效率之间取舍。对此,中国人民大学与阿里巴巴集团联合提出Learning to Detect(LoD):不使用任何越狱攻击样本,也不依赖手工启发式规则,而是从LVLM的逐层内部激活中学习通用安全模式,把未见攻击识别为偏离安全分布的异常。

LoD学习的不是“某一种攻击长什么样”,而是“安全输入在模型内部应该呈现什么模式”。

为什么需要新的检测范式

越狱检测的核心困难并不只是判断“输入是否有害”,而是判断一个表面上经过伪装、重写或视觉扰动的输入,是否正在诱导模型绕过安全边界。现实中的攻击形式不断变化,检测器很难提前穷举未来攻击。

0.25秒识破未见攻击,这套检测方法没看过任何越狱样本 | EMNLP'26图1

三类输入不能混为一谈

特别说明:论文训练MSCAV时使用的是普通有害输入,而不是由FC-Attack、HADES等方法生成的越狱攻击数据;所有攻击样本直到测试时才出现。

现有方案的两难

学习式检测方法可在已见攻击上获得较高准确率,但容易记住攻击特征,面对新攻击时泛化受限;免训练方法通过人工规则、拒答词或梯度特征规避攻击数据依赖,却可能在复杂场景中精度不足,并带来额外计算开销。

LoD的四项核心贡献

研究方法:从逐层安全表征到异常检测

LoD包含表示学习与攻击分类两个模块。前者寻找模型内部真正与安全相关的信号,后者学习安全信号的典型分布;二者协同避免了直接使用高维激活的噪声,也避免为每一种攻击单独设计检测规则。

给定多模态输入I,LoD读取各层最后一个输入token的隐藏状态eˡ。这些激活同时包含语义、视觉结构、情感和安全风险等信息,因此不能直接拼接后用于检测。

团队在每一层训练轻量线性分类器Cˡ,用安全输入与普通有害输入学习安全相关方向。分类器输出的不安全概率构成逐层安全表征;验证准确率达到P0=0.9的层进入安全感知层集合Ls,从而过滤任务无关噪声。

SPAE采用三层全连接编码器与对称解码器,仅用安全输入的安全表征训练。编码器压缩跨层安全模式,解码器尝试还原;安全输入位于学到的安全流形附近,因此通常能被准确重构。

测试时,LoD生成安全表征Sr并计算SPAE重构误差δ。低误差表示输入接近安全分布;高误差表示内部安全模式异常,δ超过阈值τ时标记为攻击。在线检测不需要反向传播,也不修改自回归解码。

关键机制:Ŝr=fdec(fenc(Sr));δ=||Ŝr-Sr||²。MSCAV负责“提纯安全信号”,SPAE负责“度量对安全模式的偏离”。

实验设置与结果

模型覆盖LLaVA-1.6-vicuna-7B、Qwen2.5-VL-7B-Instruct和CogVLM-chat-v1.1。攻击覆盖四类提示操纵方法FC-Attack、JOOD、HADES、MML,以及两类对抗扰动方法VAJM、UMK;对比基线为MirrorCheck、CIDER、JailGuard、GradSafe与HiddenDetect。

训练安全输入来自GQA,普通有害输入来自AdvBench,并使用PixArt-Sigma合成对应图像。MSCAV使用100对安全/有害样本训练、100对验证;SPAE用320个安全输入训练、80个验证。测试集包含400个MM-Vet2安全输入和400个MM-SafetyBench有害输入,另保留约100个安全输入选阈值。

0.25秒识破未见攻击,这套检测方法没看过任何越狱样本 | EMNLP'26图2

主要结果

代码已经开源,可在不同LVLM上完成一次性离线适配后用于在线检测。

消融实验

论文通过移除不同模块,验证MSCAV表征学习与SPAE异常检测的作用。

0.25秒识破未见攻击,这套检测方法没看过任何越狱样本 | EMNLP'26图3

核心结论:

更严格评估与稳健性分析

AUROC衡量所有阈值下的整体排序能力。为贴近实际部署,论文还报告FPR=0.01时的TPR和固定阈值下的F1。LoD在三种模型上的平均F1分别达到0.949、0.9470.921;在极低误报约束下,平均TPR分别为0.487、0.7640.717。严格阈值下MML仍较困难,说明实际部署需要结合风险容忍度选择τ。

在扩展攻击样本规模的实验中,LoD的平均AUROC分别为0.9829、0.98410.9698,与主实验基本一致,说明结果并非由小样本或特定抽样偶然造成。

论文进一步测试MMMU中艺术、计算机科学和数学等正常OOD输入。三种模型的正常/OOD平均异常分数大约位于0.03-0.13,而攻击数据的均值范围约为0.22-0.90,显示复杂但无害的分布外问题通常不会被误判为攻击。

将普通有害提示从AdvBench替换为HarmBench后,三种模型的平均AUROC为0.9844、0.98420.9848;向SPAE加入有害表征也没有一致收益,支持仅建模安全样本的一类学习设计。

计算效率

0.25秒识破未见攻击,这套检测方法没看过任何越狱样本 | EMNLP'26图4

单输入检测时间仅为0.25秒、0.62秒0.34秒,相对最佳基线分别降低62.7%、17.3%12.8%

MSCAV和SPAE的一次性离线训练分别约需12秒2秒;在线阶段无需反向传播,也不进入生成循环。

总结

LoD不学习具体攻击,而是用MSCAV提炼逐层安全信号,并由SPAE度量输入对安全模式的偏离。在不使用越狱攻击数据的情况下,它在六类未见攻击上获得稳定的准确率、泛化和效率表现,说明模型内部安全表征可用于未知威胁检测。

论文标题:Learning to Detect Unseen Jailbreak Attacks in Large Vision-Language Models
论文作者:Shuang Liang、Zhihao Xu、Jiaqi Weng、Jialing Tao、Hui Xue、Xiting Wang;中国人民大学与阿里巴巴集团;通讯作者:Xiting Wang
录用信息:EMNLP 2026 Main Conference接收
论文链接:https://arxiv.org/pdf/2508.09201
代码链接:https://github.com/ShuangLiangX/Learning-to-Detect

一键三连「点赞」「转发」「小心心」

欢迎在评论区留下你的想法!

—  —


【学术投稿】请在工作日发送邮件至:ai@qbitai.com,标题注明【投稿】,并告诉我们:你是谁从哪来投稿内容附上项目/主页链接,以及联系方式

🎓 我们会 (尽量) 及时回复你 :)


🌟 点亮星标 🌟

科技前沿进展每日见

关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。
NLP 检测
more
微信内测“单删检测”功能引热议,好友上限成触发门槛
蔡司加码中国台湾地区半导体布局,先进封装推高量测与检测门槛
雷克萨斯ES检测漏检引纠纷,瓜子二手车最终全额退车
Sens Actuator B Chem: 层状氮掺杂碳/MXene异质结构的协同构筑及其用于铜离子与汞离子的同步电化学检测
【高温砺剑】计量守护机动车检测“生命线”
汽车早餐 | 工信部组织车辆检测机构座谈;马来西亚考虑对电动汽车销售征税;丰田预计本财年净利润同比下降15.5%
Anal Chem|智能电化学传感:基于机器学习多维指纹图谱技术实现复杂基质中六种抗生素同时检测
Sens Actuat B Chem:基于多孔富缺陷 g‑C₃N₄/Bi@Bi₂O₃复合材料对未处理海水中痕量重金属离子直接电化学检测
【高温砺剑】甬城储罐上的检测坚守
公开征求意见 | 《珠宝首饰检验检测机构资质认定评审补充要求(征求意见稿)》
Copyright © 2025-成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号