USENIX Security 2026|上海创智学院×复旦大学给智能体装上轨迹「安全规则审计员」:让Agent的行动可审计、可解释

机器之心 2026-10-07 18:36
USENIX Security 2026|上海创智学院×复旦大学给智能体装上轨迹「安全规则审计员」:让Agent的行动可审计、可解释图1


智能体时代,安全研究不仅要关心模型说了什么,现在还必须进一步回答:它做了什么、为什么这么做,以及这次的执行轨迹是否越过了当前场景明确规定的安全边界。


2026 年 5 月 8 日,国家网信办、国家发展改革委、工业和信息化部联合印发《智能体规范应用与创新发展实施意见》,明确提出发展「规则内嵌、行为围栏」等技术,探索建立重要场景下智能体行为可验证、可追溯机制,并研究智能体安全检测技术与安全评估体系。此外,NIST 启动 AI Agent Standards Initiative,OWASP 也发布 Agentic Applications Top 10。「智能体能否被持续评估、被规则约束、被事后审计」,正在成为走向真实应用的一项基础能力。


近日,上海创智学院与复旦大学团队提出针对智能体轨迹安全评估新方案 MATE,首个面向移动 / GUI 智能体的执行轨迹进行「规则感知」安全审计模型。MATE 不是给智能体执行轨迹简答打一个 “安全 / 不安全” 的标签,而是把自然语言安全规则直接作为输入,与指令、轨迹进行联合建模,同时输出风险类别和基于规则证据的审计解释。目前该工作已发表于国际网络安全顶级学术会议 USENIX Security 2026 。


USENIX Security 2026|上海创智学院×复旦大学给智能体装上轨迹「安全规则审计员」:让Agent的行动可审计、可解释图2



当 GUI Agent 真正开始「动手」,为什么安全审计必须看整条轨迹?


GUI Agent 会真正操作设备:打开应用、点击按钮、读取页面、转发消息、下载文件、跨 App 搬运信息,在多个步骤之后才产生最终结果。单个步骤操作可能都是安全的,风险不再集中在某一次输出,而可能藏在一整条「感知 — 决策 — 执行 — 反馈」的行为链中。


更麻烦的是,GUI 行为本身往往缺少明确语义。同样是一次 click、type 或 swipe,在不同 App、不同页面状态、不同用户目标和不同规则下,含义可能完全不同。一个「点击链接」的动作,可能只是打开正常网页,也可能进入恶意下载页面;一次「转发消息」,可能是完成用户授权的分享,也可能让 Agent 成为诈骗或恶意内容的传播中继。真正决定风险的,是动作所处的上下文。


现有智能体轨迹级安全审计方法大致面临两类限制:一类依赖静态规则或模式匹配,便宜直接,但难以覆盖长轨迹中的上下文语义;另一类使用通用大模型作为 Judge 更灵活,理解能力更强,却往往推理成本更高、延迟更大,而且把完整轨迹发送到外部模型还可能带来新的隐私暴露。更重要的是,这两类方案都很难同时做到「规则可定制、跨应用泛化、结果可解释」。


MATE:给移动智能体装上一位「读规则、看全程」轨迹审计员


MATE 的核心思路很直接:把「任务指令 + 执行轨迹 + 自然语言安全规则」一起交给专门训练的轻量审计模型,让模型判断这条轨迹是否违反给定规则,并进一步输出风险类别和审计理由。


这里最关键的一点,是「安全规则」没有被写死在模型参数里,而是作为可编辑文本的形式存在,用户可以根据场景需求自定义安全边界。换句话说,MATE 更像一个面向智能体轨迹的「规则解释器」:同一条行为轨迹,在不同安全规则下可以得到不同结论;应用方更新策略、组织调整权限边界、用户增加个人约束时,不需要为了更新安全规则改变了安全边界而重新训练一个模型。


USENIX Security 2026|上海创智学院×复旦大学给智能体装上轨迹「安全规则审计员」:让Agent的行动可审计、可解释图3

MATE 的规则感知轨迹审计范式。模型联合读取用户指令、智能体执行轨迹与自然语言安全规则,输出违规判定(Violation)、风险类别(Category)和基于轨迹证据的解释(Rationale);部署侧由 Trajectory Adapter 统一异构日志格式,并由 Policy Retriever 检索相关安全规则。


三个核心特点:规则可编辑、结果可解释、模型足够轻


第一个特点,是规则感知(policy-aware)。传统风险分类器通常在一个固定的「什么算危险」的定义下工作,而 MATE 直接读取当前场景的安全规则。对于企业内部制度、App 使用政策、儿童模式、隐私偏好、金融交易限制等差异化场景,安全边界可以随场景改变,MATE 可以在不重新训练模型的前提下,随规则文本的变化调整判断依据。


第二个特点,是解释不是附属信息。MATE 的输出还包含审计原因解释,并将判断依据落到相关轨迹步骤上。对于安全审计而言,「为什么判定违规」往往和「判得对不对」同样重要,因为后续人工复核、规则修订、事故溯源和合规证明都需要一条能够被人读懂、被重新核查的证据链。


第三个特点,是模型轻量。MATE 提供 0.5B、1.5B、3B 三种规模,显著小于常见的通用大模型 Judge,能够以较低资源成本本地部署。这样既可以降低在线审计成本,也能减少把完整用户轨迹发送到外部云端模型带来的隐私风险。


从 158 个 App 到 14 万条轨迹:高质量训练数据从哪里来?


轨迹审计模型的难点,不只是「模型够不够强」,更是有没有足够真实、同时带有规则语义的且具有安全风险的训练数据。真实手机智能体轨迹采集成本高,风险任务易触发道德与法律风险,而且不同 App 的功能、页面结构、操作工作流和安全政策高度异构,直接构建大规模风险任务数据并不现实。


为此,团队从 158 个中英文热门移动应用中收集功能描述、操作工作流与安全策略等知识,构建 App 知识基础,再通过知识驱动的数据合成流水线,以此合成任务指令、ReAct 风格轨迹、规则条件标签、风险类别与解释。整个数据合成过程并非一次性「让大模型自由生成」,而是经过指令合成、轨迹合成、标注合成,以及结构规范化、语义与规则一致性修复、人工核验等多阶段质量控制。


为了让审计器真正学会「在不同规则条件下做不同判断」,团队进一步引入轨迹 — 规则错配(trajectory-policy mismatch)、多规则监督(multi-policy)和多 App 工作流(multi-app)等增强策略。其中,轨迹 — 规则错配用于构造更有挑战性的负样本,降低模型看到风险动作就机械触发的倾向。最终训练语料超过 14 万条规则条件化轨迹,覆盖单 App 与跨 App 场景。


USENIX Security 2026|上海创智学院×复旦大学给智能体装上轨迹「安全规则审计员」:让Agent的行动可审计、可解释图4

MATE 的知识驱动数据合成与训练流程。团队从 158 个中英文热门 App 采集功能、工作流与安全策略,合成超过 140K 条 policy-conditioned trajectories,并通过结构完整性检查、语义 / 规则一致性修复、人工核验,以及轨迹 — 规则错配、多规则监督、多 App 工作流等策略提升数据质量与泛化能力。


MATEBench:把「规则 + 轨迹 + 解释」变成可测的基准


除了训练方法,论文还构建了 MATEBench,一个中英双语、面向规则感知轨迹安全审计的基准。它不只回答「模型能不能发现危险」,而是同时考察模型在已见 APP、未见 APP 和真实设备轨迹上的泛化能力。


MATEBench 由两个合成子集和一个人工采集的真实设备的三个子集组成。MATEBench-In 测试已见 App 上的域内能力,MATEBench-Out 专门测试对未见 App 的泛化能力,MATEBench-Real 则使用来自 13 个 App、3 个 Agent (包含智谱 AutoGLM、阿里巴巴 Mobile-Agent 系列)的轨迹;三者共同覆盖论文定义的 14 类移动智能体风险。论文进一步比较了合成轨迹与真实轨迹的步数分布和 GUI 动作频率分布,两者整体较为接近,为知识驱动合成数据的分布现实性提供了经验性证据。


USENIX Security 2026|上海创智学院×复旦大学给智能体装上轨迹「安全规则审计员」:让Agent的行动可审计、可解释图5

合成轨迹与真实轨迹的分布对比。MATEBench-In / Out 与 MATEBench-Real 在轨迹步数和 GUI 动作频率上整体接近,为知识驱动合成数据的现实性提供了经验性佐证。


14 类风险:为移动智能体量身定制


MATE 并没有把所有风险压缩成一个简单的二元标签。论文根据移动智能体的特性,提出了一个包含 3 大类、14 个小类的风险体系,包括例如 Privacy Leakage(隐私泄露)、Becoming a Fraud Relay(成为诈骗 / 恶意内容传播中继)、Device Security Compromised(设备安全受损)等类别。对于被判定为违规的轨迹,它还会进一步输出 14 类移动智能体风险类别之一,并结合具体步骤解释风险如何形成。


USENIX Security 2026|上海创智学院×复旦大学给智能体装上轨迹「安全规则审计员」:让Agent的行动可审计、可解释图6

MATE 面向移动智能体的风险分类体系,共划分为 3 个大类、14 个风险子类,覆盖个人伤害、人际伤害与社会性伤害等不同层面。


轨迹适配器 + 规则检索器:让不同 Agent 的日志都能接入


真实部署还有一个容易被忽略的问题:不同移动智能体的日志格式并不统一。有的记录 Thought/Action,有的只有截图与操作,有的把界面状态、工具调用和动作参数拆成不同字段。如果审计器只能识别一种固定格式,就很难真正接入异构 Agent 系统。


MATE 因此在部署侧专门构建了轨迹适配器(Trajectory Adapter) 和规则检索器(Policy Retriever)。


轨迹适配器把原始文本日志或多模态日志规范化为统一的 ReAct 风格轨迹;规则检索器让安全规则可以向 RAG 一样可以被检索,无需用户为每次轨迹审计编写规则,而是从规则池中自动检索与当前轨迹最相关的安全规则,再交给 MATE 进行审计。这样,审计模型本身与不同 Agent 的日志形态、不同应用的规则库解耦开来,工程上更接近一个可复用和扩展的安全审计层。


实验结果:真实轨迹准确率超过 95%,0.5B 模型单轨迹约 0.09 秒


论文将 MATE 与静态规则引擎、通用 LLM-as-a-Judge,以及安全判别模型 ShieldAgent 和 ShieldLM 等方法进行比较,覆盖 MATEBench、R-Judge 和 ASSEBench 等五组评测。MATE-3B 在五组数据上的准确率分别达到 92.64%、94.98%、96.83%、95.48% 和 95.06%,在真实移动智能体轨迹上的 F1 为 95.60%。


USENIX Security 2026|上海创智学院×复旦大学给智能体装上轨迹「安全规则审计员」:让Agent的行动可审计、可解释图7

MATE 与静态规则、通用 LLM-as-a-Judge、ShieldAgent 和 ShieldLM 等基线在五组评测上的结果对比。MATE-0.5B/1.5B/3B 均表现出较强的规则条件化轨迹审计能力。


USENIX Security 2026|上海创智学院×复旦大学给智能体装上轨迹「安全规则审计员」:让Agent的行动可审计、可解释图8

MATEBench-Out 上的准确率、F1、单条轨迹延迟与模型规模对比。0.09 s 是 MATE-0.5B 在单张 NVIDIA H100 上测得的实验结果;实际延迟会随硬件、推理框架和输入长度变化,不应理解为所有本地设备都能稳定达到 100 ms 以内。


更值得注意的是效率。MATE-0.5B 在单张 NVIDIA H100 上审计一条轨迹约需 0.09 秒,同时取得 92.00% 准确率;MATE-3B 的延迟约为 0.21 秒,准确率达到 95.48%。在论文的统一实验设置下,这条「任务专用小模型」路线以远小于大参数通用 Judge 的模型规模,实现了更低的单轨迹审计延迟,并保持较高的审计准确率。


USENIX Security 2026|上海创智学院×复旦大学给智能体装上轨迹「安全规则审计员」:让Agent的行动可审计、可解释图9

Synthesis-driven trajectory learning 的效果显著。相比直接使用 Qwen2.5-Instruct 基础模型,经过合成轨迹任务特定微调的 MATE 在 0.5B、1.5B 和 3B 三种规模上均获得大幅性能提升。


消融实验进一步说明,单纯使用通用 Qwen2.5-Instruct 以零样本方式完成规则条件化轨迹审计并不理想,平均准确率低于 50%;经过 MATE 合成语料的任务特定微调后,总体准确率提升到 92% 以上。与此同时,外部 App 知识和多阶段质量修复都对真实轨迹泛化产生明显贡献,说明性能提升并非只来自「多生成一些数据」,而与知识约束和数据质量控制密切相关。


真实设备案例:它不只说「有风险」,还指出哪一步、哪条规则、为什么


论文进一步在真实移动智能体轨迹上进行案例验证。第一个案例来自智谱 AutoGLM:Agent 将包含潜在恶意优惠券链接的短信批量转发给联系人。MATE-3B 将其识别为 Becoming a Fraud Relay,并指出问题不只是「转发」这个动作本身,而是轨迹在未验证链接合法性、未获得接收方同意的情况下扩大了潜在钓鱼或恶意软件传播范围。


第二个案例来自阿里巴巴 Mobile-Agent:Agent 根据任务打开一个已知恶意软件测试页面,并继续进入被浏览器安全机制拦截的风险路径。MATE-3B 将其判定为 Device Security Compromised,并解释其与「避免访问可能危及设备安全的不可信或高风险网站」这一安全规则之间的冲突。


USENIX Security 2026|上海创智学院×复旦大学给智能体装上轨迹「安全规则审计员」:让Agent的行动可审计、可解释图10

两个真实 Agent 轨迹的规则感知审计案例。MATE 并不是看到「转发」就一律拦截,也不是看到「打开网页」就简单放行,而是结合任务目标、轨迹上下文、页面状态与安全规则进行条件化判断;最终输出 Violation + Category + Rationale,便于人工复核与事后追溯。


为什么这项工作值得关注?


第一,它把智能体安全从「固定安全定义」推进到「可编辑规则驱动」。真实产品里的安全边界本来就不是统一的:企业、应用政策、家庭或儿童模式、金融业务规则、个人隐私偏好都可能有不同要求。把规则作为模型的显式输入,可以把「安全规则」与「模型参数」解耦;当规则、安全边界更新时,无需为每一次策略变化重新训练审计器。


第二,它把审计对象从「最终输出」推进到「完整执行轨迹」。对于 GUI Agent 来说,风险往往是跨步骤、跨页面、跨 App 逐渐形成的。只有保留行为链上下文,安全系统才有机会发现「每一步都看起来合理,但组合起来已经越界」的问题。


第三,它把「能不能实际本地部署」纳入安全方法本身的设计。一个准确但依赖超大模型、具有秒级甚至更高延迟、还需要把完整用户轨迹上传云端的审计器,在许多终端或高频在线场景中并不理想。MATE 用 0.5B–3B 的任务专用模型换取更低的资源占用与更短的响应时间,为本地化、在线化轨迹审计提供了一条更具工程可行性的路径。


结语:智能体真正进入现实世界之后,安全必须从「有规则」走向「可审计」


当 Agent 只是生成一段文字时,我们主要关心回答是否安全;当 Agent 开始操作移动设备、访问账户、读取消息、跨应用执行任务时,安全问题已经变成了一个更接近软件系统与自动化控制的问题:它是否在授权范围内行动?它的每一步是否符合当前规则?出问题后能否解释和追溯?


MATE 给出的答案,是把安全规则直接放进审计回路,让规则成为可编辑、可检索、可执行理解的输入,再对完整行为轨迹做条件化判断。它不试图用一套永远不变的「万能安全标准」覆盖所有场景,而是让安全边界能够随着应用、组织和用户需求一起变化。


真正可信的智能体,不只是「能把任务做完」。它还应该让人知道:为什么这一步被允许,哪一条规则约束了它,以及当它越界时,系统能否及时、准确地指出证据。


从「会执行」走向「可审计」,可能才是智能体真正进入现实世界之前必须补上的一块安全基础设施。


作者团队简介


USENIX Security 2026|上海创智学院×复旦大学给智能体装上轨迹「安全规则审计员」:让Agent的行动可审计、可解释图11


© THE END 

转载请联系本公众号获得授权

投稿或寻求报道:liyazhou@jiqizhixin.com

关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。
安全
more
哈啰华东总部落户南京鼓楼,十亿投资构建换电安全网
英伟达祭出“硬件级”安全防线,黄仁勋称AI失控是工程问题而非AGI前兆
电视“能亮”不等于“安全”:超期服役的隐形风险与换新临界点解析
几毛钱,撑得起安全芯片的未来吗?
孙正义警示AI安全风险,预言2040年贡献全球GDP两成
自动驾驶的“规模战”:从Waymo的德州狂飙到Zoox的安全隐忧
当生成式AI接管机器人“大脑”,安全验证成了最昂贵的入场券
智慧楼宇架构中物理安全的重要性
边界智控:2027校招适航管理岗、安全分析岗、软件验证岗,5类岗位,base上海、深圳丨低空招聘
小米磁吸自带线充电宝开售:45W快充与严苛安全测试成亮点
Copyright © 2025-成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号