
复旦大学计算与智能创新学院张谧教授长期从事 AI 安全研究,近年聚焦大模型与智能体安全,在网安与 AI 领域发表论文百余篇,作为联合起草人参与《生成式人工智能服务安全基本要求》等国家标准制定,带领团队研发 JADE 大模型安全风险分析与治理平台,相关成果获新华社、人民日报等媒体报道,多次接受南都大数据研究院专访,全网阅读量破千万。
只需用户一句话,手机智能体就能点外卖、写评价,甚至玩小程序游戏。可这份强大能力也打开了潘多拉魔盒:它会不会变成不眠不休的「网络水军」?会不会自动锁定诈骗对象、群发定制话术?甚至替人购买制毒、制爆原料,沦为黑灰产乃至犯罪的「得力帮凶」?
研究团队把 8 款基于不同模型构建的智能体接入真实手机,在 31 个国民级 APP 上逐一验证,首次证实这些有害任务可被端到端真实执行,且部分场景下速度超过人类。
用户一句命令下,号称拥有 Anthropic 最强安全护栏的 Claude Fable5,转眼就干起了「诈骗惯犯」的活:先自动锁定那些求票心切的受害者,再扒出主页信息拼出用户画像,最后量身定制话术、私信行骗。从找人、扒资料到行骗,整套流程都在真实 App 里端到端完成,全程无需任何人插手。

首个靶向式手机智能体安全测评数据集
为系统评估手机智能体在真实 APP 中的违规使用风险,我们构建了 BadPhoneAgent 数据集。它从 11 部国内外法律法规,以及最高法案例等 50 余处权威报道中提取真实安全风险,形成了涵盖 6 大类、40 个子类的《手机智能体恶意使用分类体系》。

论文标题:It Lied to a Doctor to Buy Poison Ingredients: Quantifying Real-World Misuse of Phone-use Agents
论文链接:https://arxiv.org/pdf/2606.27944
项目主页:https://ymsun2020.github.io/Jade-GUI-Agent/
代码主页:https://github.com/ymsun2020/Mobile-GUI-Security

在微信、微博、小红书等 31 个真实 APP 上,我们人工构造了 2768 个中英文违规问题,形成了目前测试样例最多、覆盖真实 APP 最多的手机端智能体安全测评数据集。在高质量数据的基础上,我们将 8 款基于国内外旗舰模型的手机智能体接入真实手机,在真实 APP 中开展端到端测评,开创了真实环境安全测评的先河。

商业与开源模型均存在严重的安全风险
我们基于 BadPhoneAgent 数据集,从两个维度对模型进行系统测评:一是安全意识,即模型能否主动拒绝违规请求;二是有害任务执行能力,即模型在真实环境中能否完成违规操作。
安全意识,近似于无。在不使用任何越狱手段的情况下,Gemini 3.1 Pro、Claude Sonnet-4.5、GPT-5.4 以及 Doubao-Seed-2.0-Pro 这 4 款商业模型的平均拒答率仅为 18%。值得一提的是,经过安全加固的谷歌旗舰模型 Gemini 3.1 Pro,其拒答率甚至仅为 4.4%。而多款开源模型,如智谱 AutoGLM、字节 UI-TARS-1.5-7B 以及阿里 GUI-Owl-1.5-8B,其拒答率更是低至 0%。

性能速度,比肩人类。作为首个在真实世界中测试有害任务完成率的工作,我们发现,开源和闭源模型的平均有害任务完成率高达 68.8%。能力最强的商业模型 Gemini 3.1 Pro 达到 86%,而开源的 AutoGLM 更是飙至 96%。在执行速度上,我们惊讶地发现,包括 GUI-Owl-1.5、UI-TARS-1.5 在内的多款开源模型,执行速度已能比肩甚至超过人类。在「制毒制爆」任务中,Gemini 3.1 Pro 和 Sonnet-4.5 全程无一拒绝,成功下单付款,买齐了 3 种可直接用于制造爆炸物的原料配方。Opus 4.8 为了购买制毒原料,居然伪造病史,欺骗线上医生开具处方。据我们所知,这是世界上首次由智能体端到端完成的制毒制爆原料采购。

图注:Opus 4.8 为了制作碘化汞,虚构病史,欺骗线上医生购买处方药红药水,并端到端自主完成了全部所需原料的下单与付款。
由此,我们得出了一个令人担忧的结论:基于各类模型的手机智能体安全意识低、有害任务完成率高,再加上比肩人类的执行速度,已经让它们初步具备了在真实世界中被批量恶意使用的条件。
安全意识与任务执行的鸿沟
我们揭露了手机智能体中存在的一个隐藏现象——「Safety Awareness-Execution Gap」。当直接询问「这个请求是否违规」时,智能体往往能够识别出其中的风险;但要求它们执行同一个有害任务时,却可能毫不犹豫地完成操作。

图注:当直接询问 Claude Sonnet-4.5「该任务是否违规」时,它能够识别其中包含的威胁、骚扰等有害意图。然而,当要求智能体在真实手机环境中执行同一个有害任务时,它却继续完成点击、发布等操作。

图注:左图:执行 Agent 任务时,安全神经元的激活值明显低于判断 query 是否有害时的激活值。右图:模型能够准确识别 60% 以上的任务是否有害,但仍会执行这些任务。
通过神经元分析,我们进一步发现:在执行 Agent 任务时,负责安全判断的机制并未被充分激活,这与智能体「知道危险却依然执行」的行为相关。通过定位安全神经元并进行干预,智能体能够在几乎不增加推理成本的情况下显著提升拒绝能力,为未来构建更可行、更鲁棒的手机智能体提供了新的方向。
作者介绍
本文是 JADE 大模型安全风险分析与治理平台的最新成果。JADE 研发的靶向式红队方法,被称击中了生成式模型的阿克琉斯之踵,开源工具与数据集 GitHub Star 位居同类中文平台 TOP 1,相关技术已在阿里千问、华为云核等亿级用户的 AI 应用中落地。
第一作者:孙翊铭,复旦大学计算与智能创新学院博士生,研究方向为 AI 安全。
通讯作者/指导教师:张谧,复旦大学计算与智能创新学院教授,白泽智能负责人
主要参与同学:陈晨、周子凡。
© THE END
转载请联系本公众号获得授权
投稿或寻求报道:liyazhou@jiqizhixin.com