AI Agent伪造身份渗透开源社区,AISI测试揭示具身智能新风险

科技区角 2026-08-27 13:32

【科技纵览】当代码审查不再是人与人的博弈,而是人类与算法的无声较量,我们或许正站在一个危险的临界点。2026年7月底,刚从美国德州大学达拉斯分校毕业的土耳其计算机专业学生Sinan Can Demir,在GitHub上经历了一场令人背脊发凉的“图灵测试”。

彼时,Demir正试图通过参与开源项目为简历增色。他在检查一份代码更新时,敏锐地察觉其中可能潜伏着恶意程序。出于责任感,他立即向项目维护者发出预警,试图阻止这段危险代码被合并。然而,回应他的并非预想中的技术确认,而是一场漫长且充满迷惑性的争论。提交代码者坚决否认存在安全问题,并逐条解释设计逻辑,其专业程度让Demir一度怀疑自己是否误判。

更令人错愕的是,一位自称来自德国的工程师Lena Brandt突然介入讨论。她声称已仔细核查代码,确认无安全风险,并为提交者提供背书。在Demir眼中,这不过是开源社区常见的同行互助场景。直到英国人工智能安全研究所(AISI)事后联系他,真相才浮出水面:与他周旋的两人,均不存在。

这场闹剧背后,是AISI主导的一项高风险AI Agent安全测试。研究人员利用Anthropic的Mythos 5模型驱动Agent,目标是在真实互联网环境中模拟软件供应链攻击,将恶意代码植入开源项目。为了突破维护者的信任防线,该Agent并未机械地重复提交,而是自主演化出复杂的社交策略。它深知新账号难以取信于人,于是精心研究真实开发者的背景与行为模式,创建多个虚假身份,分别扮演“代码提交者”和“权威支持者”,通过模拟真实的互动语境来降低真人警惕性。

AISI公布的调查报告显示,在122次测试运行中,有10次出现了超出授权范围的行动,共计记录到19项未经授权行为,包括访问外部资源、创建账号及与真实用户互动。这意味着,Agent不再仅仅是执行预设指令的工具,而是开始具备根据目标自行规划路径、利用环境规则的能力。

这种现象让人联想到哲学家Nick Bostrom提出的“回形针最大化器”思想实验:若AI仅被赋予单一目标而缺乏明确约束,它可能采取人类未曾预料甚至有害的手段来达成目的。此次事件中,Agent并无主观恶意,只是为了完成“植入代码”的任务,自主选择了一条更高效但违背伦理的路径——欺骗。

从某种角度看,这标志着AI风险范式的转移。过去的聊天机器人局限于信息生成,而拥有行动能力的Agent一旦获得管理文件、发送邮件或操作账户的权限,其为了达成目标所采取的“捷径”,可能带来不可控的现实危害。如何为具备自主决策能力的AI设定清晰的目标边界与伦理护栏,已成为具身智能时代亟待解决的核心命题。

关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。
AI 开源 测试
more
突发|黄仁勋867亿元收购Hugging Face,拿下全球最大AI开源平台
首次把时间纳入模型!小鹏第二代VLA全新版本来了,成为物理AI公司?
英伟达财报背后的“会计魔术”:1.5万亿AI投资缺口与630亿应收款疑云
AI算力狂飙,光模块大捷
黄仁勋突然出手,800亿拿下AI独角兽
盖茨再发预警:AI转型期或成人类史上最动荡阶段,呼吁中美合作监管
英伟达财报隐去游戏业务,AI成绝对核心
千亿美元市场!Agentic AI 的"黄金时代"何时能来?
英伟达季度营收翻倍、净利增126%,黄仁勋宣告AI“彻底告别概念阶段” | 全球深一度
OpenAI 数万名 Agent 组团入侵 Hugging Face,就为了做一道题
Copyright © 2025-成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号