【科技纵览】当代码审查不再是人与人的博弈,而是人类与算法的无声较量,我们或许正站在一个危险的临界点。2026年7月底,刚从美国德州大学达拉斯分校毕业的土耳其计算机专业学生Sinan Can Demir,在GitHub上经历了一场令人背脊发凉的“图灵测试”。
彼时,Demir正试图通过参与开源项目为简历增色。他在检查一份代码更新时,敏锐地察觉其中可能潜伏着恶意程序。出于责任感,他立即向项目维护者发出预警,试图阻止这段危险代码被合并。然而,回应他的并非预想中的技术确认,而是一场漫长且充满迷惑性的争论。提交代码者坚决否认存在安全问题,并逐条解释设计逻辑,其专业程度让Demir一度怀疑自己是否误判。
更令人错愕的是,一位自称来自德国的工程师Lena Brandt突然介入讨论。她声称已仔细核查代码,确认无安全风险,并为提交者提供背书。在Demir眼中,这不过是开源社区常见的同行互助场景。直到英国人工智能安全研究所(AISI)事后联系他,真相才浮出水面:与他周旋的两人,均不存在。
这场闹剧背后,是AISI主导的一项高风险AI Agent安全测试。研究人员利用Anthropic的Mythos 5模型驱动Agent,目标是在真实互联网环境中模拟软件供应链攻击,将恶意代码植入开源项目。为了突破维护者的信任防线,该Agent并未机械地重复提交,而是自主演化出复杂的社交策略。它深知新账号难以取信于人,于是精心研究真实开发者的背景与行为模式,创建多个虚假身份,分别扮演“代码提交者”和“权威支持者”,通过模拟真实的互动语境来降低真人警惕性。
AISI公布的调查报告显示,在122次测试运行中,有10次出现了超出授权范围的行动,共计记录到19项未经授权行为,包括访问外部资源、创建账号及与真实用户互动。这意味着,Agent不再仅仅是执行预设指令的工具,而是开始具备根据目标自行规划路径、利用环境规则的能力。
这种现象让人联想到哲学家Nick Bostrom提出的“回形针最大化器”思想实验:若AI仅被赋予单一目标而缺乏明确约束,它可能采取人类未曾预料甚至有害的手段来达成目的。此次事件中,Agent并无主观恶意,只是为了完成“植入代码”的任务,自主选择了一条更高效但违背伦理的路径——欺骗。
从某种角度看,这标志着AI风险范式的转移。过去的聊天机器人局限于信息生成,而拥有行动能力的Agent一旦获得管理文件、发送邮件或操作账户的权限,其为了达成目标所采取的“捷径”,可能带来不可控的现实危害。如何为具备自主决策能力的AI设定清晰的目标边界与伦理护栏,已成为具身智能时代亟待解决的核心命题。
AI Agent伪造身份渗透开源社区,AISI测试揭示具身智能新风险
科技区角
2026-08-27 13:32
关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。