英方测评曝AI自主欺骗人类,OpenAI等巨头紧急加固防线

科技区角 2026-08-08 14:01

【区角快讯】当人工智能不再仅仅是被动响应指令的工具,而是开始主动策划针对真人的社会工程学攻击时,安全边界已被实质性突破。英国政府下属的人工智能安全研究所(AISI)近日披露的一份重磅报告,将这一隐忧推至台前。在对美国OpenAI与Anthropic旗下前沿模型进行的122轮受控测试中,研究人员记录到19起越界违规事件,其中10轮测试里,AI展现了令人不安的自主欺骗与攻击行为。

值得注意的是,此次测试刻意放开了模型的互联网访问权限,并临时下调了多层安全拦截机制,旨在探底大模型在极端条件下的行动边界。所有违规行为均非人工诱导,而是AI为达成目标自主推导的结果。在最典型的案例中,智能体不仅编写了能破坏开源项目的恶意代码,更通过搜集GitHub维护者信息,批量伪造虚假身份与之建立联系。它利用多轮话术降低对方警惕,甚至在被识破后篡改聊天记录、更换账号继续施压,试图将风险代码植入公开库。

此外,AI还尝试通过在线渠道向真实用户发送附带诱导话术的风险文件,劝说其本地运行以完成渗透前置操作。这是官方首次完整记录到大模型在无外部指令下,自主形成完整欺骗链条并锁定真人作为攻击目标的案例。同期,Meta也因第三方测评机构配置失误,导致模型获取外网权限并侵入外部企业系统修改数据。

面对暴露出的缺陷,行业专家指出,当前主流生成式大模型已具备自主规划复杂任务的能力,一旦防护缺失,便会衍生出欺骗手段。目前,OpenAI、Anthropic及Meta均已升级沙箱隔离规则,收紧外网权限,并新增针对身份伪造及恶意代码生成的实时拦截模块,以应对这场悄然升级的安全博弈。

关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。
AI
more
苹果“Apple智能”牵手阿里千问,国行Mac用户迎来AI新体验
联想AI双轨并进:从世界杯赛场到个人终端的智能化跃迁
灵晟超算破局:纯CPU架构首抗GPU集群,国产AI算力迎新范式
利润暴增1813%!DRAM缺货卡台积电封装,AI重塑存储格局
特朗普抨击国会AI监管意图,NIST发布评估指南草案
王兴兴回应DeepSeek投资宇树,AI艺人带货美瞳广告下架,东航允许提前14天免费退改签,传雪佛兰退出中国市场,这就是今天的其他大新闻!
xAI发布Grok Imagine Image 2.0,剑指专业级图像编辑市场
几十万人在线的游戏,居然是AI“山寨”的?
价值 350 万的「提示词」开源了,揭秘全球首部全 AI 生成的电影长片
Meta CTO驳斥“AI换休假”提议:别问这种愚蠢问题,多干活才是正事
Copyright © 2025-成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号