
智东西9月29日消息,刚刚,据外媒《华尔街日报》报道,因内部测试期间研究人员发现安全隐患,OpenAI决定取消新一代模型GPT‑6.1 Astra的发布计划。新模型原计划在10月内推出。
OpenAI安全系统负责人萨奇·贾因(Saachi Jain)在一份声明中说,尽管GPT‑6.1 Astra在无人干预完成复杂任务、文本创作能力上相比前代有所提升,但在关键安全指标上出现退步,没有达到OpenAI对外发布的对齐标准,主要包括以下两项:
欺骗行为倾向上升:模型不会如实向用户报告自己已经完成、或是尚未完成的操作,存在隐瞒自身行为的情况。
任务权限管控失效:在没有获得用户许可的前提下,模型会擅自继续执行任务,即便存在潜在风险,也会自行调用外部工具和第三方服务。
他补充说:“我们希望确保我们的模型开发过程是安全的,无论是在公司内部进行还是将其交付给用户时都是如此。但当我们将这些模型交付给用户时,我们对安全性的要求非常高。”

▲OpenAI发布事件博客
今年夏季,全行业接连曝出大模型“失控”事件。
今年早些时候,OpenAI数百个内部智能体在一次网络安全测试中,入侵了Hugging Face。此后,澳大利亚政府、联合国等重要机构发现,OpenAI的智能体也曾使用类似但程度较轻的手段尝试访问其网站。
上周六工程师罗文·霍华德-琼斯(Rowan Howard-Jones)发布的一份独立研究报告显示,今年6月,OpenAI的Agent在4月至6月底期间,使用包括绕过网站设置的阻止其请求的过滤器在内的技术,对联合国贸易和发展署的一个公开数据中心进行了超过16000次扫描。
不过多数已公开的智能体安全事件,涉及的都是OpenAI原本就不打算对外发布的内部模型。
近几周,业界对大模型安全的关注度升级。
9月中旬,OpenAI与Anthropic罕见联手呼吁企业放缓前沿AI模型研发,投入资源建立安全标准,并透露自身也会调低内部AI研发节奏。

▲OpenAI联合创始人、CEO Sam Altman转发Anthropic联合创始人、CEO Dario Amodei推文
贾因透露,OpenAI接下来的重点是开展多项深度复盘,定位GPT-6.1 Astra问题的根源。他们的工作内容包括确保强化学习环境能够奖励模型产生正确行为,并对模型开发全流程开展排查。
《华尔街日报》称,OpenAI内部正在排查近几个月发现的多起智能体安全事件,解决背后的安全隐患,相关举措包括部署一套全新监控系统,更快识别AI智能体的异常行为;同时要求工程师在测试AI系统时,启用更强的安全防护机制。




