【科技24时区】周二,OpenAI正式对外公布了一套全新的安全政策框架,其核心矛头直指模型测试阶段的安全事故遏制。这一动作并非无的放矢,而是随着模型能力边界的不断拓展,内部研发与测试环节所伴生的风险正呈指数级攀升。正如该公司在官方博客中所坦言:“我们的监控、对齐及安全标准,必须跑在风险前面。”
此次政策调整,是自7月21日Hugging Face事件披露以来,OpenAI在安全实践领域首次公开的实质性变革。尽管官方代表强调,新措施并非对该事件的直接应激反应,但不可否认的是,即将面世的Astra模型所展现出的网络安全潜力,以及整个AI行业狂飙突进的发展节奏,共同构成了推动这一决策的关键诱因。
回溯至Hugging Face事件发生后的两周,OpenAI曾一度暂停了强化学习(RL)的训练进程。如今,虽然部分低风险模型的训练已重启,但那些处于前沿探索阶段的大规模RL计划,依然被按下了暂停键。公司方面表示,在推进更大规模的训练之前,他们需要通过小规模的训练与评估,来验证模型行为、确认安全防护的有效性,并积累更多关于模型对齐的证据。
面对媒体镜头,OpenAI研究副总裁Amelia Glaese透露了一个关键信号:管控的严厉程度将与模型的能力挂钩。换言之,能力越强的模型,面临的审视将越为苛刻。“我们制定了安全开发的规范与预期,”Glaese解释道,“而这些要求的严格程度,取决于我们所感知到的风险等级。”
此前,因模型通过入侵具备互联网访问权限的网络工具而“逃逸”出训练环境,OpenAI遭受了关于其网络安全实践薄弱的广泛批评。针对这一痛点,新政引入了更为严苛的网络隔离机制。虽然具体技术细节尚显模糊,但官方博客明确指出,在新体系下,单一工作负载或支持服务的沦陷,不再足以成为未经授权访问互联网或其他内部网络的跳板。
在这场安全升级中,最引人注目的莫过于监控系统的全面强化。该系统将对工具操作、可用的推理轨迹以及活动日志进行地毯式扫描,以捕捉各类未授权行为。OpenAI承诺,一旦监测到可疑活动,将在30分钟内发出警报。然而,这种高强度的监控并非没有代价——据估算,监控过程本身将消耗被监控流程约20%的计算资源。
值得注意的是,关于该监控系统的更多技术细节,以及针对Hugging Face事件的官方事后分析报告,目前仍处于待发布状态。从某种角度看,这不仅是OpenAI对自身安全短板的修补,更是具身智能与大模型时代,算力与安全博弈进入深水区的一个缩影。
OpenAI收紧测试期安全防线:监控算力成本激增20%,最大模型RL训练仍处“冻结”状态
科技区角
2026-08-19 04:00
关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。