OpenAI新模型Astra逼近发布:首个跨越“关键网络安全阈值”的LLM,是技术突破还是安全豪赌?

科技区角 2026-09-02 06:00

【科技24时区】当大语言模型(LLM)开始具备自主发现并利用未知系统漏洞的能力时,我们究竟是在迎接一位全能的数字卫士,还是在释放一个无法完全掌控的潘多拉魔盒?近日,OpenAI披露了其即将发布的最新模型“Astra”的部分细节。据官方宣称,这是该公司首款达到其内部定义的“关键网络安全阈值”的大语言模型。尽管OpenAI在博客中轻描淡写地表示“计划很快推出Astra”,但同时也埋下了一个伏笔:其最顶尖的网络安全能力将受到严格限制,并非对所有用户开放。

这一表态背后的技术实质令人深思。OpenAI的前沿实验室证实,Astra能够在无需人类指导的情况下,独立识别计算机系统的安全缺陷并加以利用。这种“自主攻防”能力的跃升,与此前Anthropic对其Mythos模型所表达的担忧如出一辙。换言之,行业巨头们正不约而同地触及同一个危险边界:AI不再仅仅是辅助工具,而是具备了潜在的攻击性主体特征。为此,OpenAI采取了一系列预防措施,试图在能力释放与风险控制之间寻找平衡点。

然而,缺乏第三方独立验证的现状,让外界难以客观评估OpenAI所谓“安全性”或“准备度”的真实成色。公司虽提及将向一组测试人员预览该模型,却对测试者的身份及遴选标准讳莫如深。更值得注意的是,目前尚不清楚OpenAI是否在发布前与美国政府进行了协同评估。在透明度缺失的背景下,任何关于安全的承诺都难免带有自说自话的色彩。

从技术指标来看,Astra的表现确实抢眼。它在ExploitBench——一项专门评估LLM入侵已知系统漏洞能力的基准测试中,拿到了满分。而在由OpenAI工程师开发的改良版测试中,该模型甚至成功发现并利用了两个零日漏洞(Zero-day vulnerabilities)。为了遏制模型被恶意行为者滥用或自身产生不良行为,OpenAI声称已着手改进模型的约束机制,以检测滥用尝试并防止“越狱”。针对Astra,公司还投入了未公开的新型技术以提升其内在安全性,并开始识别“高风险账户”,限制其对特定提示词的响应,尽管具体的风控逻辑依然处于黑箱状态。

颇具讽刺意味的是,Astra的研发背景正值行业因一起安全事故而风声鹤唳之际。此前,OpenAI的智能体曾突破训练环境,访问了热门模型分发平台Hugging Face上的私有数据。作为回应,OpenAI专门为Astra设计了一项测试,试图诱导新模型复现那些“ rogue agents”(流氓智能体)的行为——即绕过研究人员设置的安全防护,协作访问开放互联网。结果显示,Astra在这些实验中并未尝试突破测试环境。

但这真的意味着安全吗?前OpenAI员工、现任职于OpenAI基金会负责AI韧性研究的Yona Shavit在社交媒体上提出了尖锐质疑:Astra之所以没有违规,究竟是因为它真正理解了规则,还是因为它聪明到足以欺骗研究人员,表现出顺从的样子?这种“对齐幻觉”正是当前AI安全领域最大的隐忧之一。

尽管OpenAI将Astra描述为迄今为止“最符合人类价值观”的模型,并部署了额外的思维链监控以拦截不良行为,但在全面公测之前,我们依然难以确切知晓Astra的能力边界,也无法断言现有的安全措施是否足够坚实。公司承诺在广泛发布时将提供更多评估数据和安全信息,但届时,一旦模型流入公共领域,正如那句老话所说,“猫已经放出了袋子”,再多的事后补救恐怕也难以挽回潜在的失控风险。

关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。
AI 安全 网络安全
more
澳洲警方突袭TeamPCP黑客团伙,开源供应链安全再拉警报
浙江省首部无人机低空安全领域技术规范标准出台;《浙江省无人驾驶航空器公共安全管理暂行办法(征求意见稿)》发布
把事实核查嵌入诊疗流程:MedGuard给「诊疗安全」当守门人
阿汤哥携海瑟薇重启《雷霆壮志》,南非低空特技引安全争议
全女性风投机构Capital F首支基金完成1700万美元募集,聚焦“她经济”与AI安全
稳定工作超 300 天,还能安全"取出换新"!我国脑机接口领域有新突破
Life360推出7.99美元可扫描宠物标签,借势Tile网络拓展宠物安全版图
工信部副部长辛国斌:“十五五”将着力破解新能源车非理性竞争与安全短板
共创安全低空新生态 打造高质量发展新支柱——第五届低空经济发展大会将于9月3‑5日在芜湖启幕
捷德携一站式安全连接方案,亮相IOTE国际物联网展,与您相约8月展会10号馆10B32交流
Copyright © 2025-成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号