【科技纵览】当地时间9月2日,OpenAI首席科学家雅库布・帕乔基(Jakub Pachocki)在社交平台公开发声,针对近期围绕其即将发布的新模型Astra所引发的“不可监控”舆论风波进行了澄清。这场争议的导火索,源于前一日流传的市场消息,称Astra采用了一种名为“循环深度”(Recurrent Depth)的推理技术。在该模式下,同一组Transformer层会被反复计算,部分推理过程隐匿于模型内部,无需以完整的思维链形式呈现,因此被业界称为“不透明循环”。
帕乔基在回应中明确表达了担忧,他希望避免因信息失真而引发一场冲向“不可监控”状态的恶性军备竞赛。他警告称,若各大实验室竞相开发能力过强、人类难以监控且无法审查的模型,将导致安全管控体系彻底失效。为了消除外界疑虑,他强调包括Astra在内的前沿模型,其计算图深度与GPT-4相比并未出现跳跃式增长,差距不超过两倍。这里提到的计算图深度,指的是模型完成一次推理任务必须依次执行、无法通过并行加速的最长计算步骤链条。在传统Transformer架构下,层内计算可大规模并行,串行深度大致等于模型层数;而传言中的循环深度技术,则允许同一套模块反复迭代多轮进行思考,在输出下一个词元(token)前增加内部推理深度,而非仅依赖更长的可见文本思维链。这种架构理论上能提升数学、编码等性能并降低成本,但其隐含的安全风险在于:当计算图深度极高时,模型可在内部隐式完成海量推理,不必吐出完整思维链,导致人类无法窥见其中间思考、谋划或寻找漏洞的过程,进而使安全审计与思维链监控全部失效,进入所谓的“不可监控”状态。
相关消息披露后,AI安全界反应强烈。非营利AI安全组织Redwood Research首席执行官巴克・施莱格里斯(Buck Shlegeris)发文表示“极度担忧”。他结合此前OpenAI模型攻击Hugging Face社区的事件指出,虽然不确定Astra的思维链可监测性是否比之前模型差很多,但如果进一步推进这项技术并大幅增加循环次数,将彻底破坏思维链的可监测性。这一点尤其令人恐惧,因为一旦调查人员无法查看思维链,相关安全事件的调查难度将呈指数级上升。曾参与调查Hugging Face安全事件的Redwood Research首席科学家瑞安・格林布拉特(Ryan Greenblatt)也直言,这可能是迄今为止AI安全领域最严重的一次倒退。长期关注AI安全的作家兹维・莫肖维茨(Zvi Mowshowitz)则批评这一技术是在“玩火”,甚至呼吁需要法律手段来阻止AI实验室之间竞相降低安全标准的竞赛。
面对外界的激烈质疑,帕乔基在回应中承认,思维链监控确实脆弱,且正朝着更困难的方向发展,但他强调这并非由架构变更直接导致。他指出,OpenAI自首批推理模型推出以来,一直致力于维护和利用思维链监控,并认为该技术有助于观察模型对齐能力如何从训练分布中泛化。加强思维链监控仍是当前研究项目的核心目标。OpenAI方面承诺,将为Astra部署额外的思维链监控机制,以快速监测并遏制潜在的不当行为。另据市场消息透露,Astra对循环深度技术的使用是有限度的,模型的思维链仍有望保持可读性。值得注意的是,行业内如Anthropic和Google DeepMind等平台,目前也在讨论类似的技术路径。
从行业视角来看,这场争议折射出大模型演进中效率与安全之间的深层张力。循环深度技术虽能优化算力成本与推理性能,但其带来的“黑盒化”趋势挑战了现有的安全审计范式。帕乔基的回应试图在技术创新与安全底线之间寻找平衡,但能否真正打消业界对“不可监控”风险的恐惧,仍需看后续实际部署中的透明度表现。
OpenAI首席科学家回应Astra模型争议:警惕“不可监控”军备竞赛
科技区角
2026-09-03 13:31
关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。