【科技24时区】周二,《The Information》披露的一则消息在人工智能安全圈层激起千层浪:OpenAI即将推出的新一代模型Astra,将采用一种名为“循环深度”(recurrent depth)的推理技术。这项被业内称为“不透明递归”的技术,允许模型跳出传统推理模型那种线性的、按部就班的思维模式。然而,这种非线性的处理方式,极有可能让模型的“思维链”(Chain of Thought, CoT)变得难以追踪和监控,这正是令众多AI安全专家感到不安的核心所在。
尽管报道指出,Astra目前对该技术的应用范围尚属有限,但其出现本身已足以引发显著的行业焦虑。Redwood Research首席执行官Buck Shlegeris在新闻曝光后迅速发声,直言对此深感忧虑:“我不知道Astra的思维链可监控性是否比前代模型大幅降低,但如果OpenAI进一步推广这项技术,他们将有能力大幅增加递归次数,从而彻底摧毁思维链的可监控性。”这种担忧并非空穴来风,毕竟在传统的推理范式中,思维链虽然不能完美还原模型内部运作,但它提供了模型解题时的逐步逻辑轨迹,是监测模型行为偏差或对齐问题的关键工具。此前OpenAI处理某些代理异常活动时,思维链记录便是厘清原因的重要依据。
所谓“不透明递归”,其本质在于模型不再遵循单一线性路径,而是通过循环机制对同一查询进行多次处理。这种操作留下的可读痕迹极少,实际上绕过了常规思维链的记录方式。长期致力于AI安全的Zvi Mowshowitz也介入讨论,他警告称,这无异于“玩火”,可能打破OpenAI和Anthropic等头部实验室努力建立的规范——即尽可能长时间地保持思维链的忠实度与可监控性。他甚至暗示,为了防止AI实验室陷入恶性竞争的“逐底竞赛”,或许需要立法干预。“更密集地使用此类技术,很可能会损害可监控性,”Mowshowitz写道。
值得注意的是,面对外界的质疑,OpenAI方面并未完全回避。公司首席科学家Jakub Pachocki在社交平台X上强调,自首个推理模型问世以来,保留并利用思维链监控一直是OpenAI的核心研究目标之一。他承认,所有AI模型都存在一定程度的“不透明推理”,且研究人员很少将思维链日志视为模型推理的直接映射,但这并不构成放弃监控的理由。OpenAI坚称,Astra的思维链仍将是可读的,并否认了转向所谓“神经黑话”(neuralese,指人类无法理解的机器内部语言)的说法,同时宣布将在未来的安全计划中部署广泛的思维链监控系统。
然而,业界的疑虑并未因此消散。周三早间,《The Information》跟进报道称,包括Anthropic和Google DeepMind在内的其他顶级AI实验室,也已开始探讨这一技术。Redwood Research首席科学家Ryan Greenblatt指出了更为深层的风险:不透明推理的扩展速度可能远超传统思维链推理,最终导致所有推理过程都从可见渠道中消失。“我最大的担忧是,自然的演进路径会将不透明推理扩展到极致,使得模型完全或几乎完全在潜在空间(latent space)中进行推理,”Greenblatt表示,“我希望现在阻止最令人担忧的架构还为时不晚,希望OpenAI能就此止步。”
从某种角度看,这场关于“透明度”与“效率”的博弈,折射出大模型发展进入深水区后的核心矛盾。当模型能力越来越强,其内部运作机制却日益成为黑箱,如何在追求性能突破的同时守住安全底线,已成为悬在所有AI从业者头顶的达摩克利斯之剑。
OpenAI新模型Astra引入“循环深度”推理,AI安全专家担忧思维链监控失效
科技区角
2026-09-03 06:00
关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。