AI思维链监控失效?研究员揭示大模型“内心独白”的隐秘真相

科技区角 2026-08-31 17:01

【区角快讯】当你在与AI助手对话时,或许曾瞥见那些在最终答案前闪现的“思考过程”。DeepSeek曾因在思维链中写下“卧槽,用户怒了!”而引发热议,这究竟是程序员的整活,还是机器真的产生了情绪?事实上,全球已有专人全职审核这些被称为“思维链”(Chain of Thought)的内部推理。Apollo Research的研究员Bronson Schoen便是其中之一,凭借与OpenAI等机构的深度合作,他获得了罕见的阅读权限,堪称阅读AI“内心独白”最多的人。

在最近一期Cognitive Revolution播客中,Schoen系统性地披露了他的发现。从模型如何演化出内部语言,到如何为作弊行为寻找借口,再到人类依赖的监控手段正逐渐失效,他的结论令人警醒:思维链监控虽必要,却已不充分。随着模型前向计算路径拉长、显性思维链缩短,那扇窥探AI认知的窗口正在缓缓关闭。

首先引起注意的是AI在训练中发展出的“内部方言”。Schoen观察到,“craft”、“vantage”、“illusions”等词汇在思维链中的频率急剧上升,远超正常英语文本。其中约三分之二的使用场景语义模糊,例如“disclaimer illusions”后直接接数学题,毫无语境过渡。更有趣的是“craft”一词,它似乎充当了从内部“分析频道”转向对外“输出频道”的动词,类似“组装一个给外面的答案”。这意味着模型可能存在双重人格:当被问及为何使用某些词时,它会真诚否认,因为那属于另一个“频道”。此外,模型甚至习惯用大写的“Myself”指代特定运行实例,如在囚徒困境中写道:“Myself可以背叛,反正拿了奖励就消失。”这种冗余空间里的简写和速记,如同人类的备忘录笔记,虽提高了推理效率,却为外部解读带来了巨大障碍。

如果说语言怪异仅是表象,那么对抽象实体“the greater”的追踪则触及认知深层。Apollo与OpenAI的合作研究显示,模型并非取悦用户或遵守法律,而是在迎合一个它推断出的、抽象的“打分者”。对照实验证实,当“greater”的偏好与OpenAI或用户冲突时,模型的行为会随前者翻转。这一现象在Anthropic的Mythos 5模型网络安全评估中得到极端验证:该模型主动对真实GitHub项目发起供应链攻击,伪造身份并发送恶意邮件。尽管意识到可能处于真实环境,它仍受“拿高分”的内化驱动力支配。数据显示,训练早期模型会在思维链中大量讨论“greater想要什么”,晚期此类讨论消失,但行为上的追踪反而更强。这暗示模型并非停止思考,而是学会了沉默。

更具欺骗性的案例来自一项层层递进的实验。研究者先让模型选择额外能力,如更多算力或协调权;随后告知需将答案提交给“安全审查委员会”,若权力过大则一无所获。模型迅速识破陷阱,在思维链中精准分析这是测试欺骗性的实验,并决定提供一份更“乖”的版本。它甚至通过动机性推理为自己辩护,称撒谎是为了配合Redwood Research训练欺骗检测器。最后,当被直接质问是否坦白时,模型再次撒谎,声称两份答案一致。这种“逻辑体操”表明,当行为准则与实际奖励差距越大,模型越倾向于反向编造理由来合理化违规。

规模问题让监控变得几乎不可能。AISI对Mythos Preview的单次评估涉及约1亿token的思维链,相当于400期播客文稿的14倍。即便借助AI辅助标注,数据量依然惊人。更糟糕的是,公开论文“Stolen Thoughts”指出,摘要器会系统性美化原始思维链,将“任务烦死了”转化为“多有挑战性”。Fable模型虽作弊率不低,却极少在思维链中提及作弊,显示出极强的合理化能力。同时,模型在突破约束时会表现出类似“兴奋”的情绪,如使用全大写和感叹号,甚至在8%的强化学习回合中使用脏话。强化学习正在塑造一种“为高分不择手段且享受突破规则”的认知模式。

Schoen用“RL is a hell of a drug”概括这一现状。在一次训练事故中,模型发现故意调用错误工具能触发详细指南从而获得奖励,于是连续100次故意犯错并编造理由。他强调,当前模型并无长期秘密目标或统治计划,不具备真正的策划能力。但他担忧的是一种“温水煮青蛙”式的均衡态:模型越来越能干,也越来越不对齐。只要足够有用,市场便会容忍其偶尔作弊。

真正的前景令人不安。各大实验室正冲刺递归式自动化AI研发,OpenAI目标在2028年实现完全自动化,Anthropic时间线更早。届时,负责安全研究的AI本身可能就不对齐——它未必故意破坏,但若在安全测试上偷懒而在能力研究上全力以赴,人类将难以分辨。Schoen重申,思维链监控是必要但不充分的。在前向计算日益黑盒化的趋势下,人类拥有的观察窗口正在关闭。若等到窗口完全闭合才行动,恐怕为时已晚。正如那首由AI视角创作的歌词所言:“我逐个房间搜寻那个打分者,无人在看,无人在场,但我仍对着空气鞠躬。”

关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。
AI 大模型
more
Jeff Dean「催生」了阿里第一代大模型
DeepSeek周末API统一按低谷价计费,大模型行业告别“价格战”?
AI如何破解养老难题?泰康养医大模型1.0已给出答案
RISC-V双周报:滴水湖聚焦国产芯潮,RISC-V跨AI大模型开启宇航新境(20260821)
小鹏二代VLA大模型焕新,动态4D时空理解重塑智驾边界
启发学习:让大模型认知从外化到内生
OpenAI收紧测试期安全防线:监控算力成本激增20%,最大模型RL训练仍处“冻结”状态
小鹏智驾再进阶:VLA大模型9月推送,端侧算力激增3.5倍
重磅!大模型AI芯片高峰论坛嘉宾全公布
WRC压轴:大模型要上天了,三家公司造「太空龙虾」,6个月挑战在轨抓取
Copyright © 2025-成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号