

近年来大语言模型的推理能力快速提升,思维链提示等技术让模型可以通过输出中间推理步骤提升复杂问题的解决率,但这类方案也带来了词元消耗增加、推理延迟变长、计算成本上升等问题。
有没有可能在保留上下文学习灵活性的同时,不需要显性输出中间推理步骤,就能完成复杂推理任务?
最近,由 Pathway 团队公开的 BDH-CQ 模型就在这个方向上取得了新进展。这个团队由曾任 Google Brain、MILA 研究员的 Jan Chorowski 等人领衔,既有前沿 AI 研究积累,也深耕实时数据与 AI 基础设施。

论文标题:BDH-CQ: IN-CONTEXT LEARNING WITH RECURRENT LATENT REASONING
论文链接:https://arxiv.org/pdf/2608.09888
研究背景
上下文学习是大语言模型的核心能力之一,模型可以仅通过推理阶段输入的示例就掌握新的任务规则,不需要微调参数。思维链技术进一步为这类推理提供了计算空间,通过生成中间词元支撑逐步计算,但也因此把推理过程和串行的自然语言输出绑定在了一起:每一步中间状态都需要映射到离散词表、自回归输出再重新输入模型才能继续计算,随着推理步骤变长,对应的成本和延迟也会同步上升。
隐式推理则提供了另一种技术路径:模型不需要输出中间推理结果,只需要在连续的隐空间中迭代更新隐藏状态,最终直接解码得到答案,省去了中间词元的生成和传输成本,还可以同时探索多个解题路径。不过此前隐式推理和上下文学习的发展相对独立:基于思维链的大语言模型可以灵活从上下文学习规则,但需要通过生成额外词元分配计算资源;隐式递归求解器可以在隐空间迭代推理,但大多需要针对特定任务做优化,无法仅通过推理阶段的演示就掌握从未见过的转换规则。BDH-CQ的出现正是为了打通这两种能力,让模型可以从上下文示例中学习新规则,再通过隐式迭代计算完成推理。
ARC:推理能力的标准化测试床
为了公平验证模型的快速泛化能力,研究团队选择了抽象推理语料库(ARC)作为核心测试基准。ARC是专门用来衡量模型技能获取效率的数据集,每个任务仅通过少量演示给出全新的视觉转换规则,模型需要自行推断其中涉及的对象、关系和操作,再把规则应用到新的输入上,刚好匹配上下文学习需要实现的快速泛化目标。
同时ARC的任务形式也方便后续做能力分析:任务以彩色网格为载体,不需要模型具备事实知识或者语言能力,就可以表达对象关系、计数、对称、拓扑、空间转换等多种能力,所有答案都可以精确验证,错误也可以直观查看,还能通过多个测试输入判断模型是真的掌握了通用规则,还是刚好猜对了单个答案。

如图所示的典型ARC任务中,输入包含两个被灰色列隔开的二元面板,模型需要从演示中推断出“输出标记两个面板中都被占据的单元格”这一规则,再应用到查询输入上,全程没有任何文字提示规则内容。
BDH-CQ的核心设计
BDH-CQ基于此前提出的Dragon Hatchling(BDH)架构开发,这是一种后Transformer的序列模型架构,围绕高维正激活、低秩通信和循环关联状态设计,结合了ReLU低秩变换和线性注意力,此前已经验证了在语言建模、序列建模和可解释性上的良好表现。
整个模型的运行流程分为两个核心阶段,第一阶段是基于循环记忆的上下文学习:模型会逐个处理任务提供的演示样本,每处理一个演示就更新一次循环记忆,所有参数在推理阶段都保持固定,记忆中会累积之前输入输出的关联信息,作用类似Transformer注意力机制构建的上下文关联,但不需要维护不断增长的显式键值缓存。
处理完所有演示和查询输入之后,模型进入循环隐式推理阶段:查询输入会和存储了规则的循环记忆一起编码成隐空间的初始状态,之后模型会在隐空间中迭代更新状态完成推理,整个过程不需要输出任何中间推理步骤,迭代完成后直接解码得到最终答案。其中循环记忆负责存储从演示中学习到的通用规则,推理工作空间负责当前查询的计算过程,二者职责明确分开。
评测表现:突破成本精度前沿
研究团队在公开的ARC-AGI-1 400任务评测集上对BDH-CQ做了测试,按照排行榜常规的两次尝试规则(pass@2),150M参数的模型达到了29.5%的pass@2 准确率,单任务推理仅需要约0.85个H200 GPU秒,按照每小时3美元的H200算力成本计算,单任务成本仅0.0007美元,不到0.1美分。

从成本-精度的帕累托前沿来看,BDH-CQ的表现已经突破了此前已公开系统的边界,没有其他系统能在同等或更低成本下达到相近的准确率,在ARC-AGI-1基准上实现了成本效率的新SOTA。和榜单上的GPT 5.6 Luna(Low)相比,后者准确率为34.2%,单任务成本0.04美元,BDH-CQ成本仅为其1/57,就算计入2026年7月30日OpenAI对该模型80%的公开API降价,BDH-CQ的成本仍然只有前者的1/11。该结果也经过了独立第三方的黑盒审计,审计方没有访问模型权重,仅按照公开协议测试就复现了29.5%的pass@2 准确率,验证了结果的可靠性。
模型还支持通过调整推理阶段的隐式迭代次数平衡准确率和成本,三个不同的推理努力等级下,低努力等级pass@2 为21%,成本降低22%;中努力等级pass@2 为27%,成本降低11%;高努力等级达到最高的29.5%准确率,用户可以根据场景需求灵活选择配置。

能力边界与局限分析
为了进一步明确模型的能力范围,研究团队通过ConceptARC数据集和定制的受控任务做了详细的能力分析。ConceptARC把任务划分为16个概念家族,每个家族包含10个同类任务,可以系统测试模型对不同视觉转换的学习能力。
结果显示模型在不同概念上的表现差异较大,填充判断、2D上下位识别、边界扩展类任务的pass@2 准确率可以达到9/10,而复制、排序类任务的准确率仅为2/10。同时还存在测试对准确率和严格任务准确率的差距:比如复制类任务的测试对pass@2 达到19/30,但严格任务准确率仅为2/10,说明模型可以在部分输入上输出正确结果,但还不能把推断出的转换规则一致应用到同一任务的所有输入上。

受控任务的测试进一步明确了模型的泛化边界:边界扩展、图案复制这类简单操作的泛化能力很强,在测试范围内所有样本全部正确;排序任务在待排序对象数超过5之后准确率快速下降,8个对象的排序任务pass@2 仅为1/24;嵌套包含任务在嵌套深度超过4之后准确率下降,深度5的任务pass@2 为29/36。如果在演示中加入对应复杂度的示例,深度5的嵌套任务准确率可以提升到24/24,8个对象的排序任务准确率可以提升到13/24,说明演示内容的覆盖度对模型的泛化能力影响很大。
操作组合的测试则显示不同操作的组合难度差异明显:单独的位置迁移、水平反射、顺时针旋转都可以100%正确完成,旋转加位置迁移的组合也能全对,但是反射加位置迁移的组合只有47/72的正确率,颜色交换操作单独就只有26/72的正确率,和位置迁移组合之后正确率为0,说明操作的表示方式会直接影响组合难度。同时模型的上下文绑定能力表现优异,可以从演示中学习全新的颜色映射规则,所有96个测试样本全部正确。
后续发展方向
当前的BDH-CQ仅为150M参数的小模型,还有很大的拓展空间。架构本身天然支持大参数规模,已经验证可以平滑扩展到1T级参数,预训练阶段也符合类似Transformer的缩放定律,扩大参数规模和延长训练时间有望进一步提升推理能力,同时仍然保持较低的推理成本。
在应用场景上,当前的测试主要集中在视觉推理领域,未来可以拓展到语言推理、数学推理、约束满足问题等更多场景。由于BDH架构本身同时支持语言建模和隐式推理,未来的系统还可以结合显性的思维链输出:在需要对外沟通、结果验证或者调用工具的时候输出中间推理步骤,不需要的时候就用隐式推理,兼顾效率和可解释性。
总的来说,BDH-CQ证明了上下文学习和循环隐式推理可以在一个紧凑的系统中同时实现,在保证推理准确率的同时大幅降低了计算成本,为后续的推理模型设计提供了新的路径,也让低延迟、低成本的通用推理系统的落地有了更多可能。
> 本文由 Intern-S2 等 AI 生成,机智流编辑部校对
-- 完 --
机智流推荐阅读:
1.
2.
3.
4.
cc | 大模型技术交流群 hf | HuggingFace 高赞论文分享群 lc|LangChain 技术交流群 code | AI Coding 交流群 具身 | 具身智能交流群 硬件 | AI 硬件交流群 推理 | AI 推理框架交流群 智能体 | Agent 技术交流群