单任务推理成本不到 1 分钱!不写思维链,150M 小模型让 AI 学会“心算”,刷新 ARC 成本纪录

机智流 2026-08-15 22:42

单任务推理成本不到 1 分钱!不写思维链,150M 小模型让 AI 学会“心算”,刷新 ARC 成本纪录图1

单任务推理成本不到 1 分钱!不写思维链,150M 小模型让 AI 学会“心算”,刷新 ARC 成本纪录图2

近年来大语言模型的推理能力快速提升,思维链提示等技术让模型可以通过输出中间推理步骤提升复杂问题的解决率,但这类方案也带来了词元消耗增加、推理延迟变长、计算成本上升等问题。

有没有可能在保留上下文学习灵活性的同时,不需要显性输出中间推理步骤,就能完成复杂推理任务?

最近,由 Pathway 团队公开的 BDH-CQ 模型就在这个方向上取得了新进展。这个团队由曾任 Google Brain、MILA 研究员的 Jan Chorowski 等人领衔,既有前沿 AI 研究积累,也深耕实时数据与 AI 基础设施。

单任务推理成本不到 1 分钱!不写思维链,150M 小模型让 AI 学会“心算”,刷新 ARC 成本纪录图3

论文标题:BDH-CQ: IN-CONTEXT LEARNING WITH RECURRENT LATENT REASONING

论文链接:https://arxiv.org/pdf/2608.09888

研究背景

上下文学习是大语言模型的核心能力之一,模型可以仅通过推理阶段输入的示例就掌握新的任务规则,不需要微调参数。思维链技术进一步为这类推理提供了计算空间,通过生成中间词元支撑逐步计算,但也因此把推理过程和串行的自然语言输出绑定在了一起:每一步中间状态都需要映射到离散词表、自回归输出再重新输入模型才能继续计算,随着推理步骤变长,对应的成本和延迟也会同步上升。

隐式推理则提供了另一种技术路径:模型不需要输出中间推理结果,只需要在连续的隐空间中迭代更新隐藏状态,最终直接解码得到答案,省去了中间词元的生成和传输成本,还可以同时探索多个解题路径。不过此前隐式推理和上下文学习的发展相对独立:基于思维链的大语言模型可以灵活从上下文学习规则,但需要通过生成额外词元分配计算资源;隐式递归求解器可以在隐空间迭代推理,但大多需要针对特定任务做优化,无法仅通过推理阶段的演示就掌握从未见过的转换规则。BDH-CQ的出现正是为了打通这两种能力,让模型可以从上下文示例中学习新规则,再通过隐式迭代计算完成推理。

ARC:推理能力的标准化测试床

为了公平验证模型的快速泛化能力,研究团队选择了抽象推理语料库(ARC)作为核心测试基准。ARC是专门用来衡量模型技能获取效率的数据集,每个任务仅通过少量演示给出全新的视觉转换规则,模型需要自行推断其中涉及的对象、关系和操作,再把规则应用到新的输入上,刚好匹配上下文学习需要实现的快速泛化目标。

同时ARC的任务形式也方便后续做能力分析:任务以彩色网格为载体,不需要模型具备事实知识或者语言能力,就可以表达对象关系、计数、对称、拓扑、空间转换等多种能力,所有答案都可以精确验证,错误也可以直观查看,还能通过多个测试输入判断模型是真的掌握了通用规则,还是刚好猜对了单个答案。

单任务推理成本不到 1 分钱!不写思维链,150M 小模型让 AI 学会“心算”,刷新 ARC 成本纪录图4
图 1:ARC-AGI-1训练任务(标识符0520fde7)示例,包含两组演示和待解决查询,任务要求从演示中推断转换规则并应用到查询输入

如图所示的典型ARC任务中,输入包含两个被灰色列隔开的二元面板,模型需要从演示中推断出“输出标记两个面板中都被占据的单元格”这一规则,再应用到查询输入上,全程没有任何文字提示规则内容。

BDH-CQ的核心设计

BDH-CQ基于此前提出的Dragon Hatchling(BDH)架构开发,这是一种后Transformer的序列模型架构,围绕高维正激活、低秩通信和循环关联状态设计,结合了ReLU低秩变换和线性注意力,此前已经验证了在语言建模、序列建模和可解释性上的良好表现。

整个模型的运行流程分为两个核心阶段,第一阶段是基于循环记忆的上下文学习:模型会逐个处理任务提供的演示样本,每处理一个演示就更新一次循环记忆,所有参数在推理阶段都保持固定,记忆中会累积之前输入输出的关联信息,作用类似Transformer注意力机制构建的上下文关联,但不需要维护不断增长的显式键值缓存。

处理完所有演示和查询输入之后,模型进入循环隐式推理阶段:查询输入会和存储了规则的循环记忆一起编码成隐空间的初始状态,之后模型会在隐空间中迭代更新状态完成推理,整个过程不需要输出任何中间推理步骤,迭代完成后直接解码得到最终答案。其中循环记忆负责存储从演示中学习到的通用规则,推理工作空间负责当前查询的计算过程,二者职责明确分开。

评测表现:突破成本精度前沿

研究团队在公开的ARC-AGI-1 400任务评测集上对BDH-CQ做了测试,按照排行榜常规的两次尝试规则(pass@2),150M参数的模型达到了29.5%的pass@2 准确率,单任务推理仅需要约0.85个H200 GPU秒,按照每小时3美元的H200算力成本计算,单任务成本仅0.0007美元,不到0.1美分。

单任务推理成本不到 1 分钱!不写思维链,150M 小模型让 AI 学会“心算”,刷新 ARC 成本纪录图5
图 2:ARC-AGI-1评测集上各模型的准确率与单任务成本对比,数据来自2026年8月4日官方ARC Prize排行榜,BDH-CQ的表现突破了此前的成本-精度帕累托前沿,在成本效率上达到新的SOTA

从成本-精度的帕累托前沿来看,BDH-CQ的表现已经突破了此前已公开系统的边界,没有其他系统能在同等或更低成本下达到相近的准确率,在ARC-AGI-1基准上实现了成本效率的新SOTA。和榜单上的GPT 5.6 Luna(Low)相比,后者准确率为34.2%,单任务成本0.04美元,BDH-CQ成本仅为其1/57,就算计入2026年7月30日OpenAI对该模型80%的公开API降价,BDH-CQ的成本仍然只有前者的1/11。该结果也经过了独立第三方的黑盒审计,审计方没有访问模型权重,仅按照公开协议测试就复现了29.5%的pass@2 准确率,验证了结果的可靠性。

模型还支持通过调整推理阶段的隐式迭代次数平衡准确率和成本,三个不同的推理努力等级下,低努力等级pass@2 为21%,成本降低22%;中努力等级pass@2 为27%,成本降低11%;高努力等级达到最高的29.5%准确率,用户可以根据场景需求灵活选择配置。

单任务推理成本不到 1 分钱!不写思维链,150M 小模型让 AI 学会“心算”,刷新 ARC 成本纪录图6
图 7:不同推理努力等级下的pass@2准确率与成本变化,提升推理努力可以有效提高准确率,同时成本也对应上升

能力边界与局限分析

为了进一步明确模型的能力范围,研究团队通过ConceptARC数据集和定制的受控任务做了详细的能力分析。ConceptARC把任务划分为16个概念家族,每个家族包含10个同类任务,可以系统测试模型对不同视觉转换的学习能力。

结果显示模型在不同概念上的表现差异较大,填充判断、2D上下位识别、边界扩展类任务的pass@2 准确率可以达到9/10,而复制、排序类任务的准确率仅为2/10。同时还存在测试对准确率和严格任务准确率的差距:比如复制类任务的测试对pass@2 达到19/30,但严格任务准确率仅为2/10,说明模型可以在部分输入上输出正确结果,但还不能把推断出的转换规则一致应用到同一任务的所有输入上。

单任务推理成本不到 1 分钱!不写思维链,150M 小模型让 AI 学会“心算”,刷新 ARC 成本纪录图7
图 3:ConceptARC各概念域的pass@2准确率,左图为语义ID下的测试对准确率和严格任务准确率,二者的差值体现了部分正确输出无法在同一任务的所有测试输入上泛化;右图为语义ID批量分组和不透明ID混合批量下的严格任务准确率对比,整体表现几乎没有变化

受控任务的测试进一步明确了模型的泛化边界:边界扩展、图案复制这类简单操作的泛化能力很强,在测试范围内所有样本全部正确;排序任务在待排序对象数超过5之后准确率快速下降,8个对象的排序任务pass@2 仅为1/24;嵌套包含任务在嵌套深度超过4之后准确率下降,深度5的任务pass@2 为29/36。如果在演示中加入对应复杂度的示例,深度5的嵌套任务准确率可以提升到24/24,8个对象的排序任务准确率可以提升到13/24,说明演示内容的覆盖度对模型的泛化能力影响很大。

操作组合的测试则显示不同操作的组合难度差异明显:单独的位置迁移、水平反射、顺时针旋转都可以100%正确完成,旋转加位置迁移的组合也能全对,但是反射加位置迁移的组合只有47/72的正确率,颜色交换操作单独就只有26/72的正确率,和位置迁移组合之后正确率为0,说明操作的表示方式会直接影响组合难度。同时模型的上下文绑定能力表现优异,可以从演示中学习全新的颜色映射规则,所有96个测试样本全部正确。

后续发展方向

当前的BDH-CQ仅为150M参数的小模型,还有很大的拓展空间。架构本身天然支持大参数规模,已经验证可以平滑扩展到1T级参数,预训练阶段也符合类似Transformer的缩放定律,扩大参数规模和延长训练时间有望进一步提升推理能力,同时仍然保持较低的推理成本。

在应用场景上,当前的测试主要集中在视觉推理领域,未来可以拓展到语言推理、数学推理、约束满足问题等更多场景。由于BDH架构本身同时支持语言建模和隐式推理,未来的系统还可以结合显性的思维链输出:在需要对外沟通、结果验证或者调用工具的时候输出中间推理步骤,不需要的时候就用隐式推理,兼顾效率和可解释性。

总的来说,BDH-CQ证明了上下文学习和循环隐式推理可以在一个紧凑的系统中同时实现,在保证推理准确率的同时大幅降低了计算成本,为后续的推理模型设计提供了新的路径,也让低延迟、低成本的通用推理系统的落地有了更多可能。


> 本文由 Intern-S2 等 AI 生成,机智流编辑部校对


-- 完 --


加入机智流 Pro,1 天一块钱,AI 能力指数级增长时代,不掉队。机智流 AI 团队将燃烧远超人类的智能的 AI Tokens 驱动 AI Agents 军团带来「与你有关」「对你有用」的高质量资讯/研报。


机智流推荐阅读

1. 

2. 

3. 

4. 

关注机智流并加入 AI 技术交流群,不仅能和来自大厂名校的 AI 开发者、爱好者一起进行技术交流,同时还有等。
在「机智流」公众号后台回复下方标红内容即可加入对应群聊:
  • cc | 大模型技术交流群
  • hf | HuggingFace 高赞论文分享群
  • lc|LangChain 技术交流群
  • code | AI Coding 交流群
  • 具身 | 具身智能交流群
  • 硬件 | AI 硬件交流群
  • 推理 | AI 推理框架交流群
  • 智能体 | Agent 技术交流群

关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。
AI AR
more
王祖贤广州现身回应AI授权争议:人应主宰技术而非被操控
22.68万起!魏牌V8X上市:双VLA原生AI舱驾智能体,智驾无敌了
xAI再陷诉讼漩涡:Grok被指沦为生成儿童性虐待材料工具,受害者增至四人
Physical AI 挺进深海“禁区”,海洋通用机器人解锁新质生产力密码
把领导做成AI桌宠,年轻打工人做过最解气的一件事
AI宣布森多夫猜想告破!陶哲轩发现它隐藏的更强结果
腾讯研究院AI速递 20260817
闪迪SK海力士联手定义HBF标准,AI存储架构迎来新变局
AI浪潮下的就业悖论:科技巨头一边豪赌大模型,一边挥刀裁员
手机厂老板预算受限不敢做AI,攒够钱后拉起百人自研团队;云厂高管遇内网999+讨伐帖,亲自下场回应;某大厂挖角竞对被地方警告丨AI情报局
Copyright © 2025-成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号