Agent记忆新范式Recuris:3B小模型到Claude Opus 5全线暴涨

机器之心 2026-08-29 17:02
Agent记忆新范式Recuris:3B小模型到Claude Opus 5全线暴涨图1

近年来,大语言模型(LLM)智能体在长程任务中展现出强大潜力,但现有智能体框架在记忆的使用方式与迭代方式上仍面临显著挑战。


传统方法多在任务开始前根据任务检索记忆或在交互过程中通过上下文来检索经验,随着任务的推进,在任务开始阶段一次性检索的记忆已无法反映当前的问题,膨胀的上下文中又混杂着过期信息与执行噪声,检索因此越来越不可靠。检索之所以不可靠,根源并不在于缺少有用的经验,而在于缺少一个紧凑而可靠的任务状态,去把已积累的经验与当前的执行需求持续对齐。


而近期的递归式自我改进(RSI)在长程任务中也面临同样的挑战,记忆的迭代几乎只由下游任务的分数决定,无法精准定位到产生问题的具体组件,因此更新往往是粗粒度的且缺乏针对性,而面对长程任务中的推理轨迹,不断增长的上下文长度也让智能体难以在分析并在其中准确找到最有效的改进策略。


在此背景下,新加坡国立大学、普林斯顿大学与斯坦福、牛津等研究团队合作提出了 Recuris(Recursive Experiential–Working Memory Evolution),作为首个将递归自我改进应用在记忆控制层内的智能体架构,Recuris 通过三项核心技术突破,无需训练即成功实现了从 3B 小模型到 Claude Opus 5 的全面提升


Agent记忆新范式Recuris:3B小模型到Claude Opus 5全线暴涨图2



Recuris 与既有记忆方法的差别体现在两个维度上:记忆怎么被使用,以及记忆怎么被迭代


Agent记忆新范式Recuris:3B小模型到Claude Opus 5全线暴涨图3

Recuris 与既有记忆方法的两个范式差别


记忆怎么用:既有框架对着不断膨胀的对话历史做记忆的注入或检索,在长程任务中容易产生幻觉,导致技能调用错位;Recuris 在执行事件上取用技能,并由检查器把环境返回转成经过验证的状态更新,而不是听信对话里的一句「已完成」。记忆怎么迭代:既有框架从单次任务成败出发重写整个记忆;Recuris 读取结构化轨迹,把失败定位到具体组件、只修改引起问题的组件,并且只有通过验证集的门控后才被接受。


性能表现:

从 3B 小模型到 Claude Opus 5 全面暴涨


研究团队在四个长程基准(τ²-Retail、τ²-Airline、SkillFlow、Terminal-Bench 2.1)与十个模型上进行了评测。


Agent记忆新范式Recuris:3B小模型到Claude Opus 5全线暴涨图4

Recuris 在从 3B 开源模型到前沿模型上的表现


从 3B 的小模型到 Claude Opus 5 和 GPT-5.6-Sol 这样的前沿模型上,Recuris 均展现出了大幅的性能提升。同时在长程任务上,这一优势不随交互轮次的增加而衰减,并大幅降低了长程执行中常见失败模式的发生率。


长程可靠性:

优势不随任务变长而衰减


长程能力的常见评价困难在于,「任务变长」和「智能体提前放弃」会互相混淆。因此研究团队按任务本身需要多少轮才能完成把 τ²-Retail 分成四个分位。


Agent记忆新范式Recuris:3B小模型到Claude Opus 5全线暴涨图5

按任务固有长度分位的长程表现


Recuris 在全部四个分位上都领先基线,幅度 +17.0 至 +44.7,不随任务变长而单调下滑


结构化轨迹让失败可以被定位


递归改进的前提是知道该修哪里。研究团队没有停留在观察记忆,而是主动向记忆中注入已知故障,再让一个固定的裁判从三种证据中判断是哪个组件出了问题:只看最终成败、看原始轨迹、或看 Recuris 产出的结构化轨迹 Γ。故障池按类别均衡构造,因此一个「永远答同一个组件」的裁判会得到 33.3%。


Agent记忆新范式Recuris:3B小模型到Claude Opus 5全线暴涨图6


只看成败的定位准确率 13.0%,低于常答同一答案的基线;看原始轨迹 37.0%,仅比基线高不到四个点;而看结构化轨迹达到 64.8%,接近基线的两倍


演化出的记忆能迁移:

跨任务,也跨模型


跨任务:记忆从 16 个失败任务中蒸馏而来,在从未参与过的 86 个任务上仍带来 +9.01 至 +17.44 的提升。这一结果验证了 Recuris 的核心假设:结构化的失败轨迹中蕴含的信息足以支撑跨任务迁移。


Agent记忆新范式Recuris:3B小模型到Claude Opus 5全线暴涨图7

演化出的记忆在留出任务上的表现


跨模型:一份记忆只在部署模型上演化一次,随后原封不动交给从未参与演化的前沿模型,同样也能产生明显提升,进一步证明了框架的泛化性。


Agent记忆新范式Recuris:3B小模型到Claude Opus 5全线暴涨图8


关键技术解析


论文给出的判断是:长程场景下真正的瓶颈并非「没有可用的经验」,而是缺少一个紧凑而可靠的任务状态,用来把已积累的经验与当前的执行需求持续对齐。Recuris 的三项核心技术都围绕这一判断展开。


Agent记忆新范式Recuris:3B小模型到Claude Opus 5全线暴涨图9

Recuris 架构总览


经验记忆 — 工作记忆耦合(EM–WM Coupling)


工作记忆(WM)正是那个缺失的状态表示。它持续追踪智能体的当前进展与未解决的目标,并据此从经验记忆(EM)中选取最合适的技能;技能执行后,环境反馈验证进展并更新状态,闭合成一个循环:


任务状态 → 技能选择 → 执行反馈 → 更新的任务状态


具体而言,技能调用发生在执行事件上:草拟一次状态改变调用,或到达一个交互轮次的边界,而不是对着膨胀的历史上下文做相似度匹配。智能体动作之后,检查器依据环境返回的工具回执验证进展,只有被证据支持的状态变更才会被提交:调用了技能、或尝试了一次工具调用,都不算真正完成


结构化轨迹与组件级失败定位


既有方法大多只能从最终成败中学习,这类信号说明「出了问题」,却无法指出该修的是存储的技能、追踪的任务状态、技能调用机制,还是进度验证器。EM–WM 耦合把任务状态、被调用的技能、动作与观测显式串联起来,把执行过程本身变成了关于「记忆如何影响行为」的证据


EM–WM 耦合 → 结构化证据 → 失败定位 → 靶向记忆演化


它把「这次任务失败了」变成「是哪一个组件让它失败」,从而使局部修补成为可能,而不必整体重写记忆。


有界的、验证门控的递归演化


一个固定的 Meta-Agent 读取结构化轨迹,把每个诊断出的失败归因到某个记忆组件,并只修改被引发问题的组件;一个固定的门控只在补丁修复了目标任务、且不在留出集上造成回退时才准入。被接受的更新改变未来的执行模式,产生新的优化信息,进而支撑下一轮更新。


Agent记忆新范式Recuris:3B小模型到Claude Opus 5全线暴涨图10

递归演化的动态


主要作者介绍


余昭辰:新加坡国立大学博士生,研究方向为大语言模型推理、智能体系统与自我改进。


杨灵:普林斯顿大学博后研究员,研究方向为大语言模型和强化学习。


王梦迪:现任普林斯顿大学电子与计算机工程系终身教授,并创立并担任普林斯顿大学「AI for Accelerated Invention」中心的首任主任。她的研究领域涵盖强化学习、可控大模型、优化学习理论以及 AI for Science 等多个方向。


颜水成:新加坡国立大学教授,IEEE / ACM / AAAI / IAPR Fellow,研究方向涵盖计算机视觉、机器学习与多模态大模型。


本工作合作者包括斯坦福大学博后吴英成,牛津大学博后尹榛菲等


Agent记忆新范式Recuris:3B小模型到Claude Opus 5全线暴涨图11


© THE END 

转载请联系本公众号获得授权

投稿或寻求报道:liyazhou@jiqizhixin.com

关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。
more
脑机接口产业联盟新添14家会员单位,会员数量已达363家!
稳定工作超 300 天,还能安全"取出换新"!我国脑机接口领域有新突破
Neuvotion首款AI驱动非侵入式脑体接口产品NeuStim®将于今秋上市,重塑神经康复新范式
国家脑机接口产业标准体系建设指南(2026 版)(征求意见稿)
【存储与接口芯片要闻简报】NAND收入单季大增77%,长鑫DDR5突破9000MT/s,中国存储产业链进入量价齐升阶段
巴西团队硬核“焊死”RTX 5090供电接口,物理隔绝烧毁风险
超声脑机接口再添一员!脑器时代完成数千万元种子轮融资
副总理调研!南开大学介入式脑机接口,到底神奇在哪?
靠意念抓握、脑电波诊疗疾病、帮盲人重建视觉……2026福祉博览会“脑机接口专区”精彩剧透!
00后清华博士生创业“神经接口”:把人类肌肉反应炼成Token
Copyright © 2025-成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号