
过去几年,大模型已经从单轮聊天机器人,快速演变为软件工程、深度检索、计算机操作、多模态交互与科学发现中的决策核心。新的问题随之出现:一个智能体即使单步表现足够聪明,能否在数百、数千次相互依赖的行动中始终记得目标、修正错误、管理上下文,并可靠安全地把任务做完?
这正是长程智能体(Long-Horizon Agents)研究要回答的问题。在智能体能力快速演进的今天,长程能力正日益成为其进入真实生产环境的核心瓶颈。依据 METR 的测量:在约 50% 成功率下,前沿智能体完成软件工程类任务的 “人类专家等效时长” 已从早期模型的秒级提升到十余小时。如图 1 所示,该时间跨度大约每 7 个月翻一倍;从 2023 年后,翻倍周期进一步缩短至约 4 个月,这说明智能体的长程能力仍处在高速扩展阶段。

图 1 前沿智能体可完成任务的时间跨度持续增长
在本文中,我们想强调的是:智能体 “跑得久”,并不等于 “具备长程能力”。真正的关键,不在于占用更多时间与算力,而在于能否在更长、更复杂、更真实的推理依赖链上持续、有效地行动。长期以来,Autonomous Agent、Self-Evolving Agent 等概念常与长程智能体混用。为理理清这一局面,这篇 149 页综述系统梳理超过 900 项研究、系统与工程实践,首次以「外部脚手架工程 × 内部模型优化」的协同演化视角,给出长程智能体的统一定义、完整分类与未来路线图。

论文标题:Towards Long-Horizon Agents: A Survey
项目主页:https://long-horizon-agents.github.io/
论文链接:https://openreview.net/forum?id=HyhfhlbWGh
项目仓库:https://github.com/RUC-NLPIR/Awesome-Long-Horizon-Agents
目前该综述刚发布就在小红书、GitHub、X 等社交平台上收获极高的关注度与反响!

为什么长程任务难:
单步错误的积累会导致整条轨迹失控
长程任务的难点并不只是某一步是否答对,而是大量紧密耦合的步骤必须组成一条连贯轨迹。单步看似微小的偏差,在长链条中会被反复继承和放大。论文将典型失败归纳为三类:
目标漂移与误差累积:执行数千步后,Agent 逐渐偏离最初目标;局部错误不断叠加最终把整条轨迹带向错误方向。
上下文腐化与窗口压力:上下文并非越长越好。随着历史推理轨迹和工具输出的不断堆积,模型可能会出现性能骤降,也可能因感知到窗口将满而过早结束任务。
稀疏、延迟奖励与不可逆行动:很多任务只在最后给出奖励信号,这使得中间决策难以获得准确归因;而任务执行过程越长,出现误删数据、错误授权或错误操作等不可逆操作的风险越高。
这意味着,单纯扩大参数量或上下文窗口并不能解决全部问题。一个模型即使拥有更强推理能力,如果缺少计划维护、状态持久化、工具治理、验证和恢复机制,仍可能在长轨迹中迅速失控。
核心论点:
智能体外部和内部协同进化
基于上述挑战,本综述提出的核心论点:“长程智能体能力” 是系统级能力,它源于外部 “脚手架工程(Harness Engineering)” 与内部 “模型优化(Model Optimization)” 的协同演进。
理解长程智能体的关键是把视线从模型单体移向由模型与 Harness 共同构成的完整系统。模型提供推理和行动的策略;而 Harness 则负责进一步支持模型决策的执行,包括组织上下文、维护状态、调度工具、编排流程,并对关键步骤进行验证与恢复。二者共同决定智能体能否沿着一条漫长而相互依赖的轨迹稳定前进。因此,长程能力应被视为整个 Model-Harness 系统的属性,而不是基础模型的一项孤立指标。
论文进一步提出一条双向演化路径:如图 2 所示,Harness Engineering 先把计划、记忆、工具和验证等能力外置,用工程手段迅速拓展模型的能力边界;系统在真实交互中积累的轨迹与反馈,再通过 Model Optimization,用数据 / 环境构造、微调、强化学习、蒸馏和自进化等策略逐步沉淀到模型内部。模型变强后,又能驾驭更复杂的 Harness。外部能力扩展与内部能力吸收由此形成持续循环。

图 2 长程智能体研究全景:外部脚手架工程与内部模型优化共同进化
三层长程阶梯:从长窗口推理,
到跨会话记忆,再到跨任务泛化
本论文不以 “运行时长” 作为长程任务的唯一标准,而是考察任务是否包含大量相互依赖的逻辑决策,以及这些依赖需要跨越多大的执行边界。如图 3 琐事,本文提出 H1 - H3 三层任务与 C1 - C3 三层能力的阶梯框架:
任务层级:
H1|窗口内任务:单上下文窗口内完成,但不是一次回答就结束;须在持续交互中,把相互依赖的决定组成连贯轨迹。
H2|跨窗口 / 跨会话任务:远超单窗口或单会话(常持续数小时至数天);须压缩上下文,并在中断或交接后恢复进度。
H3|跨任务流:任务持续到来,总目标跨越多个子任务与环境;要求持久运行,而非封闭的一次性回合。
能力层级:
C1|交互式推理(对 H1):规划 — 行动 — 观察 — 修正,维持连贯路径。
C2|状态与记忆(对 H2):在 C1 之上,读写记忆、建检查点、可靠恢复。
C3|经验积累(对 H3):在 C1/C2 之上,沉淀可复用技能,从经验中泛化并持续改进。
可以看出,三个能力层级并不是彼此割裂的:C2 以 C1 为前提,C3 又建立在 C1 与 C2 之上。一个能够长期成长的 H3 智能体,仍必须在每个具体任务中维持稳定推理和可靠记忆。

图 3 三类长程任务及其对应能力,任务跨度越大,能力要求越高
从 Prompt 到 Harness:
智能体控制面的三次跃迁
如图 4 ,本综述将大模型系统的演进概括为三个阶段。变化的关键不是 “提示词越来越长”,而是可被工程化控制的范围不断向外扩展。

图 4 长程智能体跨越三个阶段的演进概览
阶段一:Prompt Engineering(2020 - 2023)。通过指令、思维链、任务分解和自我修正等提示策略,引导模型在单次调用中产生更可靠的推理。控制主要集中在输入文本。
阶段二:Context Engineering(2023 - 2025)。系统开始主动组织检索结果、工具返回、对话历史与压缩摘要。重点从 “如何写一个好提示” 转向 “每一步究竟让模型看到什么上下文”。
阶段三:Runtime Harness(2025 至今)。控制面扩展到智能体运行脚手架:Harness 不仅组织上下文,还管理工具、记忆、工作流、权限、验证、恢复和多智能体协作。Agent 由一次模型调用,演化为可持续运行的智能体系统。
这一演进也解释了为什么当下的 Agent 竞争越来越像系统工程竞争:同一个基础模型,在不同 Harness 中可能呈现截然不同的任务上限、成本和可靠性。
六维图谱:
把碎片化智能体研究放进统一坐标系
本综述从 Foundation、Evolution、Harness、Optimization、Application 和 Frontier 六个视角下,如图 5 所示,论文将分散在记忆、工具学习、多智能体、强化学习、上下文工程、安全治理等方向的工作放入同一张图谱。其价值不仅是 “列出更多论文”,更在于回答每项改进究竟发生在哪里:是基础策略更强,还是 Harness 更完善;是提升单窗口推理,还是解决跨会话状态;是任务成功率更高,还是成本和安全边界得到改善。

图 5 长程智能体研究的统一分类框架:从演化、Harness、模型优化和应用,延伸至开放前沿
外部 Harness:
让长程能力可控制、可验证、可恢复
如图 6 所示,本综述把 Harness 拆为六个相互连接的核心组件,覆盖从目标设定到最终交付的完整生命周期:
循环与工作流:包括线性执行、Plan—Execute 和分支搜索。它们负责显式分解任务、追踪子目标,并在失败时重规划或回退。
上下文与记忆:对工作上下文执行丢弃、压缩和选择,将长期有效的信息写入持久记忆,避免上下文无限膨胀。
工具、MCP 与技能:连接外部能力,支持工具接口与协议、主动工具发现以及可复用技能库。工具越多,选择、描述和安全治理也越重要。
编排:完成任务分解、角色分配、协作拓扑和通信协议管理,使多个模型或智能体能够协同,而不是互相制造噪声。
Hooks 与中间件:在输入、工具调用和协议边界执行规则、权限、监控与安全策略,并可根据风险动态调整。
验证:从步骤级到任务结束级检查正确性、安全性和目标一致性,并用外部信号驱动修正,而非依赖模型自我认可。
值得注意的是,Harness 并不只是 “给模型套一层壳”。它承担的是长期执行中的状态机、控制器和安全边界:当模型出现短视、遗忘或误判时,Harness 必须能让系统停下来、检查、切换路径或恢复。

图 6 Agent Harness 全景:六个核心组件贯穿从目标设定、规划执行到反思恢复、验证交付的完整生命周期。
内部优化:
把外化长程能力逐步写回模型内部
如果说 Harness 解决的是 “运行时怎样把事情做完”,内部模型优化解决的则是 “如何让策略本身越来越适合长程任务”。综述沿完整训练链路梳理了七类方向:
架构底座:显式长上下文、压缩状态、混合架构与高吞吐机制,使长轨迹可表示、可训练、可负担地解码。
任务、环境与轨迹合成:构建规模化、可验证、足够真实的交互环境,并生成包含成功与失败经验的长轨迹数据。
预训练与中期训练:注入推理先验、长上下文状态、多模态感知和合理数据配比。
微调:通过指令选择、课程学习与蒸馏,让模型先掌握基础交互,再逐步面对更长、更难的任务。
智能体强化学习:处理长轨迹中的信用分配、策略优化、采样策略与多轮交互,使稀疏终局奖励能够指导中间步骤。
On-Policy Distillation:从模型自己生成、且不断变化的分布中学习,缩短教师策略与部署策略之间的偏差。
自进化:从离线经验整理走向在线自我改进,进一步探索智能体与环境共同演化。
这条链路强调:训练数据不能只包含最终答案,还需要真实的环境反馈、过程状态、工具结果与错误恢复轨迹;优化目标也不能只看单步准确率,而要关注整条轨迹是否高效、可恢复且满足最终约束。

图 7 长程智能体能力的训练管线:以架构底座为基础,通过数据与环境合成、预训练、微调、强化学习、在线策略蒸馏和自进化,将运行时能力逐步内化进模型
长程智能体的形态:
以接口为线索的五类应用
如图 8 所示,论文按 Agent 与环境交互的接口,将实践形态归纳为五类。看似不同的应用,背后都承受目标漂移、状态持久化、反馈利用和验证恢复等共同压力:
软件工程:理解大型代码仓库,维护跨文件计划,根据测试与评审反馈反复修复。
信息检索:执行深度或广度搜索,整合多源证据,在长链检索保持结论可追溯。
计算机操作:在浏览器、桌面和移动端持续感知界面状态,完成真实操作。
多模态智能体:在图像、视频、音频等高成本信息中主动选择观察对象,并完成跨模态理解与生成。
通用智能体:面向个人助理、具身系统和生产力任务,在多工具、多环境和长期目标之间切换。
相应地,评测也必须从一次性问答升级为 “面向时间跨度的评测”:任务是否真正包含长依赖?中间步骤能否检查?失败后是否恢复?系统在不同预算和 Harness 下的能力是否可归因?这些问题将直接决定榜单结果能否反映真实部署价值。

图 8 长程智能体的五类代表性应用形态
未来展望:
长程智能体的四个前沿方向
论文最终将开放问题归纳为四个轴、九个具体方向。随着任务跨度继续增长,研究重点将从 “能不能跑起来” 转向 “能否长期有效、经济并且可信地运行”。
Evolution:泛化与持续学习。让 Harness 自身能够演化、迁移和复用,并支持持续学习与终身学习。关键问题是:外置流程如何自动优化,又如何把经验稳定地内化为长期能力。
Effectiveness:进入真实环境。构建既可验证又足够真实的训练环境,提高昂贵真实交互的样本效率,并推动数字 Agent 向具身智能体迁移。论文认为,下一阶段的限速因素可能不再只是模型规模,而是环境构建。
Efficiency:学会花预算。未来 Agent 需要感知任务难度、剩余 token、时间和金钱预算,动态决定何时深思、何时压缩上下文、何时切换模型。多模态场景还要决定保留哪些帧、音频或视觉证据。
Trustworthiness:可恢复且可治理的自治。长轨迹会放大错误与权限风险,因此需要更早识别失败路径,以外部验证锚定反思,并通过最小权限、审批门、沙箱、来源追踪和独立审计保护安全不变量。
其中,一个重要判断是:生产环境中的安全与权限边界,主要落在 Harness,而非模型权重中。模型侧对齐必要但不充分;真正决定哪些工具可调用、哪些行动需审批、哪些经验可复用的,是运行时控制层。
总结:迈向长程智能体
过去的大模型 Scaling 围着参数、数据和算力而优化;进入智能体后,时间跨度成为另一条轴线:衡量的不是系统能跑多久,而是能否在更长、更复杂、更真实的依赖链上持续有效行动。这篇综述的核心判断很明确:长程智能体不是 “更聪明” 的单点升级,而是 Harness 工程与模型优化共同演化 的结果。从基础、演化、Harness、优化、应用到前沿,我们把分散研究收进同一张地图,也把开放问题落在演化、有效性、效率与可信性四条轴上。在梳理既有工作之外,我们还提炼若干将定义下一阶段长程智能体研究的新兴方向。希望本文能为后续研究奠定坚实基础,并为研究者与实践者提供有用参考。随着智能体系统不断成熟,长程智能体仍将是一个核心而开放的问题,并很可能在构建稳健、通用、持久的人工智能中发挥决定性作用。
作者信息:本文由中国人民大学、北京大学、清华大学、中山大学、香港科技大学和新加坡国立大学的研究者联合完成。论文的核心贡献者为董冠霆、宋晓帅、扈煜阳、金佳杰与张宬浩,通讯作者为中国人民大学高瓴人工智能学院窦志成教授。
© THE END
转载请联系本公众号获得授权
投稿或寻求报道:liyazhou@jiqizhixin.com