迈向长程智能体,人大高瓴发布149页全景综述

机器之心 2026-07-25 15:30
迈向长程智能体,人大高瓴发布149页全景综述图1


过去几年,大模型已经从单轮聊天机器人,快速演变为软件工程、深度检索、计算机操作、多模态交互与科学发现中的决策核心。新的问题随之出现:一个智能体即使单步表现足够聪明,能否在数百、数千次相互依赖的行动中始终记得目标、修正错误、管理上下文,并可靠安全地把任做完?


这正是长程智能体(Long-Horizon Agents)研究要回答的问题。在智能体能力快速演进的今天,长程能力正日益成为其进入真实生产环境的核心瓶颈。依据 METR 的测量:在约 50% 成功率下,前沿智能体完成软件工程类任务的 “人类专家等效时长” 已从早期模型的秒级提升到十余小时。如图 1 所示,该时间跨度大约每 7 个月翻一倍;从 2023 年后,翻倍周期进一步缩短至约 4 个月这说明智能体的长程能力仍处在高速扩展阶段。


迈向长程智能体,人大高瓴发布149页全景综述图2

图 1 前沿智能体可完成任务的时间跨度持续增长


在本文中,我们想强调的是:智能体 “跑得久”,并不等于 “具备长程能力”。真正的关键,不在于占用更多时间与算力,而在于能否在更长、更复杂、更真实的推理依赖链上持续、有效地行动。长期以来,Autonomous Agent、Self-Evolving Agent 等概念常与长程智能体混用。为理理清这一局面,这篇 149 页综述系统梳理超过 900 项研究、系统与工程实践,首次以「外部脚手架工程 × 内部模型优化」的协同演化视角,给出长程智能体的统一定义、完整分类与未来路线图。


迈向长程智能体,人大高瓴发布149页全景综述图3



目前该综述刚发布就在小红书、GitHub、X 等社交平台上收获极高的关注度与反响!


迈向长程智能体,人大高瓴发布149页全景综述图4


为什么长程任务难:

单步错误的积累会导致整条轨迹失控


长程任务的难点并不只是某一步是否答对,而是大量紧密耦合的步骤必须组成一条连贯轨迹。单步看似微小的偏差,在长链条中会被反复继承和放大。论文将典型失败归纳为三类:


这意味着,单纯扩大参数量或上下文窗口并不能解决全部问题。一个模型即使拥有更强推理能力,如果缺少计划维护、状态持久化、工具治理、验证和恢复机制,仍可能在长轨迹中迅速失控。


核心论点:

智能体外部和内部协同进化


基于上述挑战,本综述提出的核心论点:“长程智能体能力” 是系统级能力,它源于外部 “脚手架工程(Harness Engineering)” 与内部 “模型优化(Model Optimization)” 的协同演进。


理解长程智能体的关键是把视线从模型单体移向由模型与 Harness 共同构成的完整系统。模型提供推理和行动的策略;而 Harness 则负责进一步支持模型决策的执行,包括组织上下文、维护状态、调度工具、编排流程,并对关键步骤进行验证与恢复。二者共同决定智能体能否沿着一条漫长而相互依赖的轨迹稳定前进。因此,长程能力应被视为整个 Model-Harness 系统的属性,而不是基础模型的一项孤立指标。


论文进一步提出一条双向演化路径:如图 2 所示,Harness Engineering 先把计划、记忆、工具和验证等能力外置,用工程手段迅速拓展模型的能力边界;系统在真实交互中积累的轨迹与反馈,再通过 Model Optimization,用数据 / 环境构造、微调、强化学习、蒸馏和自进化等策略逐步沉淀到模型内部。模型变强后,又能驾驭更复杂的 Harness。外部能力扩展与内部能力吸收由此形成持续循环。


迈向长程智能体,人大高瓴发布149页全景综述图5

图 2 长程智能体研究全景:外部脚手架工程与内部模型优化共同进化


三层长程阶梯:从长窗口推理,

到跨会话记忆,再到跨任务泛化


本论文不以 “运行时长” 作为长程任务的唯一标准,而是考察任务是否包含大量相互依赖的逻辑决策,以及这些依赖需要跨越多大的执行边界。如图 3 琐事,本文提出 H1 - H3 三层任务与 C1 - C3 三层能力的阶梯框架:


任务层级:


能力层级:


可以看出,三个能力层级并不是彼此割裂的:C2 以 C1 为前提,C3 又建立在 C1 与 C2 之上。一个能够长期成长的 H3 智能体,仍必须在每个具体任务中维持稳定推理和可靠记忆。


迈向长程智能体,人大高瓴发布149页全景综述图6

图 3 三类长程任务及其对应能力,任务跨度越大,能力要求越高


从 Prompt 到 Harness:

智能体控制面的三次跃迁


如图 4 ,本综述将大模型系统的演进概括为三个阶段。变化的关键不是 “提示词越来越长”,而是可被工程化控制的范围不断向外扩展。


迈向长程智能体,人大高瓴发布149页全景综述图7

图 4 长程智能体跨越三个阶段的演进概览


段一:Prompt Engineering(2020 - 2023)。通过指令、思维链、任务分解和自我修正等提示策略,引导模型在单次调用中产生更可靠的推理。控制主要集中在输入文本。


阶段二:Context Engineering(2023 - 2025)。系统开始主动组织检索结果、工具返回、对话历史与压缩摘要。重点从 “如何写一个好提示” 转向 “每一步究竟让模型看到什么上下文”。


阶段三:Runtime Harness(2025 至今)。控制面扩展到智能体运行脚手架:Harness 不仅组织上下文,还管理工具、记忆、工作流、权限、验证、恢复和多智能体协作。Agent 由一次模型调用,演化为可持续运行的智能体系统。


这一演进也解释了为什么当下的 Agent 竞争越来越像系统工程竞争:同一个基础模型,在不同 Harness 中可能呈现截然不同的任务上限、成本和可靠性。


六维图谱:

把碎片化智能体研究放进统一坐标系


本综述从 Foundation、Evolution、Harness、Optimization、Application 和 Frontier 六个视角下,如图 5 所示,论文将分散在记忆、工具学习、多智能体、强化学习、上下文工程、安全治理等方向的工作放入同一张图谱。其价值不仅是 “列出更多论文”,更在于回答每项改进究竟发生在哪里:是基础策略更强,还是 Harness 更完善;是提升单窗口推理,还是解决跨会话状态;是任务成功率更高,还是成本和安全边界得到改善。


迈向长程智能体,人大高瓴发布149页全景综述图8

图 5 长程智能体研究的统一分类框架:从演化、Harness、模型优化和应用,延伸至开放前沿


外部 Harness:

让长程能力可控制、可验证、可恢复


如图 6 所示,本综述把 Harness 拆为六个相互连接的核心组件,覆盖从目标设定到最终交付的完整生命周期:


值得注意的是,Harness 并不只是 “给模型套一层壳”。它承担的是长期执行中的状态机、控制器和安全边界:当模型出现短视、遗忘或误判时,Harness 必须能让系统停下来、检查、切换路径或恢复。


迈向长程智能体,人大高瓴发布149页全景综述图9

图 6 Agent Harness 全景:六个核心组件贯穿从目标设定、规划执行到反思恢复、验证交付的完整生命周期。


内部优化:

把外化长程能力逐步写回模型内部


如果说 Harness 解决的是 “运行时怎样把事情做完”,内部模型优化解决的则是 “如何让策略本身越来越适合长程任务”。综述沿完整训练链路梳理了七类方向:


这条链路强调:训练数据不能只包含最终答案,还需要真实的环境反馈、过程状态、工具结果与错误恢复轨迹;优化目标也不能只看单步准确率,而要关注整条轨迹是否高效、可恢复且满足最终约束。


迈向长程智能体,人大高瓴发布149页全景综述图10

图 7 长程智能体能力的训练管线:以架构底座为基础,通过数据与环境合成、预训练、微调、强化学习、在线策略蒸馏和自进化,将运行时能力逐步内化进模型


长程智能体的形态:

以接口为线索的五类应用


如图 8 所示,论文按 Agent 与环境交互的接口,将实践形态归纳为五类。看似不同的应用,背后都承受目标漂移、状态持久化、反馈利用和验证恢复等共同压力:

相应地,评测也必须从一次性问答升级为 “面向时间跨度的评测”:任务是否真正包含长依赖?中间步骤能否检查?失败后是否恢复?系统在不同预算和 Harness 下的能力是否可归因?这些问题将直接决定榜单结果能否反映真实部署价值。


迈向长程智能体,人大高瓴发布149页全景综述图11

图 8 长程智能体的五类代表性应用形态


未来展望:

长程智能体的四个前沿方向


论文最终将开放问题归纳为四个轴、九个具体方向。随着任务跨度继续增长,研究重点将从 “能不能跑起来” 转向 “能否长期有效、经济并且可信地运行”。



其中,一个重要判断是:生产环境中的安全与权限边界,主要落在 Harness,而非模型权重中。模型侧对齐必要但不充分;真正决定哪些工具可调用、哪些行动需审批、哪些经验可复用的,是运行时控制层。


总结:迈向长程智能体


过去的大模型 Scaling 围着参数、数据和算力而优化;进入智能体后,时间跨度成为另一条轴线:衡量的不是系统能跑多久,而是能否在更长、更复杂、更真实的依赖链上持续有效行动。这篇综述的核心判断很明确:长程智能体不是 “更聪明” 的单点升级,而是 Harness 工程与模型优化共同演化 的结果。从基础、演化、Harness、优化、应用到前沿,我们把分散研究收进同一张地图,也把开放问题落在演化、有效性、效率与可信性四条轴上。在梳理既有工作之外,我们还提炼若干将定义下一阶段长程智能体研究的新兴方向。希望本文能为后续研究奠定坚实基础,并为研究者与实践者提供有用参考。随着智能体系统不断成熟,长程智能体仍将是一个核心而开放的问题,并很可能在构建稳健、通用、持久的人工智能中发挥决定性作用。


作者信息:本文由中国人民大学、北京大学、清华大学、山大学、香港科技大学和新加坡国立大学的研究者联合完成。论文的核心贡献者为董冠霆宋晓帅扈煜阳金佳杰张宬浩,通讯作者为中国人民大学高瓴人工智能学院窦志成教授


© THE END

转载请联系本公众号获得授权

投稿或寻求报道:liyazhou@jiqizhixin.com

声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。 
more
亚马逊启动新一轮大规模裁员,AI自动化成关键推手
谷歌整合Intrinsic加速布局物理AI,聚焦制造自动化与开发者生态
2026年全球及中国AOI检测行业供需情况、市场规模及趋势研判:制造业转型升级带动自动化检测普及,AOI检测成为质量保障关键支撑[图]
IDAS 2026 IC设计自动化产业峰会报名正式开启
工业自动化的未来展望:AI与网络安全
联邦快递聚焦“实用型自动化”:联手外部机器人企业推进仓储革新
清华校友带队!小米投的国内工业自动化领军者A股上市辅导已完成
光模块整线自动化设备知名厂商盘点
人形机器人进入万元时代,自动化厂商杀入供应链上游
Kimi Claw 实测:OpenClaw 热潮之下,自动化 AI 仍是半成品|AI 上新
Copyright © 2025 成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号