

在大语言模型智能体的落地过程中,很多团队都会遇到类似的问题:明明选用的底座模型性能很强,实际执行复杂任务时的效果却不达预期。这一问题的核心矛盾往往并不在模型本身,而是在支撑模型运行的框架设计上——不同类型的任务对内存管理、规划逻辑、工具调用策略的需求差异极大,统一设计的固定框架很难适配所有场景。
针对这一痛点,近期研究团队提出了JIT-Agent,一款专门用于动态生任务专属智能体运行框架(Harness)的模型,在多个基准测试中帮助开源底座模型的表现追平甚至超过了前沿闭源模型。

论文标题:Scaling Harness Intelligence via Just-in-Time Harness Evolution
论文链接:https://arxiv.org/pdf/2608.25593.pdf
项目官网:https://bingreeky.github.io/JIT-site
开源仓库:https://github.com/bingreeky/JIT
Hugging Face主页:https://huggingface.co/JIT-Agent
研究背景
智能体的实际性能由底座大语言模型和配套的智能体运行框架共同决定,后者负责管控交互历史留存、任务意图生成、工具能力暴露、动作执行逻辑、异常校验与恢复等核心流程,是模型能力落地的关键载体。
过往的运行框架大多采用提前设计(AOT)的思路,即先基于历史经验优化出一套通用的框架结构,再推广到不同任务中使用(就比如我们使用的 Codex、Claude Code),这种模式在任务分布稳定的场景下表现尚可,但很难适配差异极大的任务需求。
比如大范围搜索类任务更适合并行探索多源证据,终端操作类任务适合精简的串行ReAct循环,深度研究类任务需要保留检索到的证据作为工作记忆,代码仓库类任务则需要文件系统支撑补丁、测试、版本状态的管理。如果用同一套框架适配所有场景,要么需要投入极高的成本探索足够大的设计空间,要么只能牺牲部分场景的性能。
针对这一问题,研究团队提出了即时生成(JIT,Just-in-time)的框架设计思路,即训练一个专门的元智能体,针对每个具体任务的特点,当场生成适配的专属运行框架,再让底座大语言模型在这个框架下执行任务,这就是 JIT-Agent 的核心设计逻辑。
JIT-Agent核心设计
JIT-Agent是一款27B参数的轻量元智能体,推理阶段会接收任务说明、框架协议、可用工具/技能列表,以及少量历史框架参考信息,输出可直接执行的任务专属运行框架,支撑底座模型完成任务。随着执行反馈和轨迹数据的积累,JIT-Agent还可以动态修正框架、更新历史框架库,在自身参数不变的情况下实现测试阶段的框架演化。

整个系统的核心是框架智能,包含三个关键属性:首先是适配性,生成的框架能够匹配任务和底座模型的特点;其次是可靠性,生成的框架可稳定执行,出现问题时能够自动修复;最后是可演化性,能够基于执行反馈不断优化后续生成的框架效果。
为了实现这些能力,研究团队首先将智能体运行框架拆解为内存、规划、动作、能力编排四个可组合的模块,搭建了统一的框架代码库HarnessFactory,重新实现了ReAct、Plan-and-Execute等13种当前主流的智能体框架作为种子库,让框架生成从无约束的程序合成变成了基于可复用模块的组合搭建,大幅降低了生成难度。
三阶段训练流程
JIT-Agent的训练流程对应推理阶段的生命周期,分为定制化学习、修复能力学习、演化能力学习三个阶段,逐步实现稳定的框架生成能力。

第一阶段是定制化学习,研究团队使用能力更强的教师模型,针对每个任务从种子库中采样3个匹配的参考框架,生成符合协议要求、可稳定执行的目标框架作为标注数据,通过监督微调让JIT-Agent学会根据任务和参考信息生成合规的框架。同时加入偏好学习目标,引导模型优先生成效果更好、延迟更低、成本更少的框架方案。
第二阶段是修复能力学习,研究团队没有直接丢弃第一阶段生成失败的案例,而是将这些失败的框架和对应的编译器错误、接口不匹配、运行时异常等诊断信息作为输入,让教师模型生成对应的修复补丁,最终得到两步骤内可以修复为可执行框架的训练数据,训练JIT-Agent学会根据错误信息修复有问题的框架,提升生成的可靠性。
第三阶段是演化能力学习,研究团队提出了演化组解耦策略优化(Evo-GDPO)方法,让JIT-Agent学会生成比历史框架库中的方案效果更好的框架。训练过程中,模型会基于当前的框架库生成多个候选框架,和历史最优方案在相同条件下执行对比,只有在效果不弱于历史最优、且至少在延迟或成本上有一项提升的候选框架,才会被加入框架库作为未来的参考。这一阶段的训练让JIT-Agent的生成能力可以随着执行数据的积累持续迭代,不需要更新模型参数就能不断提升表现。
实际效果验证
研究团队在深度研究、日常工作、规划、办公四类共9个智能体基准测试上验证了JIT-Agent的效果,覆盖信息检索、长指令遵循、约束感知规划、多应用办公操作等常见智能体场景。

从测试结果来看,使用JIT-Agent生成的框架替换底座模型的默认框架后,所有18组底座-基准配对的性能都有明显提升。GLM-5.2的9个基准平均得分从74.1提升到81.8,提升7.7分;DeepSeek-V4-Flash的平均得分从66.7提升到75.5,提升8.8分。其中提升幅度最大的是需要持续状态管理和约束追踪的规划类任务,DeepSeek-V4-Flash在DeepPlanning-Shopping任务上提升24.8分,GLM-5.2在DeepPlanning-Travel任务上提升20.2分。

搭配JIT-Agent的开源底座模型表现甚至超过了多款前沿闭源模型:DeepSeek-V4-Flash搭配JIT-Agent后,在DeepSearchQA上超过GPT-5.6 9.1分,在OdysseyBench上超过GPT-5.6 4.3分;GLM-5.2搭配JIT-Agent后在7个基准上排名第一,整体表现和GPT-5.6基本持平。
在和Claude Code、OpenCode等成熟固定框架的对比测试中,JIT-Agent的表现同样亮眼,在6组底座-基准配对中拿下了4个性能第一,同时在所有测试场景中都实现了最低的词元消耗和API调用成本,相比最便宜的固定框架平均降低36%的单次任务成本,最高降幅可达54.1%。比如在DeepSeek-V4-Flash的xBench-DS测试中,JIT-Agent生成的框架将单次任务的词元消耗从52.7万降到21.2万,成本从0.075美元降到0.039美元,同时性能从78.0分提升到82.0分,实现了效果和成本的双重优化。


JIT-Agent的提升效果不受底座模型的限制,在DeepSeek V4、Qwen3.6、Mimo-V2.5三个不同模型家族的6个不同参数版本上,替换默认ReAct框架为JIT生成的框架后,所有24组配对的性能都有提升,平均提升7.6分,说明框架智能的提升是可迁移的,并非只针对特定底座模型的优化。

此外研究团队还验证了流式推理模式的效果,即框架库会随着任务执行不断积累优质的框架方案,作为后续任务的参考。测试显示,随着执行任务数量的增加,流式推理模式的准确率逐步超过静态生成模式,且不会明显提升成本和工具调用次数,验证了JIT-Agent的演化能力的实际价值。
生成框架案例展示
为了更直观地展示JIT-Agent的生成逻辑,研究团队公开了两个典型任务的生成框架示例,两者虽然都遵循四模块协议,但整体逻辑完全适配任务的不同特点。

针对需要跨应用操作的联系人处理任务,JIT-Agent生成的框架会将需求编译为明确的DAG依赖图:联系人发现和格式检查是过滤操作的前置条件,工作簿创建需要等待记录标准化完成,邮件发送需要等待附件验证通过。执行模块会按照依赖关系执行节点,同时存储中间结果,避免下游节点重复计算。

针对需要多源证据交叉验证的身份查询任务,JIT-Agent生成的框架没有使用固定的DAG结构,而是支持动态分解子问题,新增了委托子智能体的能力,子智能体拥有独立的内存和研究工具,完成研究后只返回结构化的事实结果,主流程不需要继承子智能体的完整交互轨迹,既保证了探索的灵活性,也避免了上下文冗余。
总结与展望
JIT-Agent的提出,验证了框架智能是智能体能力提升的独立维度,不需要仅通过提升底座模型参数规模来获取更好的智能体表现。通过将框架生成转化为可训练的能力,JIT-Agent实现了针对不同任务的动态框架适配,在多个测试场景下帮助开源模型追平了前沿闭源模型的表现,同时大幅降低了推理成本。
未来,框架智能和模型参数的协同设计会是重要的研究方向,生产环境中的智能体系统可以保留稳定的核心框架,同时针对具体任务的特点,动态调整部分模块的逻辑,在系统稳定性和任务适配性之间找到更好的平衡。随着相关技术的成熟,未来的大语言模型不仅可以在给定的框架下执行任务,还可以自行优化运行框架,进一步释放智能体的落地潜力。
> 本文由 Intern-S2 等 AI 生成,机智流编辑部校对
-- 完 --
机智流推荐阅读:
1.
2.
3.
4.
cc | 大模型技术交流群 hf | HuggingFace 高赞论文分享群 lc|LangChain 技术交流群 code | AI Coding 交流群 具身 | 具身智能交流群 硬件 | AI 硬件交流群 推理 | AI 推理框架交流群 智能体 | Agent 技术交流群