

当前智能体AI的能力边界不断拓展,已经能实现长程推理、工具调用、网页搜索、计算机操作等复杂任务。这些能力的提升越来越依赖基于交互经验的训练,而非单纯的预训练。但目前高价值的交互训练环境仍存在明显瓶颈:人工标注的环境规模扩张速度受限于人力成本,固定合成的环境池则无法随模型能力提升自适应调整,当模型性能超过环境难度上限后,训练就会陷入停滞。
针对这一问题,来自华盛顿大学、斯坦福大学、麻省理工学院等机构的研究团队提出了全新的自对弈强化学习框架SPADE,让单一大语言模型同时承担环境设计和推理任务的双重角色,实现能力的持续提升。

论文标题:SPADE ♠: Self-Play in Adaptive Synthetic Executable Environments
论文链接:https://arxiv.org/pdf/2608.19197.pdf
开源代码地址:https://github.com/spade-rl/spade
研究背景
随着大语言模型能力的提升,训练数据的瓶颈已经从静态的文本语料转向了交互式的训练环境。行业数据显示,头部实验室每年在环境构建上的投入已经超过10亿美元,还有大量创业公司也在布局相关赛道,但现有的环境构建方案都存在明显的短板。
提示工程类方案只能优化模型推理时的表现,不会更新模型权重,能力提升上限和每个任务的人工设计绑定,无法沉淀为模型的通用能力。人工标注的环境质量高,但扩张速度受限于人力,无法匹配大模型的训练需求。固定规则的合成环境生成方案可以快速输出大量任务,但生成器本身不会随模型能力进化,很快就会被模型穷尽,训练会进入饱和期。传统的自对弈方案让模型同时扮演出题者和解题者,但容易受信息对称的限制,生成的任务超不出模型本身的知识边界,还可能放大原有错误,且大多只能生成单轮任务,只有稀疏的最终奖励,没有完整的多轮交互逻辑,无法支撑真正的持续进化。
SPADE的核心运行逻辑
SPADE的全称是Self-Play in Adaptive Synthetic Executable Environments,核心是让同一个大语言模型通过不同的系统提示切换两个角色:环境设计者和推理智能体,两者共享同一套模型参数,更新任意一个角色的梯度都会作用于整体模型。
环境设计者的任务是生成完整的可执行训练环境,输出为符合OpenAI Gym风格的Python代码,包含reset()和step()接口,本质是一个完整的交互流程,内置状态转移规则、奖励函数和验证逻辑。这种代码即环境的设计,既可以支撑单轮的推理任务,比如数学题求解,一步给出答案就获得奖励,也可以支撑多轮的智能体交互任务,比如工具调用、游戏闯关,需要多步操作才能完成,理论上任何可计算的交互流程都可以被编码为Python代码,因此环境的设计空间几乎没有限制。
除了环境代码之外,环境设计者还会为每个环境生成一条专属的特权提示,包含解决任务的关键思路或者部分解法,但不会直接给出答案。这条提示不会出现在推理智能体的常规训练输入中,仅用于计算环境设计者的奖励。
推理智能体的任务则是和生成的环境交互,通过逐步操作获得奖励,完成训练。
为了让生成的环境刚好匹配推理智能体的能力边界,研究团队设计了基于提示的后悔值奖励机制:对于同一个环境,分别测量推理智能体带特权提示和不带特权提示的平均表现,两者的差值就是环境设计者获得的奖励。如果差值高,说明这个环境的难度刚好卡在智能体的能力边界上——拿到提示就能顺利解决,没有提示则很难完成,刚好适合用来训练;如果差值低,要么是环境太简单,有没有提示智能体都能做对,训练价值很低;要么是环境难度太高,哪怕有提示也做不出来,也无法提供有效训练信号。这种奖励机制既避免了环境设计者生成过于简单的无效任务,也避免了生成完全不可解的任务,能稳定输出适配当前智能体能力的训练内容。

为了防止环境设计者生成的任务陷入模式崩溃,也就是反复输出类似的简单任务,研究团队还引入了两个关键设计:一是语料 grounding,每一轮环境设计都会基于从大规模预训练语料中采样的真实文档生成,避免输出超出预训练知识边界的错误内容,同时保证环境的多样性;二是环境内存,系统会维护一个历史生成环境的缓冲区,标注每个环境的后悔值和技能标签,环境设计者可以参考这些历史数据,避开已经被智能体掌握的简单任务和完全不可解的任务,始终瞄准当前的学习边界。

实验效果验证
研究团队在三个不同参数规模的Qwen3基座模型上验证了SPADE的效果,分别是4B、8B和30B版本,训练过程中所有基准测试数据集都没有出现在训练环境中,保证结果的泛化性。
在游戏场景的训练中,环境设计者生成的是带可验证奖励的独立Python游戏,推理智能体需要通关这些游戏完成训练。测试结果显示,在30B参数规模下,SPADE在8个跨领域基准测试上的平均得分达到58.3,比基座模型高8.1分,比最强的固定环境基线 高5.3分。

而且这个提升幅度随着模型规模扩大而增长:4B模型平均提升5.2分,8B模型平均提升5.7分,30B模型提升到8.1分。这些增益不仅体现在和训练相关的程序性推理任务上,还能迁移到完全不相关的数学、科学、代码生成任务上,比如GPQA-Diamond科学推理测试提升了5.4分,LiveCodeBench-v6代码生成测试提升了4.1分,且训练全程不会降低模型原本的竞赛数学能力。
在工具使用场景的训练中,环境设计者生成的是模拟工具调用环境,包含符合OpenAI函数调用格式的工具集、后台状态和多轮用户指令,推理智能体需要通过多轮工具调用完成所有指令才能获得奖励。测试结果显示,30B参数规模下,SPADE在ACEBench-Agent多步工具调用测试上提升了13.9分,在BFCL v4多轮工具调用测试上提升了5.7分,表现超过了多个专门的合成数据生成系统,其中需要多步交互的任务增益最为明显。

研究团队还通过消融实验验证了各个组件的作用:去掉环境内存后,平均得分下降5.1分;去掉语料grounding后,平均得分下降4.8分;如果冻结环境设计者的参数,同时去掉环境内存,效果甚至会低于原始基座模型,平均得分下降9.7分。这说明环境设计者和推理智能体的协同进化是SPADE效果提升的核心来源。
局限与未来展望
目前SPADE仍然存在一定的局限:首先环境的复杂度上限受基座模型本身的能力限制,无法生成超出基座模型知识边界的环境;其次模型的优化器仍然是人工设计的GRPO,SPADE本身还无法修改自身的学习规则;另外当前的测试基准都是固定任务,无法有效衡量模型的开放式推理能力增长。
未来研究团队计划探索更多方向:比如让环境设计者不需要梯度更新,仅通过上下文积累和优化设计策略来提升环境质量;还可以将自适应环境设计和其他自动化训练环节结合,覆盖从数据处理到学习规则设计的全流程,进一步拓展协同进化自对弈的应用边界。
总体来看,SPADE框架首次将环境设计变成大语言模型后训练过程中的可学习组件,通过双角色自对弈的方式实现了环境和智能体的协同进化,为大语言模型的开放式持续自我提升提供了可行的技术路径。
> 本文由 Intern-S2 等 AI 生成,机智流编辑部校对
-- 完 --
机智流推荐阅读:
1.
2.
3.
4.
cc | 大模型技术交流群 hf | HuggingFace 高赞论文分享群 lc|LangChain 技术交流群 code | AI Coding 交流群 具身 | 具身智能交流群 硬件 | AI 硬件交流群 推理 | AI 推理框架交流群 智能体 | Agent 技术交流群