Agent驱动的模型训练,基元律动做了一次迈向RSI的实验

机器之心 2026-09-09 11:54
Agent驱动的模型训练,基元律动做了一次迈向RSI的实验图1
编辑 | 泽南


Agent 完成任务后,学到的经验去了哪里?


一个 Agent 接到项目排期任务,它找到了工作目录里的文件,大致理解用户想要什么,却漏读了一封包含最新消息修改的邮件。随后,它沿着过时信息继续规划,生成了无效排期,最后还把文件写到了错误位置。


执行链在中途断掉,随后就全是基于错误推理的错误答案。看到之后,你显然会让 AI「重新审视问题」再生成一遍。问题在于,下一次怎么办?


今天的大多数系统中,Agent 的经验都留在日志里,模型每天在真实环境里产生的执行经验,几乎从不进入模型参数。这意味着模型下一次遇到相似任务,依旧可能踩一遍同样的坑。


基元律动最近发布的 NeoHorse-1 试图改变这件事。他们开源了 4B 与 9B 两个尺寸的模型,训练出来的思路听起来有点绕:让一个本来负责给模型「派活」的路由系统,顺便把所有模型走过的路记录下来,再把这些路教给一个小模型,让它自己就能走完一群模型走过的路。


Agent驱动的模型训练,基元律动做了一次迈向RSI的实验图2



Agent驱动的模型训练,基元律动做了一次迈向RSI的实验图3


这件事,被他们称为迈向 RSI 的第一次闭环验证


该模型由无问芯穹提供底层基础设施支撑与 Infra 优化技术能力,清华大学、北京大学团队参与算法和训练方法研究,共同探索提升 Agent 后训练的数据利用效率和训练效果。


大模型的终极目标:自我迭代


RSI(Recursive Self-Improvement,递归自我改进)是 2026 年 AI 领域一个炙手可热,也富有争议的词汇。它的愿景并不复杂:让 AI 把自己的产出作为经验重新喂回研发流程,参与设计更强的下一代自己,循环往复、自我升级。


今年 6 月,Anthropic 发布《When AI builds itself》,称在内部观察到了 RSI 的早期迹象。这个星期,OpenAI 发布博客首次公开了自己 RSI 的进展。OpenAI 称,其已经实现去年秋天定下的目标:在今年 9 月前造出一个「自动化研究实习生」。


Agent驱动的模型训练,基元律动做了一次迈向RSI的实验图4


但 Anthropic、OpenAI 自己也承认完整的 RSI 时代尚未到来,甚至不会必然发生。学术界今年涌现的一大批工作,从 Self-Harness、Continual Harness 到各类自我进化基准,大多还停留在「改进某个零件」的阶段。


人们争议的焦点很具体:AI 巨头口中的 RSI 目标很远大,实际操作起来却是个外界无法检查的黑箱。你既看不到训练数据如何流转,也复现不了那个闭环,最后只能选择相信或不相信。


在已经大规模应用的 AI Agent 上,工程层面的自我迭代也一直在进行中。对于 Harness 来说,决定表现的并不只在于底层模型。就像 DSH 之于 DeepSeek V4 Pro,一个设计得当的 Harness 才可以让模型发挥全部潜力。


当前,Agent 领域出现了两条并行演进路线。一条是在推理时更新外部系统,例如把成功经验写入 Memory、Skill 或 Harness;另一条则更进一步,让 Harness 框架直接参与模型训练。


NeoHorse-1 尝试用最简单的方式来实现训练的正循环,让我们看到了一个清晰可行的流程,它用的模型是 Qwen3.5 4B 和 9B,再把一个自我改进闭环拆成了四个可以逐环检查的零件,并全部开源。


要看懂它,得先从一个叫 OpenSquilla 的路由系统讲起。


Harness 框架,天然就是 AI 训练场


几个星期前,基元律动开源的 Harnes 框架 OpenSquilla 为这家公司基础设施层的创新开了个头。OpenSquilla 专注于通过高效率和低 Token 成本来运行和调度复杂的智能体任务,目标直指 Agent 落地的核心痛点。


一个复杂任务往往要跑数十轮,每一轮都调用最贵的旗舰模型,token 会顶不住。OpenSquilla 的做法是在 Harness 框架上装一个「路由器」,每执行一步之前先判断这一步需要多强的能力,再分派给够用且最便宜的那个模型或模型组合。按 benchmark 测试结果,这套机制可以省下 60% 到 80% 的 token 开支。


到这里,主要还是在想办法省钱。NeoHorse 的进一步洞察在于,路由器在派活的每一步都留下了三样东西:它预判了这一步需要什么能力、记录实际派遣的模型,还要观察这一步最终执行得怎么样。


换句话说,人与 AI 聊天的记录主要包含「问题 — 答案」,Routing Harness 产生的则是「需求预测 — 路由决策 — 执行过程 — 环境结果」。


这恰好就是一份完整的教学档案,基元律动决定拿它办学。NeoHorse 基于 Harness 训练 AI 模型的思路大致分为四步。


Agent驱动的模型训练,基元律动做了一次迈向RSI的实验图5


第一步是尽量保留 Agent 的「推理 — 行动 — 反馈」链条。Agent 的真实能力藏在交错的推理、工具调用、环境复现、报错后的恢复动作和最终交付产品之间。NeoHorse 把每一次完整交互保存为一条轨迹,再按用户轮次切成训练单元,当前轮的推理与动作是模型要学习的目标,更早的历史作为可以查阅的上下文。主语料库包含十万到百万条脱敏任务轨迹,另加公开数据补齐覆盖面。


第二步是判断轨迹能不能用。系统先用确定性规则检查工具调用是否有对应返回、事件顺序是否成立、是否缺少最终回复,以及执行分支能否闭合。结构完整的轨迹进入下一步;部分可恢复的记录只保留因果关系完整的片段;无法判断事件归属的轨迹则被隔离。


随后,系统从目标达成、指令遵循、工具使用、证据一致性、错误恢复和正确终止六个维度进行语义评估。NeoHorse 分别记录了通过、警告、失败或未评估几种状态,这样一来系统看到的不只是任务的执行情况,还能知道失败更可能发生在证据获取、工具选择还是终止判断上。


第三步,是用 Router 预测的能力需求进行课程学习NeoHorse 直接借用 Routing Harness 的 C0 到 C3 分层作为难度信号:训练分三个阶段推进,先集中学低需求档任务,再逐步混入高需求档的硬任务,同时刻意把一部分简单样本留到最后阶段,防止模型到后期只会做难题。路由记录反映的是真实的用户覆盖、模型定价与可用性波动,比抽象的难度标签更贴近部署现场。


这里有一个容易被忽略的细节,系统并没有把「最终调用了哪个模型」直接当作难度标签。因为实际路由还可能受任务指定、服务可用性和系统策略影响。NeoHorse 使用的是回答发生之前,Router 根据请求及历史状态重新估计的能力需求。它决定样本什么时候出现,而不是简单告诉模型「这是一道难题」。


第四步,NeoHorse 还采用了路由引导的 On-Policy Distillation。传统蒸馏更像让学生模仿教师已经写好的标准答案;而在 On-Policy Distillation 中,学生先生成自己的响应,教师再沿着学生实际走到的位置提供下一步监督。通俗来说,它是让学生先做题,若走进岔路再进行纠正。


最后,模型评估结果会形成一张「能力短板地图」,反映哪些场景完成率低、哪种错误多发、哪个能力层级最薄弱。下一轮训练数据便向这些区域倾斜,同时维持基础能力覆盖。至此,评估、选择、更新,这一圈转起来,构成一次基元律动口中 RSI 闭环。


能力提升了多少?


NeoHorse-1 分别在 4B 和 9B 两个尺寸上进行了评测,覆盖 Harness Agent、工具调用、多轮交互、代码生成和指令遵循等十项 Benchmark。


Agent驱动的模型训练,基元律动做了一次迈向RSI的实验图6


自己跟自己比的话,4B 模型的平均分从 58.94 提高到 64.87,增加 5.93 分;9B 则从 65.60 提高到 69.04,增加 3.44 分。NeoHorse-1-4B 的综合结果已经接近 Qwen3.5-9B 基座的 65.60。报告还显示,在同一套路由课程配置下,Harness 轨迹训练出的检查点,在五个可比测试上的平均分比公开合成工具数据 Toucan 高出 6.26 分。


这些结果需要分开来看。NeoHorse-1-4B 达到同规模 SOTA 的提升,主要集中在 Harness Agent、工具交互和代码执行这类流程清晰、反馈可验证的任务上;但在需要长时间保持状态、反复测试修复、根据环境反馈改变策略的任务上,这个尺度依然吃力。参数规模没有失去意义 —— 后训练补上的是执行链条上的关键一环,而不是把能力边界整体抹平。


一项数据分析任务正好标出了这条边界。当环境中没有 pandas 时,NeoHorse-1-4B 没有及时识别出原方案已被环境阻断,而是反复尝试安装依赖、手动解析并修补脚本,最终没能生成报告。这类任务恰恰需要交给模型池中能力更强的模型 ——Agent 之间的差距有时不体现在「会不会做」,而体现在「路线对不对」;思考路线更准确的 Agent,往往反而消耗更少。


数字之外,Agent 在行为层面的变化更直观。票务日报任务里,基座模型处理工单状态前后矛盾后反复重写,二十多条记录越改越乱,NeoHorse 则会主动补取证据、识别更新后的约束、核对一致后再交付,最终 19 张工单匹配率达到 100%。五子棋网页任务里,同样的 26 次点击回放,基座模型全程报索引错误、棋盘始终空白,NeoHorse 则按顺序落下 13 黑 13 白、攻防轮转正常。


Agent驱动的模型训练,基元律动做了一次迈向RSI的实验图7


那么,这到底算不算是 RSI ?


这是不是真正的 RSI?


AI 的自我改进至少存在三个层次:模型在当前任务中发现错误并重试,是自我修正;系统把经验写入 Memory、Skill 或 Harness,是运行层适应;当经验进一步改变模型参数,更新后的模型又产生更好的新经验,并在多代循环中继续积累,才更接近完整的递归自我改进。


NeoHorse 已经具备其中几个关键特征:Harness 产生执行数据,评估发现能力缺口,数据配比随之调整,后训练更新模型,更新后的模型可以重新回到多模型池。团队将其概括为 Data-RSI 与 Model-RSI 这两个相连的环节。


但当前技术报告只验证了一轮「评估 — 选择 — 更新」。它还没有证明第二代、第三代模型能够持续获得增益,也没有让「如何改进模型」这套机制本身发生自动进化。随着模型变强,原先的数据可能失去价值;反复从自身轨迹学习,也可能放大偏差或造成能力退化。这些都需要跨代实验回答。


因此,正如基元律动所说的,NeoHorse 完成的是一次迈向 RSI 的、可复现的单轮闭环验证


虽然它不算证明 RSI 已经到来,但从现在起,RSI 已经可以被看作是一个可复现的工程问题。在基础大模型朝着参数、算力累加迭代的今天,这种新方向的优化尤其值得关注。


模型与 Harness 的飞轮,已开始旋转


在基元律动的愿景中,OpenSquilla 是模型执行与产生经验的场所,NeoHorse 则是经验进入模型参数之后的载体。


这套飞轮的理想状态是,OpenSquilla 用多模型完成任务并留下真实运行轨迹;NeoHorse 从中学习,逐步承担更多原本需要昂贵模型处理的工作;推理成本下降后,Agent 获得更多使用量;更多执行又产生新数据,推动下一轮训练。


以行业的角度来看,过去承载模型干活的 Harness 框架长期被视为缺乏技术含量,NeoHorse 给出的结论则是:谁能构建出一个持续运转、每一步都留下结构化记录的系统,谁就拿到了下一代 Agent 模型最便宜、也最难复制的训练数据。模型参数可以开源、可以追平,真实流量里踩出来的路不行。


NeoHorse-1 提出的模型成长路径,把 Harness 的重要性再次提升了一个台阶。现在,它越来越像连接用户任务、环境反馈和模型更新的中枢。


这还只是一次初步实验,未来的 Agent 系统,或许能让模型从每次执行的过程中持续成长了。



© THE END 

转载请联系本公众号获得授权

投稿或寻求报道:liyazhou@jiqizhixin.com

关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。
驱动
more
PCIM Asia深圳2026启幕在即:中国电源学会权威加持,固态断路器与AIDC等前沿议题深度聚焦,两大峰会定调产业方向,主题论坛驱动技术浪潮
美满电子两季连续上调业绩预期,定制芯片与光互联驱动AI增长
物联洞察|蜂窝通信驱动IPC网络摄像头驶入数智化“快车道”
Win11八月更新陷驱动泥潭,安全补丁竟成游戏崩溃元凶
英特尔Xe驱动迎冷重置机制,Linux 7.4合并窗口前夕提交新代码
【Omdia CDC 2026 仅剩2周】LCD中小尺寸显示驱动IC供需相对紧张
Neuvotion首款AI驱动非侵入式脑体接口产品NeuStim®将于今秋上市,重塑神经康复新范式
2026年中国血细胞分析仪产业链、市场规模及未来发展趋势分析:市场稳健扩容,政策驱动与需求升级共筑增长根基[图]
快手程一笑:AI驱动短剧供给爆发,日均曝光破2.3亿
智能体时代EDA工具革新,比昂芯科技专注AI驱动电路仿真及Chiplets设计
Copyright © 2025-成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号