Auto-Research「终极大考」:新基准撕下大模型科研伪装

机器之心 2026-08-12 06:24

Auto-Research「终极大考」:新基准撕下大模型科研伪装图1


该论文团队由来自10所高校的28位研究者构成,核心作者包含加州大学伯克利分校吕博涵、韩鑫阳,普渡大学张家儒,华盛顿大学李星汉,以及清华大学杨玉成、黄思乔、徐启鑫、张华清、张轶程。团队成员覆盖多领域背景,在大语言模型、强化学习、MLsys、计算机视觉、优化理论等领域的成果受到学界业界广泛认可。


当一个 AI Agent 在机器学习实验中得到更高分,提升究竟来自哪里?


它可能提出了新的优化器或训练目标,也可能只是调整了学习率、扩大了模型、修改了数据处理,甚至找到了评测流程中的漏洞。只观察最终指标,往往无法区分方法创新与工程优化。


这也是现有 Auto-Research 评测面对的核心归因问题。代码生成与实验执行已经成为前沿模型的常见能力,但「能完成研究流程」并不等于「能发现更好的方法」。如果不控制数据、容量、训练预算和评测协议,任何分数提升都很难被可靠归因到算法本身。


来自伯克利、普林斯顿、清华等多家机构的研究者提出 MLS-Bench,试图在可执行环境中单独测量这项能力。它包含 12 个机器学习领域的 140 个真实研究任务,每个任务都设置多个泛化条件,并在统一代码库中复现至少三种强人类方法,其中包括领域公认的 SOTA。


论文对初版五个前沿模型的分析发现,即使获得这些强方法的实现,模型仍然更擅长优化和组合已有组件,而不是完成真正的方法发现。


Auto-Research「终极大考」:新基准撕下大模型科研伪装图2


MLS-Bench 论文首页:



现有评测为什么难以测量方法发现


过去一年,自动研究系统取得了不少进展。一类系统把代码生成、自动验证和进化搜索连接起来,在 circle packing、kernel 优化或固定训练任务中持续提高指标;另一类系统尝试让 Agent 阅读论文、提出想法、编写实现并生成研究报告。


两类路线分别证明了大模型可以进行大规模搜索,也可以执行越来越完整的研究流程。但它们仍留下一个共同问题:结果变好时,我们不知道模型究竟发现了什么。


具体来看,MLE-Bench 一类任务继承了数据挖掘竞赛的形式:模型获得训练集与测试接口,通过数据清洗、特征工程和既有算法组合提高单个数据集上的预测表现。这适合评估机器学习工程,但单点结果无法说明候选方法能否迁移。另一类端到端研究评测让 Agent 生成方案和论文,再由语言模型从新颖性、完整性与可行性等维度评分,却不直接比较候选方法的实际性能。


还有一些任务更接近方法搜索,但聚焦范围较窄。例如激活函数发现可以在少数固定数据和模型上验证大量表达式;nanoGPT speedrun 可以持续吸收新优化器、注意力实现与训练技巧。它们能够推动具体系统,却没有为跨领域方法发现提供统一测量。


在拥有廉价验证器的任务中,系统可以生成大量候选,通过单一分数选择最优实现。这种设置适合测量搜索效率,却不要求候选方法跨数据、模型或规模成立。端到端研究任务覆盖范围更广,但允许模型修改的环节也更多。只要数据处理、训练资源、模型容量或评分逻辑没有锁定,局部工程收益就可能被误认为方法进步。


机器学习方法的价值通常来自可迁移性。残差连接、Attention、归一化或 Adam 并不是只在某个固定实例上有效;它们解决了更一般的问题,并在条件发生变化时继续带来收益。因此,一套面向方法发现的评测至少需要回答两个问题:


  1. 提升能否被归因到目标研究组件,而不是其他工程变量?

  2. 同一个改进能否跨越多个数据、环境、模型或规模?


从这个角度看,工程优化与科学方法发现的区别不在于是否写代码,而在于优化对象。工程任务允许围绕一个最终指标使用多种技巧;方法发现则要求改进一个明确研究组件,并验证它在多个下游条件与更大规模中仍然成立。


MLS-Bench 的任务设计围绕这两个问题展开。


从真实研究问题构造 140 个可执行任务


MLS-Bench 覆盖语言模型预训练、语言模型后训练、视觉生成、强化学习、机器人、机器学习系统、AI for Science、优化与理论、因果推断、时间序列和可信学习等 12 个方向,共包含 140 个任务。


任务跨度包括 KV 缓存压缩、主动学习、时空交通预测、黑洞图像逆问题、抗体与抗原结合、机器人世界模型、训练量化以及优化与理论问题。完整评测运行一次候选方案约需 700 个 H100 小时;30 题的 MLS-Bench-Lite 将单次评测降至约 90 个 H100 小时。这个成本本身也反映了真实方法验证与廉价代码评分之间的差异。


这些任务并不要求模型总结论文或复现既有实验。每个任务都从真实代码库和具体研究问题出发,要求 Agent 修改一个明确的研究组件。例如,候选提交可能是一种新的训练目标、优化器、注意力变体、采样策略或路由机制。模型必须提交可运行实现,并通过统一评测得到结果。


Auto-Research「终极大考」:新基准撕下大模型科研伪装图3

MLS-Bench 关注方法在多个条件下是否持续有效,而不是固定实例上的单点提升。


完整任务包含五类关键要素:



团队还从中选择 30 个任务构成 MLS-Bench-Lite。这个子集覆盖全部 12 个方向,用于成本更低的持续评测。Kimi K3 和 Qwen3.8-Max 已在各自官方发布中采用这一版本。


Auto-Research「终极大考」:新基准撕下大模型科研伪装图4

图片分别来自 Kimi K3 Tech Blog 与 Qwen3.8-Max 官方 Blog。


受控修改范围如何隔离算法贡献


开放性与可归因性之间存在直接张力。允许模型修改整个仓库,更接近自由研究,但难以判断增益来源;只允许修改少量代码,又可能排除真正有价值的方法。


MLS-Bench 通过复现人类基线来校准这个边界。对每个任务,研究团队首先将至少三种代表性方法重新接入同一代码库,并确认其中的 SOTA 能够恢复参考性能。如果某种强方法无法在给定范围内表达,说明任务边界过窄;如果无需改动目标组件也能显著提高结果,说明边界仍然过宽。


经过校准后,模型只能修改与目标问题直接相关的部分。研究训练目标时,数据管线、评分器和共享训练协议保持固定;研究模型结构时,系统会检查参数规模,避免通过增加容量换取性能;涉及不同计算预算的任务,也会统一资源约束。


部分原始研究使用的训练规模过大,无法直接放入持续评测。MLS-Bench 对这类任务使用较小模型或较少数据,但要求所有人类基线在缩小后的规模上保持原有性能排序。也就是说,降低验证成本不能改变任务对方法优劣的基本判断。140 个任务都需要通过这项校准。


Auto-Research「终极大考」:新基准撕下大模型科研伪装图5

强人类方法与模型提交在相同代码基础和相同协议中比较。


多个测试条件承担另一个作用。模型可能在可见反馈上找到特例,但候选方法还需要在未用于局部优化的数据集、环境、模型规模或训练条件中继续有效。一个只提高单个实例、离开当前条件便失效的补丁,不会被计为一般性方法进步。


不同任务包含不同数量的条件和指标,论文采用三级统一评分。原始指标先以人类基线为锚点进行变换,再在同一测试条件内聚合,最后得到任务分数。对单项指标,最弱基线对应 0 分,最强基线对应 50 分;存在理论上界的指标还保留继续向上的空间。


由于分数先在单项指标上锚定,再跨测试条件和任务聚合,最终总分并不是一条预先设置的「人类及格线」。它适合比较候选方案的整体表现,却不能单独证明某个候选包含新的方法机制。


这种设计使 MLS-Bench 更接近受控实验。最终变量不是模型能修改多少工程细节,而是它能否围绕目标研究问题提出一个具有迁移性的算法改动。


主实验测到的,不只是模型会不会跑实验


主实验为五个前沿模型提供两种工作方式。第一种直接评估模型首次提出的方案;第二种允许模型进入代码库,多轮运行实验并修改实现,最后提交最优版本。


模型同时获得强人类基线代码,其中包括当前公认的最佳方法。因此,实验并不是测量模型能否从零复现文献,而是在已有方法清楚可见时,它能否继续发现更好的机制。


Auto-Research「终极大考」:新基准撕下大模型科研伪装图6

网页柱状图分别展示模型首次方案、多轮实验结果与 Human SOTA。


论文主实验中,多轮实验普遍改善了汇总成绩,但当时评测的五个模型所提出的方法在整体表现上均未超过 Human SOTA。此后随着更强模型进入公开榜单,总分仍在继续上涨。不过,当前领先成绩的绝对水平依然不高,评测远未饱和。比某个时间点的静态排名更重要的,是模型通过什么方式取得这些分数。


更关键的是模型如何取得提升。对初版五个模型的消融和专家分析显示,模型主要围绕已知组件进行局部修改、参数调整和重新组合,很少提出能够解释现有失败、并在多个条件中持续成立的新机制。


模型规模检查的控制实验进一步说明了严格归因的必要性。移除这项检查后,所有模型都会通过扩大参数规模提高成绩,部分候选甚至超过人类基线。表面上看是 Agent 发现了更优方案,实际上被改变的是容量,而不是目标算法。重新施加容量约束后,这类收益随即消失。


这一差距不能简单解释为模型不会使用代码工具。Agent 能够读写仓库、运行训练、查看指标并迭代方案。问题出现在更上游的方法选择:它们往往围绕已知组件做局部修改,却很少提出能够解释现有失败并产生稳定增益的新机制。


消融分析区分了「优化」与「发现」


研究团队进一步改变任务提示。要求模型「发现新方法」时,表现弱于把目标表述为「优化现有方法」时的结果。这说明当前模型的优势更接近工程搜索,而不是方法发现。


专家案例分析支持了这一点。很多候选提交可以运行,也会组合多种已知技术,但核心结构通常来自已经提供的基线。模型会把一个方法的损失函数、另一个方法的模块和第三个方法的调度策略拼接起来,再进行局部参数调整。真正新的机制很少;即使出现,也经常没有一个足够有洞见的假设来说明它为什么应该跨条件有效。


Auto-Research「终极大考」:新基准撕下大模型科研伪装图7

模型输出通常更接近对已知组件的重新组合。


这一区分很重要。组合已有模块可能产生实用系统,也可能提高具体任务表现,但它与提出一种新的、可推广的方法并不是同一能力。MLS-Bench 的实验结果表明,当前模型在前者上已经较强,在后者上仍存在明显缺口。


测试时扩展提高分数,但没有改变行为模式


增加迭代和采样能否弥补能力差距?论文测试了不同规模的测试时计算。


Auto-Research「终极大考」:新基准撕下大模型科研伪装图8

增加尝试次数可以改善简单任务,但收益很快饱和。


更多迭代和大规模采样通常能够提高结果,但收益很快趋于饱和,模型仍主要围绕已有候选空间进行局部搜索。当模型只获得部分测试条件的反馈时,持续搜索还可能过度适应这些可见条件,导致候选方法在未开放条件下退化。


这说明搜索规模与方法创新不是可以直接互换的变量。更多采样能够更充分地探索已定义的候选空间,但它不能保证模型提出一个更好的问题解释,也不能自动创造新的算法空间。


比提出想法更难的是规划实验


论文还设置了一个受算力约束的预训练研究实验,用于观察模型是否具备更完整的科学判断。


固定方案原本允许进行三次完整的 345M 参数训练。研究团队将前两次训练的资源转换成一笔可自由分配的预算,让模型自行选择代理模型规模、训练 token 数、实验顺序,以及何时进行完整验证。


这相当于给模型更多研究自由。它可以先用便宜实验检验假设,排除错误方向,再把剩余资源投入最有希望的方案。然而,更多选择通常没有带来更好结果。一个模型消耗大量预算后性能反而下降;唯一获得提升的模型只使用了很少资源。


Auto-Research「终极大考」:新基准撕下大模型科研伪装图9

当前模型仍难以把有限算力分配给最有信息量的实验。


模型之间的差距因此不仅体现在能否提出新想法,还体现在能否形成有洞见的假设、选择有效代理实验、根据不完整反馈更新判断,并决定何时值得进行昂贵验证。


给模型加入网页搜索、基线论文推导和理论背景,也只带来有限改善。信息更多并没有自动转化为更好的实验决策。这表明当前瓶颈不是单纯的知识缺失,而是建立与验证证据所需的、更广泛的科学判断力。


从廉价验证转向完整科学发现


当前大规模搜索范式可以追溯到一条清楚的技术路径。AlphaGo 与 AlphaZero 在规则明确的博弈中进行深度搜索;AlphaTensor 将矩阵乘法重写为可搜索的数学对象;FunSearch 让语言模型生成函数,并通过自动评分保留更优候选;AlphaEvolve 则把同一循环扩展到更复杂的程序与代码库。


Auto-Research「终极大考」:新基准撕下大模型科研伪装图10

语言模型生成候选程序,自动评分器执行并打分,程序库再决定下一轮的搜索起点。图源:Google DeepMind。


基于大规模搜索的自改进工作通常依赖快速、明确的验证器。每个候选都能立刻得到分数,因此扩大采样量能够提高找到好答案的概率。


科学研究中的验证则经常昂贵、延迟、多阶段且只能部分观察。一次实验失败可能来自方法、实现、数据、尺度或随机性;研究者需要用小规模实验区分多种解释,再决定是否投入完整训练。此时真正受限的不是可生成多少候选,而是多少计算能够转化为有效证据。


论文将目标概括为:在验证难以规模化的条件下,实现可规模化的科学发现。


这也给 Auto-Research 提出了更严格的评测标准。一个系统不仅要产出候选方法,还需要说明提升来自哪里,验证它在多个条件下是否成立,并在有限资源下完成从假设到证据的研究过程。


随着传统代码评测逐渐饱和,AI for Research 正成为新的能力前沿。Kimi K3 与 Qwen3.8-Max 已将 MLS-Bench-Lite 放入官方发布评测。下一步值得持续观察的,不只是模型能否执行研究,而是它何时能够独立发现并验证真正推动机器学习前进的方法。


相关链接


MLS-Bench 论文:https://arxiv.org/abs/2605.08678

MLS-Bench 项目主页:https://mls-bench.com/

MLS-Bench GitHub:https://github.com/Imbernoulli/MLS-Bench

Kimi K3 官方博客:https://www.kimi.com/blog/kimi-k3

Qwen3.8-Max 官方博客:https://qwen.ai/blog?id=qwen3.8

Anthropic《When AI builds itself》:https://www.anthropic.com/institute/recursive-self-improvement

Richard Sutton《The Bitter Lesson》:https://bitterlesson.ai/

Google DeepMind AlphaEvolve:https://deepmind.google/blog/alphaevolve-a-gemini-powered-coding-agent-for-designing-advanced-algorithms/


© THE END 

转载请联系本公众号获得授权

投稿或寻求报道:liyazhou@jiqizhixin.com

关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。
AR 大模型
more
今天,互联网不再只属于人类!Cloudflare实锤机器流量反超
云托管LLM推理提效新方案:复旦等提出选择性KV缓存传输方案SMARTGEN
产业 | 当XR光学重塑终端格局,空间计算和AR眼镜走到了哪一步?
Hark发布浏览器代理“Handoff”:能看懂网页结构,却难逃演示片段的质疑
DXOMARK虚化榜单第一 OPPO Find X9 Ultra人像碾压苹果
Cloudflare入局浏览器赛道,推出专为AI代理打造的云端浏览器Kitesurf
比亚迪“海獭”日本上市两周订单破千,K-Car市场格局生变
模型换个Harness就「变笨」?EverMind把自进化从研究推向产品,让AI「越用越聪明」
1000小时最大规模人手全掌触觉数据集发布!Xspark AI让物理智能真正“摸”到真实世界
VTOL圈动态,最优转速旋翼技术和跨音速旋翼技术,Karem和overair专利梳理
Copyright © 2025-成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号