【科技24时区】当人工智能开始训练人工智能,这已不再是硅谷极客圈里的谈资,而是正在发生的产业现实。近日,Anthropic在其研究员计划中披露了一项颇具颠覆性的进展:由陈岳汉(Chen Yueh-Han)领衔的研究团队发布了一篇题为《自动化研究人员可可靠地缓解对齐失败》的新论文,首次向外界展示了AI系统如何在实践中自我优化,并给出了一个令人深思的结论——在特定领域,机器不仅比人快,而且更便宜、更有效。
这项研究的核心在于验证“自动化对齐后训练”的可行性。实验设定了10个针对特定非对齐行为的基准测试,结果显示,自动化系统在不损害模型整体性能的前提下,成功提升了所有基准测试的表现。这一过程并非简单的参数微调,而是模拟了传统科研的全流程:系统自动检索现有文献,提出改进方法,随后进行为期30分钟的模型训练。通过多轮迭代,有效的方法被保留,无效的被剔除。这种“优胜劣汰”的机制使得系统能够以极高的速度和规模运行。
值得注意的是,论文中的数据对比极具冲击力。在平均六小时内,表现最佳的自动化对齐研究员(AAR)所提出的方案,其效果便超越了经验丰富的人类专家。更为直白的是成本账:AAR每小时API推理成本约为4美元,而Anthropic支付给人类研究员的时薪高达150美元。近40倍的成本差异,加上更快的迭代速度,让“人类引导的研究方向并未带来更强性能”这一论断显得格外刺眼。从某种角度看,这不仅是技术的胜利,更是经济理性的必然选择。
然而,若因此断言人类研究员即将全面失业,或许还为时过早。论文本身也保持了必要的审慎,指出了该方法的局限性。自动化系统的有效性高度依赖于基准测试是否能真实反映对齐目标。如果基准本身存在偏差或漏洞,AI可能会陷入“刷分”陷阱,即优化指标而非解决实际问题。此外,建立和维护这些基准体系,以及持续扩充供AI检索的文献库,仍需大量的人力投入。换言之,AI目前更像是一个高效的执行者,而非战略制定者。
尽管如此,这篇论文仍被视为迈向“递归自我改进”的关键一步。一旦模型能够自主优化对齐训练,进而扩展至更广泛的训练实践,人类在AI研发链条中的角色将被重新定义。正如业内观察人士所言,这不仅仅是速度的提升,更是研发范式的转移。对于Neolabs等致力于AI原生开发的公司而言,利用AI模型训练其他AI模型已成为主流目标,而Anthropic的这项研究,无疑为这一趋势提供了早期的实证支持。未来,人类研究员的价值或许将更多地体现在定义问题、设计基准以及伦理把关上,而非重复性的试错实验中。
AI研究员“下岗”倒计时?Anthropic新论文揭示自动化对齐研究效率碾压人类
科技区角
2026-08-29 04:00
关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。