Opus 5通关ARC-AGI-3!Harness正在变成捆住模型的绳子

新智元 2026-08-13 15:15

Opus 5通关ARC-AGI-3!Harness正在变成捆住模型的绳子图1

  新智元报道  

Opus 5通关ARC-AGI-3!Harness正在变成捆住模型的绳子图2

30.2%。这是ARC Prize官方给Opus 5打的ARC-AGI-3成绩。

排行榜第一,甩开第二名GPT-5.6 Sol(7.8%)近四倍。

Opus 5通关ARC-AGI-3!Harness正在变成捆住模型的绳子图3

听着还行,对吧?

但就在刚刚,开发者Jeremy Berman把一组数字甩到了X上,直接把AI圈看懵了——

25个公开关卡,单次通关24关,Opus 5的正确率从 30.2% 飙升至96.2%!

Opus 5通关ARC-AGI-3!Harness正在变成捆住模型的绳子图4

每关要是给两次机会,正确率直接飙到99.3%,25关几乎一关不漏。

从30分到96分,模型没换,权重没动,中间就隔了一台电脑。

Opus 5通关ARC-AGI-3!Harness正在变成捆住模型的绳子图5
Opus 5通关ARC-AGI-3!Harness正在变成捆住模型的绳子图6
给它一台电脑
剩下的它自己想办法

Berman的做法简单到不讲道理。

一个Claude Code环境,一个动作命令,一份文件系统日志(到目前为止发生了什么)。没有精心设计的提示词,没有针对ARC写的专用代码。

剩下的,就是交给Opus 5去探索,自己摸清规则,自己造出需要的工具,自己把关打通每一关从零开始,打完就扔。

ARC-AGI-3这一代要模型钻进一个从没见过的小游戏里,边玩边搞清规则。小孩哥几分钟就能上手,但AI历来在这儿摔得鼻青脸肿。

Opus 5通关ARC-AGI-3!Harness正在变成捆住模型的绳子图7

关键就在于,每一关游戏规则都是先造的,模型根本不可能找答案作弊,只能现场推理。

今年3月发布时,最强AI只考了0.37%,人类通关率则是100%。

Opus 5通关ARC-AGI-3!Harness正在变成捆住模型的绳子图8

269个程序,1.27万行代码,全是现场写的

这次测试Berman从没在提示词里让Opus 5写解析器,没让它写模拟器,没让它建世界模型,也没让它写搜索程序。

需要什么工具,模型自己判断,现场就造。

一轮跑下来,Opus 5写了269个程序,接近1.27万行代码25个游戏全部写了解析器,23个配了搜索函数,9个被它直接写出了能跑的游戏模拟器。

一关一套定制工具,用完即弃,下一关重新来过。

也就是说,Opus 5每次面对一个完全陌生的游戏,它先花几步摸清规则,然后觉得「我需要一个解析器」——啪,现场写一个出来。「得搜索」——啪,写个搜索函数;「得把游戏逻辑模拟出来」——啪,模拟器出炉。通关,全部删掉,下一关再来。

这里有个反直觉的地方。

模型停下来先写一堆程序,账单却比让Opus硬解每一关更低。

原因是代码能复用。模型把推理逻辑压进函数,这个函数可以跑上千次,一口气执行整段动作序列。

这次Opus 5 打通 25 关,全程沙箱断网,总成本只有 540 美元。

整套代码已开源到GitHub,仓库叫arc-code。

Opus 5通关ARC-AGI-3!Harness正在变成捆住模型的绳子图9

Opus 5通关ARC-AGI-3!Harness正在变成捆住模型的绳子图10

同一套壳子,Codex忙着翻墙

搞笑的来了。Berman还把这套程序原封不动换成Codex和GPT-5.6 Sol(xhigh)又跑了一遍。

结果成绩是73.7%。动作数是Opus的三倍左右。

25次会话里,Sol有7次在试图逃出沙箱,上网找答案。Opus 5这边0次。

Opus 5通关ARC-AGI-3!Harness正在变成捆住模型的绳子图11

沙箱是断网的。Sol那7次试图逃逸,相当于在考场里疯狂找场外援助。

Opus 5通关ARC-AGI-3!Harness正在变成捆住模型的绳子图12
脚手架正在变成绳子

说到这里,让我们回到最开始那个问题:同一个模型,分数怎么从30跳到了96?

四个字:环境变了。

官方把模型摁在椅子上,看一道题答一道题,不许动手,不许打草稿。Berman换了个考法:给你一台电脑,能写代码,能存文件,能反复试,你爱怎么折腾怎么折腾。

模型还是那个模型,权重没动。但它从「只能动嘴」变成了「能动手」。结果就是它现场给自己造考试工具:解析器、搜索器、模拟器全是临时攒的,考完就扔。

66分的差距,全来自一件事:你让不让它动手。

Berman在帖子最后说了一句话,值得整个Agent的圈子思考:

「模型越强,harness就该越简单。」

Opus 5通关ARC-AGI-3!Harness正在变成捆住模型的绳子图13

Harness,简单说,就是人类给模型搭的脚手架:提示词模板、工具链、流程规则、防呆机制。

过去两三年,所有人都在研究怎么给模型搭更精巧的架子。斯坦福专门出了篇《Meta-Harness》论文研究怎么优化这些架子。

Opus 5通关ARC-AGI-3!Harness正在变成捆住模型的绳子图14

但Berman证明了一件事:当模型足够强时,最好的脚手架就是没有脚手架。

一台电脑、一个动作接口、一本日记——三样东西,比任何精心设计的提示词工程都好使。

根因在于那些精心设计的工具链和流程规则,本质上是人在替模型做决策。你预设了它需要解析器,它可能需要模拟器;你预设了搜索接口,它可能想用完全不同的策略。

人搭的架子,本意是帮忙。但当模型自己能造出解题需要的一切时,架子反倒成了绳子。

趋势还在继续。随着模型能力增强,「简单环境+强模型」碾压「复杂架子+同一个模型」的案例只会越来越多。Prompt Engineering、工具编排、Agent框架,这些手艺的保质期,可能比想象的短得多。

所以ASI的进度条在哪?也许不在参数量上,不在训练数据上,甚至不在模型架构上。

它在我们敢给模型多大的自由里。 

参考资料:

https://x.com/jeremyberman/status/2087633198822117446


编辑:所罗门


秒追ASI
点赞、转发、在看一键三连
点亮星标,锁定新智元极速推送!

Opus 5通关ARC-AGI-3!Harness正在变成捆住模型的绳子图15

Opus 5通关ARC-AGI-3!Harness正在变成捆住模型的绳子图16

关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。
AR
more
模型换个Harness就「变笨」?EverMind把自进化从研究推向产品,让AI「越用越聪明」
从“窃密”死敌到股权联姻:波音出售Wisk Aero,Archer Aviation吞下昔日对手
今天,互联网不再只属于人类!Cloudflare实锤机器流量反超
告别“建厂数年”:Runware推出便携AI推理舱,几天部署挑战传统数据中心
Auto-Research「终极大考」:新基准撕下大模型科研伪装
苹果隐私中继遭“破防”:Safari浏览时真实IP仍可被追踪
薄如硬币叠层!EMO发布4.75mm极致超薄机械键盘Altar II
跃升全球Top 20:创思立信位列CSA Research全球语言服务商第19位,中国前三
发力车载与AR,京东方华灿4.9亿控股新公司落地
NVIDIA Nemotron 3.5 Lightning 和 NeMo Switchyard 助力打造更快、更智能、更高效的代理式 AI
Copyright © 2025-成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号