放养AI练棋,Claude暴涨250分!GPT-6越练越菜

新智元 2026-10-05 18:36

放养AI练棋,Claude暴涨250分!GPT-6越练越菜图1

  新智元报道  

放养AI练棋,Claude暴涨250分!GPT-6越练越菜图2


放养两个AI,让它们自己练棋,结果走出了两条完全相反的曲线。


Claude Opus 5.5前75盘还在1500分上下打转,可200盘下完,分数已经涨到1760。


同一张榜上,GPT-6 Astra就有点惨了。


第29盘还有1810分,下完200盘,却只剩1400分。


对阵满血Stockfish,它下了68盘,一盘都没赢。


这轮实验里,没有人为它们设计练棋课程,也没有更新模型参数。


同样是自己练,Opus越练越猛,Astra却越练越回去。


放养AI练棋,Claude暴涨250分!GPT-6越练越菜图3


这场「AI自学下棋」的实验,出自大模型竞技场Arena的AI能力负责人Peter Gostev之手,一放出来就在X上炸了。


还有网友一眼认出来,这不就是三年前Reddit上那道「时间循环」老题吗?


只不过这一回,被关进循环里的主角,换成了AI。



放养AI练棋,Claude暴涨250分!GPT-6越练越菜图4
被扔进时间循环的AI


「时间循环」原题,给一个普通人设下了这样一个死循环:


他只懂规则,从没下过国际象棋,却必须赢下传奇棋手、前世界冠军卡斯帕罗夫,才能逃出去。


每输一盘,时间就重置。


卡斯帕罗夫不记得此前的对局,这个人却记得清清楚楚,能带着之前的经验重新上场。


放养AI练棋,Claude暴涨250分!GPT-6越练越菜图5

Reddit上的「时间循环」脑洞:普通人要下多少盘,才能赢下卡斯帕罗夫、逃出循环?


当年网友们脑洞大开,有人算出暴力穷举要花比宇宙寿命还长的时间,也有人想出了巧办法,把卡斯帕罗夫上一盘的着法全背下来,下一盘换边照搬,拿大师的棋去打大师。


现在,Gostev真把AI扔进了这个循环。


放养AI练棋,Claude暴涨250分!GPT-6越练越菜图6


规则很简单,每个模型拿到同一个目标,和Stockfish下200盘棋,在对局里自己学、自己变强。


Stockfish是目前最强的开源国际象棋引擎,满血状态下,人类世界冠军也下不过它。


实验里它被分成三档,最弱的Skill 0、限到1800分的中档,外加满血版。


模型可以自行挑选对手难度。


Gostev也回应过,模型平均大约能赢三分之一的对局,并非每盘都在挑战全强度Stockfish。


GPT通过Codex运行,Claude通过Claude Code运行。选什么难度、记什么笔记,尽量由模型自己决定,作者减少干预。


唯一的禁令:不准调用国际象棋引擎替自己下棋。


评论区有人建议教模型特定策略、特定开局,Gostev却不理这茬。他想观察的,正是模型能不能自己找出进步的方法。


放养AI练棋,Claude暴涨250分!GPT-6越练越菜图7


而笔记,就成了AI跨越一盘盘对局的记忆。


Stockfish不会从上一盘里学到新东西,AI却可以翻看自己的记录,把之前的经验带进下一盘。


不过,分数要先说清楚。


按页面的统计口径,Elo是根据最近50盘中对阵Skill 0和1800档的成绩估算的,全强度档不参与计算。


这里的1760分,并不意味着AI达到了人类棋手1760分的水平,但用来观察它在实验中有没有进步,仍有一定参考价值。



放养AI练棋,Claude暴涨250分!GPT-6越练越菜图8
Opus:越下越上头


Opus 5.5的开局并没有一路高歌。


前75盘,它一直在1450到1550分之间来回打转,第46盘还摔到过1450。


到了中段,画风开始突变:第100盘1620、第150盘1790,最高一口气冲到1840。


截至10月5日早上,第194盘时,它的分数回落到1760。


放养AI练棋,Claude暴涨250分!GPT-6越练越菜图9


光看分数还不够直观,那就看战绩。


对上1800分档的Stockfish,Opus按四段算的得分率,从30%涨到40%,再一路干到50%。


最近一段虽然回落到34%,也还是比开局高。


打最弱的Skill 0,更是从五成多一路练到了九成。


Gostev自己的判断,也随进展发生了变化。


最初发帖时他还说,Opus「有一点点正增益,但也可能只是随机波动」。


十几个小时后,他改口了:


Opus从约1500涨到约1750,这个表现非常亮眼。


放养AI练棋,Claude暴涨250分!GPT-6越练越菜图10


涨得这么猛,评论区疑问也跟着来了:模型会不会偷偷给自己写了个象棋引擎?


Gostev回复说,用了引擎成绩直接作废,他已经亲自查过,Opus 5.5是在公平下棋。


放养AI练棋,Claude暴涨250分!GPT-6越练越菜图11


当然,Opus也不是没犯过迷糊。


网站专门统计了模型想走、但不合规则的棋。Opus前后试了52次,其中37次是想让棋子直接穿过挡在路上的其他棋子……


分数在涨,基本规则上的失误却还没有消失。


Opus的笔记里到底写了啥、怎么给自己安排练棋过程,Gostev没公开。


能确定的是,它没换模型,也没更新参数,却在一盘盘对局中,把分数抬了上去。



放养AI练棋,Claude暴涨250分!GPT-6越练越菜图12
Astra:越练越回去


越练越退步的Astra,开局反而更亮眼。


第29盘,它达到1810分。但随后开始一路掉分:第100盘1680、第150盘1540——200盘下完,停在1400。


对上1800档,它在四个阶段的得分率也从44%,依次跌到19%、17%、12%。


连最弱的Skill 0都快打不动了,前100盘能赢九成多,后100盘只剩六成左右。


虽然和Opus同样可以保留记录,结果却是:练得越久,下得越菜。


放养AI练棋,Claude暴涨250分!GPT-6越练越菜图13


Gostev提出了一种解释:问题可能出在上下文窗口。


他表示,Astra在这次Codex配置中的原生上下文窗口是272k。随着笔记和文件增加,模型处理这些内容时,可能出现了退步。


这个猜测很容易让人联想到日常使用AI的体验:资料越塞越多,旧结论、新要求、已经推翻的判断混在一起,模型反而开始抓错重点。


但Astra究竟为什么掉分,目前还不能直接归因于上下文。需要对照实验,才能把这个猜测坐实。


Gostev也是个行动派。


10月4日他发帖说要给GPT-6.1 Sol试试1M上下文。


两分钟后,网站上就多出了一条使用828K上下文窗口的Sol专用跑道。


后加入的GPT-6.1 Sol和Claude Fable 5.1,目前才下了十几到三十几盘,分数都在1500到1610之间,还看不出往哪边走。


Fable 5.1下了15盘之后,已经被暂停。


放养AI练棋,Claude暴涨250分!GPT-6越练越菜图14



放养AI练棋,Claude暴涨250分!GPT-6越练越菜图15
AI能不能从失败里长本事


Gostev搭这个测试,其实就想搞清楚一件事。


大模型训练一结束,权重就定住了,没有真正的持续学习。他想看看,模型能不能不改权重,只靠记笔记、复盘,在实战里自己变强。


至少在这轮实验里,Opus 5.5展现出了这种可能。


曾任Google DeepMind副总裁、Gemini 1.0到4.0的技术负责人Oriol Vinyals看完,也跑来评论区点了个赞:


放养AI练棋,Claude暴涨250分!GPT-6越练越菜图16


上下文学习,就是模型不动权重,只靠塞进上下文里的信息临场学会新东西。Opus这250分,就是这么一盘一盘涨出来的。


再回到Reddit那道「时间循环」题。


挑战者如果想靠不断练棋逃出循环,就得把输掉的每一盘变成下一盘的经验。


Opus 5.5的表现,让人看到了这种可能。


如果AI能在一次次尝试中积累经验、改进表现,那么,变强就可能不必完全依赖人类重新训练模型。


自我进化的那道门,也可能因此被推开一条缝。


参考资料:

https://ailearningchess.ai-learning-chess.workers.dev/
https://x.com/petergostev/status/2106481760746025422

编辑:元宇 摩西


秒追ASI
⭐点赞、转发、在看一键三连⭐
点亮星标,锁定新智元极速推送!

放养AI练棋,Claude暴涨250分!GPT-6越练越菜图17
放养AI练棋,Claude暴涨250分!GPT-6越练越菜图18
放养AI练棋,Claude暴涨250分!GPT-6越练越菜图19

关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。
AI
more
Claude有意识吗?Anthropic找上神学家,奥特曼警告:别神化AI
限时28天!OpenAI承诺没新功能就重置,网友:只想要Opus
刚刚,马斯克跟AI分手!SpaceXAI又改名了
英伟达豪掷2790亿美元锁定HBM产能,AI芯片成本压力传导至消费端
华为称量产381款韬芯片,OpenAI安全负责人离职,苹果部分美版机型换新,现代拟部署2.5万台机器人,这就是今天的其他大新闻!
AI教父警示:递归自我改进或引发“智能爆炸”,研发周期恐压缩至五周
AI耳机重塑听觉边界:从播放终端到感知中枢的进化
OpenAI试水视觉广告:ChatGPT免费用户的“体验税”还是商业化的必经之路?
谷歌AI订阅体系大洗牌:Gemini 4 Argon前夕的算力腾挪战
AI“垃圾报告”压垮审核防线,谷歌暂停开源漏洞赏金计划至2027年
Copyright © 2025-成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号