机智流 · 2026年9月6日
GPT-6-Astra 和 Claude Fable 5.1 同一周撞车。两边官宣页上都贴满数字。
普通人看晕,多半不是因为笨,而是这些「跑分榜」名字长、规则不一样:有的开源能自己跑,有的只能看官方交的卷子。
这篇把两边最近最爱甩的几张榜拆开讲:谁做的(出品方多说两句)、大约多少道题、怎么测、例题长什么样、官网在哪。数字只当参考,不当真理。
一、综合能力指数 · Artificial Analysis
出品方
独立评测公司 Artificial Analysis,总部在旧金山。联合创始人是 CEO Micah Hill-Smith 和 CPO George Cameron,两人都有咨询背景,公司主业就是测模型、测云、测芯片,给开发者和企业一张尽量中立的成绩单。
测什么 / 题量怎么理解
把多套卷子加权成一个总分。当前大版本常见大约 10 项测评(终端、专业文书、科学推理等),权重会改版。不是「一共 N 道选择题」那种单一题库。Fable 5.1 顶配大约 66、Astra 大约 61,是独立成绩单里常被引用的一对。
大概怎么测
同一套脚手架、多家模型一起跑;有的看对错,有的看交出来的文件,用评委对比打分。新版加重「不公开题」,防实验室对着公开题刷分。

官网截图 · Artificial Analysis Intelligence Index:十项评测拼成一张综合分
官网:https://artificialanalysis.ai/
方法说明:https://artificialanalysis.ai/methodology/intelligence-benchmarking/
二、终端干活榜 · Terminal-Bench 4.0
出品方
Terminal-Bench / Harbor 团队。背后有非营利机构 Laude Institute(约 2025 年成立,面向计算机科研的「把想法推到业界」组织;公开材料提到 Andy Konwinski 等出资与联合创立)。Harbor 是他们开源的评测脚手架;Terminal-Bench 早期与斯坦福等研究者合作,后来变成持续更新的社区题库,Ryan Marten、Alex Shaw、Mike Merrill 等人常出现在公开介绍里。
题量
4.0 版大约 66 道容器化任务。排行榜常见做法是每题跑 5 次,一整轮大约 330 次试验。
大概怎么测
把代理丢进真实命令行容器:装依赖、改配置、写脚本、排错。另一容器跑校验脚本,看最终状态对不对,不是看嘴上说得对不对。

官网例题 · Harbor:payments-pipeline-fix,真实终端里加速交易流水线
官网:https://www.tbench.ai/
代码:https://github.com/harbor-framework/terminal-bench
OpenAI 官宣对照里,Astra 大约 57.9%,Fable 5.1 大约 55.8%。这是官方表,独立榜也可能因脚手架不同略有出入。
三、科学终端榜 · Terminal-Bench-Science 0.1
出品方
同一条 Terminal-Bench / Harbor 线。科学任务由一线科研人员贡献;发布说明里写过斯坦福等研究者牵头推进,强调「科研工作流」而不是普通刷题。
题量
0.1 版 70 道。公开材料写过:海量提案里最后只留下够硬、够清楚、能严格打分的 70 道。
大概怎么测
终端里完成科研流程:数据分析、模拟、拟合、定理证明等,用可复现测试验收到底产物。

官网例题 · 化学任务:在预算内做多保真度材料/分子搜索策略
官网:https://www.tbench.ai/news/terminal-bench-science-0-1
OpenAI 官宣对照里,Astra 大约 64.6%,Fable 大约 52.6%。这是两边这轮最爱对轰的一张科学向榜。
四、长程写代码榜 · DeepSWE v1.1
出品方
Datacurve:YC 孵化的旧金山公司(约 2024),主业是给前沿模型提供高质量「写代码」训练与评测数据。DeepSWE 是他们公开的长程软件工程评测;配套还有 Pier 等跑分工具。
题量
113 道题,覆盖大约 91 个仓库,语言包括 TypeScript、Go、Python、JavaScript、Rust。
大概怎么测
陌生仓库风格工程 + 长程改造;提示不长但要动很多文件;程序化校验行为。任务是新写的,减少「考题被预训练见过」。

官网例题 · DeepSWE:happy-dom 关闭时要正确中断未完成的 body 读取
官网:https://deepswe.datacurve.ai/
代码:https://github.com/datacurve-ai/deep-swe
OpenAI 官宣表里,Astra 大约 74.1%,Fable 5.1 大约 67.4%。同场往往贴得很紧。
五、修真实 Issue · SWE-bench 家族
出品方
普林斯顿 NLP 团队发起(Jimenez、Yang、Narasimhan 等,ICLR 2024 论文)。Verified 子集与 OpenAI 合作,雇开发者人工筛掉有问题的题。更难的 Pro 等版本由 Scale 等继续推进,面向更「企业级、长周期」的修仓库场景。
题量
原版测试集约 2294 道;常用 Verified 是人工筛过的 500 道;Pro 总规模大约 1865 道(公开集 / 保留集 / 商业集拆开)。
大概怎么测
真实 GitHub Issue → 改代码 → 跑仓库测试,通过才算修好。

真实 Issue 例 · scikit-learn #10284:RidgeClassifierCV 参数报错
官网:https://www.swebench.com/
Verified:https://www.swebench.com/verified
Pro 介绍:https://scaleapi.github.io/SWE-bench_Pro-os/
注意:这轮 Fable 5.1 官宣主表并没有拿 SWE 当头牌。网上如果把 Fable 5 的旧分贴到 5.1 头上,要小心。
六、操控电脑 · OSWorld
出品方
xlang 团队等开源项目(NeurIPS 数据集赛道常见引用)。目标是给多模态代理一个「真电脑」考场:桌面、浏览器、办公软件都能碰。
题量
Ubuntu 场景大约 369 道;其中约 8 道 Google Drive 相关题常因网络配置被排除,很多报告写 361 道。
大概怎么测
虚拟机桌面里看屏幕、点鼠标、开软件;用执行结果打分,有的题是做成/没做成,有的给完成度。

官网例题 · OSWorld:从本地 VSIX 给 VS Code 装扩展
官网:https://os-world.github.io/
代码:https://github.com/xlang-ai/OSWorld
七、抽象智力游戏 · ARC-AGI / ARC-AGI-3
出品方
ARC Prize 基金会:非营利,公开材料由 François Chollet(Keras / ARC)、Mike Knoop(Zapier / Ndea)等推动。定位是「给 AGI 一个北辰」——测的是人类很容易、模型很难的流体智力;也通过奖金鼓励开源新思路。
题量
ARC-AGI-3 是可交互小环境;公开有演示集,正式排行用私有题。公开材料强调:人能解完公开环境,但公开集成绩不算正式晋级证明。
大概怎么测
不给说明书。模型要试错、摸目标、建策略。Astra 在标准化考场大约 62.7%;换官方配套状态保持方式,数字会飙很高——同榜不同考法,别直接横比。

官网例题 · ARC-AGI-3 公开演示:可交互小游戏,没说明书
官网:https://arcprize.org/arc-agi/3
工具:https://github.com/arcprize/ARC-AGI
八、超难问答 · Humanity’s Last Exam、GPQA
HLE · 出品方
Center for AI Safety 与 Scale AI 等发起;近千名学科专家、五百多所机构、约五十个国家供题。定位是「人类最后一场学术考试」:封闭题做到够难,用来追前沿模型的专家级书本能力。
题量 / 怎么测
公开版大约 2500 道(不同材料也会写约 3000 的筹备规模),覆盖上百学科;另有私有题防过拟合。可带或不带工具。

官网例题 · HLE:拉丁碑文翻译、蜂鸟解剖题,专家级超难问答
官网:https://lastexam.ai/
GPQA Diamond
研究生级科学选择题,Diamond 子集大约 198 道。很多综合榜曾经纳入它;Artificial Analysis 新版已因「太卷、分不开」把它退役。适合当背景知识,不适合再当主胜负手。
一张人话对照
按你的问题选榜,别一张表看完全部。
想看大盘谁更全能
看 Artificial Analysis 综合指数。
想看终端会不会干活
看 Terminal-Bench。科研流程再看 Terminal-Bench-Science。
想看长程改仓库
看 DeepSWE。老派修 Issue 看 SWE-bench。
想看会不会点电脑
看 OSWorld。
想看临场学新规则
看 ARC。
想看超难答题
看 HLE / GPQA,但别被天花板分数骗到。
机智流怎么用
官宣表先当广告附件。有用,但要标清:这是自家考场。
能开源复现、题量说得清的榜,比只能看通稿的榜更耐看。
同一模型换用力档、换工具、换脚手架,分数都能跳。别拿一张表判终身。
对你买不买单,最终还是两件事:会不会干你的活,额度烧不烧得起。
Astra 和 Fable 这轮最吵的,其实就这几张。名字吓人,拆开就是:谁出题、几道题、怎么判卷、例题长什么样、官网在哪。
文中截图来自各榜官网与公开任务页,方便扫读;正式题目与分数以官网、仓库及官宣对照表为准。素材截至撰写时,后续会改版。科普观察,不构成采购建议。