GPT-6 和 Claude Fable 5.1 常见「评测集」扫盲

机智流 2026-09-06 13:57

机智流 · 2026年9月6日

GPT-6-Astra 和 Claude Fable 5.1 同一周撞车。两边官宣页上都贴满数字。

普通人看晕,多半不是因为笨,而是这些「跑分榜」名字长、规则不一样:有的开源能自己跑,有的只能看官方交的卷子。

这篇把两边最近最爱甩的几张榜拆开讲:谁做的(出品方多说两句)、大约多少道题、怎么测、例题长什么样、官网在哪。数字只当参考,不当真理。

一、综合能力指数 · Artificial Analysis

出品方

独立评测公司 Artificial Analysis,总部在旧金山。联合创始人是 CEO Micah Hill-Smith 和 CPO George Cameron,两人都有咨询背景,公司主业就是测模型、测云、测芯片,给开发者和企业一张尽量中立的成绩单。

测什么 / 题量怎么理解

把多套卷子加权成一个总分。当前大版本常见大约 10 项测评(终端、专业文书、科学推理等),权重会改版。不是「一共 N 道选择题」那种单一题库。Fable 5.1 顶配大约 66、Astra 大约 61,是独立成绩单里常被引用的一对。

大概怎么测

同一套脚手架、多家模型一起跑;有的看对错,有的看交出来的文件,用评委对比打分。新版加重「不公开题」,防实验室对着公开题刷分。

GPT-6 和 Claude Fable 5.1 常见「评测集」扫盲图1

官网截图 · Artificial Analysis Intelligence Index:十项评测拼成一张综合分

官网:https://artificialanalysis.ai/

方法说明:https://artificialanalysis.ai/methodology/intelligence-benchmarking/

二、终端干活榜 · Terminal-Bench 4.0

出品方

Terminal-Bench / Harbor 团队。背后有非营利机构 Laude Institute(约 2025 年成立,面向计算机科研的「把想法推到业界」组织;公开材料提到 Andy Konwinski 等出资与联合创立)。Harbor 是他们开源的评测脚手架;Terminal-Bench 早期与斯坦福等研究者合作,后来变成持续更新的社区题库,Ryan Marten、Alex Shaw、Mike Merrill 等人常出现在公开介绍里。

题量

4.0 版大约 66 道容器化任务。排行榜常见做法是每题跑 5 次,一整轮大约 330 次试验。

大概怎么测

把代理丢进真实命令行容器:装依赖、改配置、写脚本、排错。另一容器跑校验脚本,看最终状态对不对,不是看嘴上说得对不对。

GPT-6 和 Claude Fable 5.1 常见「评测集」扫盲图2

官网例题 · Harbor:payments-pipeline-fix,真实终端里加速交易流水线

官网:https://www.tbench.ai/

代码:https://github.com/harbor-framework/terminal-bench

OpenAI 官宣对照里,Astra 大约 57.9%,Fable 5.1 大约 55.8%。这是官方表,独立榜也可能因脚手架不同略有出入。

三、科学终端榜 · Terminal-Bench-Science 0.1

出品方

同一条 Terminal-Bench / Harbor 线。科学任务由一线科研人员贡献;发布说明里写过斯坦福等研究者牵头推进,强调「科研工作流」而不是普通刷题。

题量

0.1 版 70 道。公开材料写过:海量提案里最后只留下够硬、够清楚、能严格打分的 70 道。

大概怎么测

终端里完成科研流程:数据分析、模拟、拟合、定理证明等,用可复现测试验收到底产物。

GPT-6 和 Claude Fable 5.1 常见「评测集」扫盲图3

官网例题 · 化学任务:在预算内做多保真度材料/分子搜索策略

官网:https://www.tbench.ai/news/terminal-bench-science-0-1

OpenAI 官宣对照里,Astra 大约 64.6%,Fable 大约 52.6%。这是两边这轮最爱对轰的一张科学向榜。

四、长程写代码榜 · DeepSWE v1.1

出品方

Datacurve:YC 孵化的旧金山公司(约 2024),主业是给前沿模型提供高质量「写代码」训练与评测数据。DeepSWE 是他们公开的长程软件工程评测;配套还有 Pier 等跑分工具。

题量

113 道题,覆盖大约 91 个仓库,语言包括 TypeScript、Go、Python、JavaScript、Rust。

大概怎么测

陌生仓库风格工程 + 长程改造;提示不长但要动很多文件;程序化校验行为。任务是新写的,减少「考题被预训练见过」。

GPT-6 和 Claude Fable 5.1 常见「评测集」扫盲图4

官网例题 · DeepSWE:happy-dom 关闭时要正确中断未完成的 body 读取

官网:https://deepswe.datacurve.ai/

代码:https://github.com/datacurve-ai/deep-swe

OpenAI 官宣表里,Astra 大约 74.1%,Fable 5.1 大约 67.4%。同场往往贴得很紧。

五、修真实 Issue · SWE-bench 家族

出品方

普林斯顿 NLP 团队发起(Jimenez、Yang、Narasimhan 等,ICLR 2024 论文)。Verified 子集与 OpenAI 合作,雇开发者人工筛掉有问题的题。更难的 Pro 等版本由 Scale 等继续推进,面向更「企业级、长周期」的修仓库场景。

题量

原版测试集约 2294 道;常用 Verified 是人工筛过的 500 道;Pro 总规模大约 1865 道(公开集 / 保留集 / 商业集拆开)。

大概怎么测

真实 GitHub Issue → 改代码 → 跑仓库测试,通过才算修好。

GPT-6 和 Claude Fable 5.1 常见「评测集」扫盲图5

真实 Issue 例 · scikit-learn #10284:RidgeClassifierCV 参数报错

官网:https://www.swebench.com/

Verified:https://www.swebench.com/verified

Pro 介绍:https://scaleapi.github.io/SWE-bench_Pro-os/

注意:这轮 Fable 5.1 官宣主表并没有拿 SWE 当头牌。网上如果把 Fable 5 的旧分贴到 5.1 头上,要小心。

六、操控电脑 · OSWorld

出品方

xlang 团队等开源项目(NeurIPS 数据集赛道常见引用)。目标是给多模态代理一个「真电脑」考场:桌面、浏览器、办公软件都能碰。

题量

Ubuntu 场景大约 369 道;其中约 8 道 Google Drive 相关题常因网络配置被排除,很多报告写 361 道。

大概怎么测

虚拟机桌面里看屏幕、点鼠标、开软件;用执行结果打分,有的题是做成/没做成,有的给完成度。

GPT-6 和 Claude Fable 5.1 常见「评测集」扫盲图6

官网例题 · OSWorld:从本地 VSIX 给 VS Code 装扩展

官网:https://os-world.github.io/

代码:https://github.com/xlang-ai/OSWorld

七、抽象智力游戏 · ARC-AGI / ARC-AGI-3

出品方

ARC Prize 基金会:非营利,公开材料由 François Chollet(Keras / ARC)、Mike Knoop(Zapier / Ndea)等推动。定位是「给 AGI 一个北辰」——测的是人类很容易、模型很难的流体智力;也通过奖金鼓励开源新思路。

题量

ARC-AGI-3 是可交互小环境;公开有演示集,正式排行用私有题。公开材料强调:人能解完公开环境,但公开集成绩不算正式晋级证明。

大概怎么测

不给说明书。模型要试错、摸目标、建策略。Astra 在标准化考场大约 62.7%;换官方配套状态保持方式,数字会飙很高——同榜不同考法,别直接横比。

GPT-6 和 Claude Fable 5.1 常见「评测集」扫盲图7

官网例题 · ARC-AGI-3 公开演示:可交互小游戏,没说明书

官网:https://arcprize.org/arc-agi/3

工具:https://github.com/arcprize/ARC-AGI

八、超难问答 · Humanity’s Last Exam、GPQA

HLE · 出品方

Center for AI Safety 与 Scale AI 等发起;近千名学科专家、五百多所机构、约五十个国家供题。定位是「人类最后一场学术考试」:封闭题做到够难,用来追前沿模型的专家级书本能力。

题量 / 怎么测

公开版大约 2500 道(不同材料也会写约 3000 的筹备规模),覆盖上百学科;另有私有题防过拟合。可带或不带工具。

GPT-6 和 Claude Fable 5.1 常见「评测集」扫盲图8

官网例题 · HLE:拉丁碑文翻译、蜂鸟解剖题,专家级超难问答

官网:https://lastexam.ai/

GPQA Diamond

研究生级科学选择题,Diamond 子集大约 198 道。很多综合榜曾经纳入它;Artificial Analysis 新版已因「太卷、分不开」把它退役。适合当背景知识,不适合再当主胜负手。

一张人话对照

按你的问题选榜,别一张表看完全部。

想看大盘谁更全能

看 Artificial Analysis 综合指数。

想看终端会不会干活

看 Terminal-Bench。科研流程再看 Terminal-Bench-Science。

想看长程改仓库

看 DeepSWE。老派修 Issue 看 SWE-bench。

想看会不会点电脑

看 OSWorld。

想看临场学新规则

看 ARC。

想看超难答题

看 HLE / GPQA,但别被天花板分数骗到。

机智流怎么用

官宣表先当广告附件。有用,但要标清:这是自家考场。

能开源复现、题量说得清的榜,比只能看通稿的榜更耐看。

同一模型换用力档、换工具、换脚手架,分数都能跳。别拿一张表判终身。

对你买不买单,最终还是两件事:会不会干你的活,额度烧不烧得起。

Astra 和 Fable 这轮最吵的,其实就这几张。名字吓人,拆开就是:谁出题、几道题、怎么判卷、例题长什么样、官网在哪。

文中截图来自各榜官网与公开任务页,方便扫读;正式题目与分数以官网、仓库及官宣对照表为准。素材截至撰写时,后续会改版。科普观察,不构成采购建议。

关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。
more
英诺赛科上半年营收8.34亿元,AI芯片出货大增183%
iPhone 18 Pro首发A20 Pro芯片 2nm工艺加持 GPU性能暴涨近30%
小米18 Fold影像预热:徕卡三摄加持,玄戒O3芯片首秀
英伟达花200亿美元买回来的推理芯片,一颗HBM都不用?
从芯到端:极海AK1/AK2超声波传感与控制芯片全栈式产业化之路
Marvell迈威尔FY2027 Q2:数据中心占营收近八成,定制芯片下半年开始爬坡
小米18 Fold配置全解析:金沙江电池与玄戒O3芯片首发
华境S交付延期致歉:芯片短缺成瓶颈,启动专项保供
神芯科技何为:坚定做国产脑机接口芯片的" 长期主义者 "
具身智能芯片技术路线新动向:“大小脑一体化SoC”和“视触同源”
Copyright © 2025-成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号