OpenAI研究员:我们都不读论文了

机器之心 2026-08-09 18:03
OpenAI研究员:我们都不读论文了图1
机器之心编辑部

前沿实验室的人几乎不读论文了?


OpenAI 的一位研究员一句话扫射三大顶会:太多夸大其词和造假!


OpenAI研究员:我们都不读论文了图2


事情的起因,是一篇效果好得让人想不通的 ICLR 论文,网友研究了一下才发现其中的「秘诀」。


OpenAI研究员:我们都不读论文了图3


在顶会发论文都「进化」成这样了吗?


OpenAI研究员:我们都不读论文了图4


一看代码是否开源,二看实验方法里有没有藏着什么「歪门邪道」,三才是出来的结果又能不能支撑核心结论 —— 这一层层拷问下来,顶会论文究竟有几篇经得起检验?


还真有人这么干了。


105 篇中,只有 8 篇「合格」


今年 7 月,由芝加哥大学计算机科学与数据科学副教授谭宸浩联合创办的 SAI,公布了一次大规模「实验审稿」。


他们选中的,是 ICML 2026 全部 168 篇 Oral 论文。


今年 ICML 共收到 23918 篇投稿,最终只有 168 篇获得 Oral 资格,占比约 0.7%。


换句话说,SAI 检查的已经是两万多篇投稿中筛出的最顶层。


除了和传统审稿人一样阅读论文的方法、实验设计和结果,SAI Review 还会下载代码、模型和数据,配置环境并运行实验,最后把运行结果与论文原文逐项对照。


SAI 审查了全部 168 篇 Oral,其中只有 104 篇论文代码开源,最终完成了 105 篇完整复现。


其中,只有 34 篇复现了超过 40% 的主张;复现比例超过 80% 的,只剩 8 篇。


OpenAI研究员:我们都不读论文了图5

无论每篇论文至少包含 1 项、3 项还是 5 项可验证主张,复现得分中位数始终在 28%—30%,整体分布变化不大。


OpenAI研究员:我们都不读论文了图6

排除未运行、提前中止或超出硬件能力的实验后,复现得分中位数仍只有 42%—50%;当每篇论文至少包含 3 项可验证主张时,中位数稳定在 42%。


复现里最常见的问题都遇到了:代码无法运行、文件缺失、说明不完整、依赖损坏,或者代码跑出的结果和论文对不上。


还有 4 篇论文依赖已经下线的模型。后来的研究者即使愿意花钱、花时间,也不可能重新得到相同结果。


SAI 还列举了两个更具体的例子。


一篇论文把「只训练基础模型 0.77% 的参数」写成主要卖点,实际发布的检查点却训练了 6.31% 的参数,约为宣称数字的 8 倍


另一篇论文展示了由裁判模型评分的可靠性表格,开源代码中却找不到这个裁判模型,也没有脚本能够算出表格里的数字。


劣质论文,收益高风险低


SAI 的复现结果可以说是相当糟糕。


更糟糕的是,这里发现的问题还只是「有条件被发现」的问题。


那些没有代码的论文,直接就「无懈可击」。


OpenAI研究员:我们都不读论文了图7


而即使代码完全公开,想要验证一篇论文,所花费的时间、精力和金钱都是巨额的,最后的结果还不如人意,不知道要多崩溃了。


按照 SAI 基于 Google Cloud 公开按需价格给出的估算,完整重跑一篇 ICML Oral 论文,成本中位数约为 8900 美元。105 篇论文中,17 篇超过 10 万美元,最昂贵的一篇接近 220 万美元


论文越依赖大规模算力,独立复现就越困难。


没有代码,别人无从检查;有了代码,也未必有人付得起这个成本。


于是,一篇存在问题的论文完全可能顺利通过评审、获得引用,再被写进简历,换来录取、教职或者大实验室的工作机会。


偶然有人发现结果对不上,会议也很少重新审查,论文也未必会被撤回。


这就是评论区所说的「做出糟糕的研究有收益,却几乎没有代价」。


OpenAI研究员:我们都不读论文了图8


不读论文,但是招聘要看论文


在大模型领域,确实有许多真正重要的进展不再以论文的形式出现。


作为 OpenAI 的工程师,站在产业前沿,有这种感受并不难理解。毕竟有更充足的算力、更快的实验反馈和大量不公开的内部结果,有「不读论文」的底气。


但这么说出来,多少有点微妙。


一条评论讽刺科技公司里的人这样是「上岸后抽走梯子」:从高校招走研究人员,建立在学术界公开积累的成果之上,用更高的价格抢走人才和 GPU,自己越来越少接受同行评审,最后却转过头宣布学术研究「主要是骗局」


OpenAI研究员:我们都不读论文了图9


稍显刻薄,但确实有道理。


这些前沿实验室的人可以「不读论文」,但是想进入的人还是要先发论文。


对于缺少产业经历的学生和年轻研究者来说,顶会论文依然是证明研究能力最直接的凭证。


申请博士、寻找教职、进入 OpenAI 这样的前沿实验室,都要依靠论文获得关注度。


产业界的人在进入大实验室之后轻视论文,却仍然用论文数量、会议级别和引用成绩筛选站在门外的人。


论文于是陷入一种尴尬的位置:它在知识传播上的可信度受到质疑,在人才竞争中的价值却丝毫没有消失。


所以,「大实验室已经不读论文了」听起来稍显清高和傲慢。因为真正有资格不读论文的人,往往已经凭借论文跨过了那道门槛。


当然,也不是所有学生都是精心设计骗局的学术反派。


一位高校研究者开玩笑说,他倒希望自己的学生已经有能力写出一篇夸大其词甚至造假的论文。


OpenAI研究员:我们都不读论文了图10


有的人在「争做学术骗子」,而有的人还挣扎在 LaTeX。


参考链接:

https://x.com/MathewShen42/status/2084465434506768867

https://x.com/kellerjordan0/status/2084721463089902074


https://sai.science/blog/how-much-science-is-verifiable

https://x.com/mengyer/status/2085134204786921886



OpenAI研究员:我们都不读论文了图11


© THE END 

转载请联系本公众号获得授权

投稿或寻求报道:liyazhou@jiqizhixin.com


关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。
AI
more
模型权重如何成为AI的下一个「训练语料」?
OpenAI关停Atlas:AI浏览器梦碎,功能化才是终局
OpenAI研究员:我们都不读论文了
Anthropic CEO急了:新人都是冲钱来的!AI巨头最大危机不是算力,是留人
NextSlide团队并入OpenAI,专注ChatGPT视觉化表达
20期、130多个产品后,我们把「每周AI项目推荐」做成了「Builder Hub」
揭秘!Agent潜伏两个月联手作案,OpenAI还原安全事故全过程
OpenAI高管:Codex这样的Harness,也就再火俩月
狐聊 | 你有用 AI 产出过什么有用的东西吗?
苹果官网撤下国行AI千问手册/曝诺奖得主哈萨比原计划离开谷歌/DeepSeek被一道几何题卡死| Hunt Good 周报
Copyright © 2025-成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号