三分之一arXiv沦陷!CS论文65%被判「AI味」,数学仅0.7%

新智元 2026-07-27 09:59

三分之一arXiv沦陷!CS论文65%被判「AI味」,数学仅0.7%图1

  新智元报道  

三分之一arXiv沦陷!CS论文65%被判「AI味」,数学仅0.7%图2


三分之一的arXiv论文,竟然是AI写的?

就在最近,一份unslop的研究在外网炸开了锅。

过去一年,计算机科学领域65%的新论文,被它的检测器标了红。

网友甚至为此造了一个专属名词——「大泔水时代」。

可同一时期的数学论文,却只有0.7%。

三分之一arXiv沦陷!CS论文65%被判「AI味」,数学仅0.7%图3

三分之一arXiv沦陷!CS论文65%被判「AI味」,数学仅0.7%图4
ChatGPT一响,曲线原地起飞


在这项研究中,团队扫了12750篇arXiv论文,时间跨度从2023年1月直抵2026年7月。

目标锁定十个学科,每个领域每月抽取约25怕篇全文。

对照组则选定在2021至2022年,那是ChatGPT还未降生的纯人类时代。

三分之一arXiv沦陷!CS论文65%被判「AI味」,数学仅0.7%图5

结果显示,2021至2022年,标记率稳定在0.4%;但随着ChatGPT的发布,曲线在几个月内拔地而起。

在最近一个完整季度中,标记率达到了32%,而在2026年初,峰值更是逼近39%。

三分之一arXiv沦陷!CS论文65%被判「AI味」,数学仅0.7%图6

分学科来看,计算机科学最为惨烈,标记率高达65%。

要知道在ChatGPT问世前,它的底数只有0.2%。短短三年,数字狂飙了300多倍。

紧随其后的是定量生物56.3%,电气工程51.3%,经济金融47%;再往下,应用物理34%,统计31.3%,凝聚态24%,高能物理14%,天体物理10.7%。

榜单的最后一行是数学:0.7%。

而这还只是下限。如果把AI文本藏得足够隐蔽,检测器是识别不出来的。

三分之一arXiv沦陷!CS论文65%被判「AI味」,数学仅0.7%图7

同一台检测仪,同一个论文库,落差逼近100倍。

到底是数学家集体坚守纯手工码字?还是这台机器在数学公式面前,压根就是个瞎子?

三分之一arXiv沦陷!CS论文65%被判「AI味」,数学仅0.7%图8

跌入谷底的0.7%,是机器致盲


其实,谜底已经被unslop亲手写进了报告里。

想想看,一篇标准的数学论文究竟长什么样?满屏都是符号、公式、定理与证明,真正用英语写成的散文句子,少得可怜。

偏偏这台检测器只认文字。它盯的是句子的结构、用词的习惯、段落的组织。

而数学论文里仅剩的那几行字,还全是「设X为某某」「由引理3可推导」这类格式化表达,和检测器训练时见过的科学英语基本不在同一个频道上。

所以团队自己也承认,目前的研究还有不少局限性:

数学的0.7%目前还说明不了什么。可能是数学家真不怎么用AI,也可能是检测器看不懂数学论文,但这份数据分不出是哪一种。

对照组也比较小。每个学科只有200篇ChatGPT前的论文,按0.4%的误报率,2000篇里总共只有8篇被标记。这种水平,只能算是粗略估计。

再有就是前面说过的,检测器抓不全。所以,这些数字都还只是下限,真实比例只会更高。

三分之一arXiv沦陷!CS论文65%被判「AI味」,数学仅0.7%图9

越卷的地方,越离不开AI


那么,到底是谁在用AI写论文?

答案,藏在斯坦福另一组测了两年的数据里。

2024年3月,斯坦福Weixin Liang团队率先把尺子伸进同行评审:ICLR 2024的审稿意见里,约10.6%的句子被LLM大幅修改过。论文还没测完,审稿人自己先用上了。

2025年8月,还是这个团队,把样本扩到112万篇论文,并且直接登上了《自然·人类行为》。

研究显示,截至2024年9月,CS论文摘要的LLM修改比例最高已达22.5%。而且用得最狠的,是发预印本最勤、扎在最卷领域的研究者。

三分之一arXiv沦陷!CS论文65%被判「AI味」,数学仅0.7%图10

越卷的领域,用得越狠。

在这里,AI写作已经成为了军备竞赛:同行都在用AI提速,只用手写的人,节奏就慢了一拍。

难怪这份报告在X上流传颇广的一条转发,配文里第一行就是:「提示词:写一篇能发arXiv的论文。」

三分之一arXiv沦陷!CS论文65%被判「AI味」,数学仅0.7%图11

三分之一arXiv沦陷!CS论文65%被判「AI味」,数学仅0.7%图12
它闻的是「味」,不是AI


不过,先别急着拿这65%去定罪。

团队在报告里也承认,检测器分不清「AI顺过一遍语法」和「整篇机器代工」,它只认文字里的机器味浓度。

所以65%的准确读法,是「65%的论文闻起来像AI」,而不是「65%的论文是AI写的」。

但麻烦在于,这种机器味,人类自己也会沾染。

有不信邪的研究者,把自己多年前的旧论文扔进检测工具,结果27%到74%的内容被标红。

要知道在那个年代,ChatGPT连个影子都还没有。

三分之一arXiv沦陷!CS论文65%被判「AI味」,数学仅0.7%图13

原因不难找。

翻开今天的学术期刊,满纸都是大型语言模型、基准测试、业界最前沿。措辞越标准,结构越工整,越容易撞上检测器认定的机器特征。

何况,LLM本来就是拿这类论文训练出来的。不是学者写得像AI,是AI生来就写得像学者。

三分之一arXiv沦陷!CS论文65%被判「AI味」,数学仅0.7%图14

三分之一arXiv沦陷!CS论文65%被判「AI味」,数学仅0.7%图15

当所有文字都有了嫌疑


其实这两年,我们都在干和检测器同一件事。

读到一段四平八稳、词句工整、是不是「不仅……而且……」的文字,心里就会咯噔一下:这怕不是AI写的吧?

unslop的检测器,等于把这种玄学的嗅觉,做成了一台能量产数字的仪器。

毕竟怀疑一旦装进脑子,就卸不掉了。

过去,「写下来」本身就是一种背书。一个人愿意花几个小时组织文字,至少说明他认真。

现在写得再漂亮,都可能只换来一句「AI吧」。

有些人甚至开始刻意绕开自己用了半辈子的词,只因它们「听起来太AI」。

三分之一arXiv沦陷!CS论文65%被判「AI味」,数学仅0.7%图16

如今,「AI味」正在变成一场席卷文字圈的新型原罪。

滑稽的是,直到今天,我们连这股原罪由什么构成,都还没能精确测量出来。

参考资料:

https://unslop.run/blog/measuring-ai-writing-on-arxiv


编辑:摩西


秒追ASI
点赞、转发、在看一键三连
点亮星标,锁定新智元极速推送!

三分之一arXiv沦陷!CS论文65%被判「AI味」,数学仅0.7%图17

三分之一arXiv沦陷!CS论文65%被判「AI味」,数学仅0.7%图18

关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。
AI AR
more
杨植麟直言OpenAI无原创,Kimi K3登顶编程榜引硅谷震荡
马斯克对话《经济学人》:AI十年夺权与人类“园艺”隐喻
从WAIC展台到产业现场,道通科技开放日全面展示具身智能巡检技术体系
全球最强AI数据中心TOP60,三家中国企业上榜
商务部严正回应美方AI调查威胁:驳斥“蒸馏侵权”谬论,警告将采取必要反制
AI最尴尬的短板,中国科学院出手了
三分之一arXiv沦陷!CS论文65%被判「AI味」,数学仅0.7%
黄仁勋马斯克对中国AI发声/曝苹果智能眼镜明年亮相/携程回应被罚51亿
AI 内存架构,看这一篇就够了!
出海企业苦等的可信任AI营销产品,飞书深诺做出来了
Copyright © 2025 成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号