【科技纵览】2026年8月,一本内嵌AirTag定位器的书籍横跨美国大陆,最终停驻于拉斯维加斯亚马逊VGT3设施。这一追踪行动由科技媒体404 Media发起,起因是一名二手书商在Biblio平台接到异常大额订单后,配合记者将追踪器植入书中。据该仓库员工透露,此处接收大量纸质书后,会切除书脊与装订,快速扫描散页以提取文本,原书随即失去流通价值。这家曾以“把书搬上互联网”为使命的公司,二十余年后正通过物理拆解的方式,将未数字化的实体书转化为训练数据。
大模型对语言、知识及人类世界观的学习依赖海量文本,随着模型规模扩张,对多样化新信息的需求日益迫切。过去,业界视互联网为近乎无限的数据矿藏,涵盖数十亿人十多年的表达。然而,Epoch AI 2024年的研究指出,经去重和质量筛选后,公开人类文本仅约300万亿token,预计2026至2032年间将被充分消耗。虽然AI不会立即面临无数据可用困境,但获取优质新语料的成本正急剧上升。
与此同时,互联网内容正遭受AI生成内容的“污染”。自ChatGPT发布以来,大量网页、博客及评论由模型生成或辅助撰写。这些内容虽通顺,却缺乏纯粹的人类特质。大模型通过人类文本学习世界描述方式,而AI生成内容往往基于高概率表达,导致措辞同质化及错误共享。当这些内容回流至训练集,形成递归循环,高频模式被放大,长尾低概率内容消失,这种现象被称为“模型坍缩”。此外,人机混写内容使得来源追踪和质量过滤成本激增,尽管文本总量增加,有效新数据并未同步增长。
在此背景下,未经AI介入的纸质书成为稀缺资源。一本几十年前出版且未数字化的旧书,其核心价值在于来源的可确定性。例如1987年的地方史或绝版专业手册,虽内容可能过时,但保留了作者、出版社等元数据,提供了主流网络中罕见的低频知识和特定时代语境。在AI训练视角下,“人类创作”本身成为一种可识别且高价值的数据标签。相较于被反复转载的网络文章,这些罕见出版物能提供模型未曾见过的知识分布。
科技巨头已加速布局线下数据源。OpenAI于2023年启动数据合作计划,寻求公共互联网外的大规模资料,包括与Free Law Project合作的法律文书。2025年Bartz v. Anthropic案披露,Anthropic斥资数百万美元购买数百万本新旧书籍,通过拆装订、裁书页并扫描为PDF的方式构建私有数据集。这些举措表明,谁能提前锁定未被AI污染的存量文本,谁便掌握了下一代模型的关键命门。
面对亚马逊切书脊的行为,公众易产生文化遗产被毁的本能反感。然而,在旧书市场中,“稀有”常指存量少或绝版,未必具备高收藏价值。许多此类书籍早已滞销,面临化浆命运。从某种角度看,这种物理毁灭伴随的是数据的永久保存与检索便利。那些被人类遗忘数十年的文字,在AI时代重新获得生命力。我们正步入一个悖论式的阶段:能撰写论文与代码的人工智能,其进化养分正从落满灰尘的旧书页中逐页剥离。
AI语料枯竭引发“拆书潮”:亚马逊仓库成数据提取前线
科技区角
2026-08-31 10:31
关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。