AI语料枯竭引发“拆书潮”:亚马逊仓库成数据提取前线

科技区角 2026-08-31 10:31

【科技纵览】2026年8月,一本内嵌AirTag定位器的书籍横跨美国大陆,最终停驻于拉斯维加斯亚马逊VGT3设施。这一追踪行动由科技媒体404 Media发起,起因是一名二手书商在Biblio平台接到异常大额订单后,配合记者将追踪器植入书中。据该仓库员工透露,此处接收大量纸质书后,会切除书脊与装订,快速扫描散页以提取文本,原书随即失去流通价值。这家曾以“把书搬上互联网”为使命的公司,二十余年后正通过物理拆解的方式,将未数字化的实体书转化为训练数据。

大模型对语言、知识及人类世界观的学习依赖海量文本,随着模型规模扩张,对多样化新信息的需求日益迫切。过去,业界视互联网为近乎无限的数据矿藏,涵盖数十亿人十多年的表达。然而,Epoch AI 2024年的研究指出,经去重和质量筛选后,公开人类文本仅约300万亿token,预计2026至2032年间将被充分消耗。虽然AI不会立即面临无数据可用困境,但获取优质新语料的成本正急剧上升。

与此同时,互联网内容正遭受AI生成内容的“污染”。自ChatGPT发布以来,大量网页、博客及评论由模型生成或辅助撰写。这些内容虽通顺,却缺乏纯粹的人类特质。大模型通过人类文本学习世界描述方式,而AI生成内容往往基于高概率表达,导致措辞同质化及错误共享。当这些内容回流至训练集,形成递归循环,高频模式被放大,长尾低概率内容消失,这种现象被称为“模型坍缩”。此外,人机混写内容使得来源追踪和质量过滤成本激增,尽管文本总量增加,有效新数据并未同步增长。

在此背景下,未经AI介入的纸质书成为稀缺资源。一本几十年前出版且未数字化的旧书,其核心价值在于来源的可确定性。例如1987年的地方史或绝版专业手册,虽内容可能过时,但保留了作者、出版社等元数据,提供了主流网络中罕见的低频知识和特定时代语境。在AI训练视角下,“人类创作”本身成为一种可识别且高价值的数据标签。相较于被反复转载的网络文章,这些罕见出版物能提供模型未曾见过的知识分布。

科技巨头已加速布局线下数据源。OpenAI于2023年启动数据合作计划,寻求公共互联网外的大规模资料,包括与Free Law Project合作的法律文书。2025年Bartz v. Anthropic案披露,Anthropic斥资数百万美元购买数百万本新旧书籍,通过拆装订、裁书页并扫描为PDF的方式构建私有数据集。这些举措表明,谁能提前锁定未被AI污染的存量文本,谁便掌握了下一代模型的关键命门。

面对亚马逊切书脊的行为,公众易产生文化遗产被毁的本能反感。然而,在旧书市场中,“稀有”常指存量少或绝版,未必具备高收藏价值。许多此类书籍早已滞销,面临化浆命运。从某种角度看,这种物理毁灭伴随的是数据的永久保存与检索便利。那些被人类遗忘数十年的文字,在AI时代重新获得生命力。我们正步入一个悖论式的阶段:能撰写论文与代码的人工智能,其进化养分正从落满灰尘的旧书页中逐页剥离。

关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。
AI
more
机械革命翼龙15 Air 2026发布:锐龙7 H 449配RTX 5060,国补后仅9999元
长鑫正式量产LPDDR6,华为新三折叠亮相,微信分付支持AppleStore,国内首部AIGC长剧定档,这就是今天的其他大新闻!
OpenAI加速Astra模型内测,单次对话生成GTA2级游戏引关注
重磅!大模型AI芯片高峰论坛嘉宾全公布
OpenAI 终止与 Cursor 合作;雷军:2600名小米车主行程超 10 万公里;华纳与索尼起诉 Anthropic,索赔数十亿美元 | 极客早知道
搜狗输入法“做减法”重构体验,AI能力整合与生僻字全覆盖成亮点
AI 如何塑造生产力?复旦联合斯坦福、伯克利、牛津、普林斯顿、UCL 等 12 家机构给出 68 页答案
马斯克跨界造叶片:AI算力瓶颈倒逼能源供应链垂直整合
本周AI项目推荐|津渡生科、临界航天、无尽方舟……AI4S再次站上潮头
好莱坞与字节握手言和!既然挡不住AI视频浪潮,那就一起赚钱
Copyright © 2025-成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号