【科技纵览】当互联网被低质生成内容淹没,人工智能行业正悄然转向实体世界,试图从泛黄的纸页中挖掘未被污染的“纯净”语料。据调查媒体404 Media披露,多家头部AI企业正借助中间商渠道,大规模收购二手图书。这一举动旨在获取高质量的人类原创文本以优化模型训练,同时规避直接抓取网络数据可能引发的舆论风暴。
回溯至2022年之前出版的纸质书籍,因其大概率未受AI生成内容的侵染,被视为极具价值的原始素材。这种对“人类智慧结晶”的渴求并非空穴来风。此前卷入版权纠纷的Anthropic公司,曾斥资数百万美元从Better World Books等平台批量购入纸质书,用于提炼内容训练其Claude模型,随后竟将这些书籍销毁。尽管法院裁定使用正版图书进行训练属“合理使用”,但Anthropic因长期持有包含700万本盗版书的数据库,最终被判赔偿15亿美元(约合人民币101.62亿元)。无独有偶,出版商联盟近期也对谷歌提起诉讼,指控其未经授权利用数百万本受版权保护的图书训练Gemini模型。
在此背景下,拥有逾1.11亿条图书目录信息的在线平台ISBNdb调整了业务航向,推出了面向AI企业的大宗图书采购服务。据报道,单笔订单规模跨度极大,从千本至百万本不等。一位匿名职业书商透露,自今年4月起,其销量呈现爆发式增长:以往周销约20本,如今已飙升至数百本,增幅达五倍左右。Alibris、Biblio等二手交易平台上的其他商户也证实了这一异常的大宗采购现象。
虽然尚无铁证指向具体买家,但交易特征显露出强烈的工业化采集意图。采购对象几乎全为带有13位国际标准书号(ISBN)的图书,且毫无题材偏好,小说、教材、专著均在列。更令人诧异的是,买方对价格极不敏感,即便标价高于市场价亦照单全收。前Google Books项目成员、现负责Anthropic“巴拿马计划”的汤姆·哈维证实,该公司聘请了如Datamation Information Services等专业扫描机构。为了追求效率与低成本,业界普遍采用破坏性扫描——即拆解书籍后高速录入,这导致数百万册纸质书在数字化过程中被物理毁灭。
这种将公共知识资源私有化的做法引发了深层伦理忧虑。批评者指出,若珍稀或绝版书籍在扫描中被毁,它们将永久退出流通领域。更为严峻的是,这些被数字化的内容最终仅存于AI公司的封闭数据库中,公众无法访问。这意味着,我们或许迎来了更智能的助手,却可能以牺牲人类知识遗产的公开性与可及性为代价,让后世失去直接接触原始文献的机会。
AI巨头隐秘扫货二手书,纸质文献成训练数据新矿藏
科技区角
2026-07-28 20:32
关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。