【科技纵览】当人工智能生成内容如洪水般漫灌互联网,由人类亲手撰写的“纯净语料”瞬间成了稀缺资源。在此背景下,科技巨头们的目光悄然转向了纸质书籍这一传统载体。日前,独立媒体404 MediaX披露了一则令人咋舌的消息:多家AI公司正批量收购2022年前出版的珍稀图书,通过液压切割机暴力切除书脊后进行扫描,以获取未被AI“污染”的干净数据——毕竟,2022年前的出版物尚不包含机器生成的痕迹。更为极端的是,为防止这些数据二次流入市场,这些书籍在扫描后往往被直接粉碎销毁。
报道特别指出,Anthropic曾执行代号为“巴拿马计划”的行动,销毁了数百万册实体书,其中甚至包括存世量极少的绝版古籍。颇具讽刺意味的是,美国联邦法院裁定该行为合法,认定“购买纸质书并进行破坏性扫描”属于合理使用范畴。消息一经曝光,便在社交媒体引发剧烈震荡。X平台用户Hedgie转述此事时,埃隆·马斯克罕见回复称,已要求SpaceX AI团队保存图书馆中的珍贵书籍,并采用无损扫描方式,以避免对书脊造成物理破坏。Hedgie随即回应,感谢马斯克团队的举措,尽管无损扫描速度较慢,但仍能获取训练数据,并呼吁其他业内公司以此为标准。
无论手段如何,书籍作为AI训练语料核心来源的地位已毋庸置疑。ISBNdb这家号称拥有“全球最大图书数据库”的公司,近年已转型为AI企业的专属数据供应商;《华盛顿邮报》亦发现,Anthropic已与旧书平台Better World Books达成合作。然而,这种掠夺式的数据获取方式正引发激烈的法律对抗。7月22日,新闻集团向加州奥克兰联邦法院提起反诉,指控Brave Software未经授权抓取《华尔街日报》等旗下媒体文章用于模型训练;此前一周,一群主要出版商也对谷歌提起诉讼,指控其非法使用数百万本版权书籍构建Gemini模型,并称此为“历史上最严重的侵犯版权行为之一”。谷歌内部评估显示,若将出版商文本用于Google Play图书,可能面临100亿至1000亿美元的潜在罚款。
从行业视角看,这场博弈背后是巨大的商业价值重构。中信证券研报预测,2026年文化IP数字化运营有望为出版业带来约700亿元增量空间。大模型对优质语料的渴求,使得出版企业拥有的清晰版权归属和垂类内容优势,成为跨越技术周期的底层核心资产。中泰证券亦指出,相关出版公司有望在互联网与AI的双重浪潮中持续获益。
AI巨头“毁书”求数据引争议,马斯克呼吁无损扫描
科技区角
2026-07-30 10:32
关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。