AI巨头“毁书”求数据引争议,马斯克呼吁无损扫描

科技区角 2026-07-30 10:32

【科技纵览】当人工智能生成内容如洪水般漫灌互联网,由人类亲手撰写的“纯净语料”瞬间成了稀缺资源。在此背景下,科技巨头们的目光悄然转向了纸质书籍这一传统载体。日前,独立媒体404 MediaX披露了一则令人咋舌的消息:多家AI公司正批量收购2022年前出版的珍稀图书,通过液压切割机暴力切除书脊后进行扫描,以获取未被AI“污染”的干净数据——毕竟,2022年前的出版物尚不包含机器生成的痕迹。更为极端的是,为防止这些数据二次流入市场,这些书籍在扫描后往往被直接粉碎销毁。

报道特别指出,Anthropic曾执行代号为“巴拿马计划”的行动,销毁了数百万册实体书,其中甚至包括存世量极少的绝版古籍。颇具讽刺意味的是,美国联邦法院裁定该行为合法,认定“购买纸质书并进行破坏性扫描”属于合理使用范畴。消息一经曝光,便在社交媒体引发剧烈震荡。X平台用户Hedgie转述此事时,埃隆·马斯克罕见回复称,已要求SpaceX AI团队保存图书馆中的珍贵书籍,并采用无损扫描方式,以避免对书脊造成物理破坏。Hedgie随即回应,感谢马斯克团队的举措,尽管无损扫描速度较慢,但仍能获取训练数据,并呼吁其他业内公司以此为标准。

无论手段如何,书籍作为AI训练语料核心来源的地位已毋庸置疑。ISBNdb这家号称拥有“全球最大图书数据库”的公司,近年已转型为AI企业的专属数据供应商;《华盛顿邮报》亦发现,Anthropic已与旧书平台Better World Books达成合作。然而,这种掠夺式的数据获取方式正引发激烈的法律对抗。7月22日,新闻集团向加州奥克兰联邦法院提起反诉,指控Brave Software未经授权抓取《华尔街日报》等旗下媒体文章用于模型训练;此前一周,一群主要出版商也对谷歌提起诉讼,指控其非法使用数百万本版权书籍构建Gemini模型,并称此为“历史上最严重的侵犯版权行为之一”。谷歌内部评估显示,若将出版商文本用于Google Play图书,可能面临100亿至1000亿美元的潜在罚款。

从行业视角看,这场博弈背后是巨大的商业价值重构。中信证券研报预测,2026年文化IP数字化运营有望为出版业带来约700亿元增量空间。大模型对优质语料的渴求,使得出版企业拥有的清晰版权归属和垂类内容优势,成为跨越技术周期的底层核心资产。中泰证券亦指出,相关出版公司有望在互联网与AI的双重浪潮中持续获益。

关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。
AI 扫描
more
OpenAI 芯片实测跑分揭晓,「为模型造芯片」时代来了
液冷到底有多脆弱?AIDC液冷故障全面分析
AI时代外语专业并非“夕阳产业”,北理工探索文理交叉新路径
200万AI打工人,撑起一个IPO
加州理工用AI攻克量子化学60年难题,1块显卡做完7800块的活!
AI 硬件创业者,开始研究黄金和宝石了
2026 高通开发者城市创享工坊 · 深圳站收官|瑞莎 Dragon Q6A 化身 AI 视觉云台
Roku上线全天候AI电视频道,没人想看却强行开播?
换掉一块英伟达卡,要重写多少东西?6家国产AI芯片公司,谁的软件栈接得住?
苹果Mac mini M6发布:两年涨2500块,AI税反噬「龙虾神机」
Copyright © 2025-成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号