【科技纵览】当大模型厂商在千亿算力基建上挥金如土时,一颗隐秘的“版权暗雷”正悄然逼近。8月中旬,市场传出苹果拟斥资数亿美元采购新闻语料的消息,瞬间搅动内容行业的一池春水。这一举动不仅关乎真金白银的交易,更折射出全球范围内日益激烈的AI训练数据版权之争。从《纽约时报》起诉OpenAI和微软,到六位普利策奖得主联名控告Anthropic等巨头,诉讼浪潮已席卷文学与新闻界。此前,Anthropic因被指滥用著作训练Claude而达成和解,需支付15亿美元赔偿金,创下美国版权案已知最高和解纪录。国内亦不平静,上海金山法院去年11月一审宣判了首例AI大模型著作权侵权案,涉及《斗破苍穹》角色形象权益。面对迭代狂奔的大模型,法律如何界定“合理使用”与“侵权”边界?记者就此对话了多位律师、学者及从业者。
苹果此次提出的“按量付费”机制——即Siri实际使用合作方内容时才支付费用——被视为AI时代内容授权的新范式,但也引发争议。上海财经大学竞争法与知识产权研究中心执行主任厉彦冰指出,这并非全新概念,本质上仍是依据美国现行《版权法判定的版税支付,属于常见的许可费计价模式之一。北京大成(上海)律师事务所高级合伙人傅钢强调,著作权法关注的是企业是否获得许可实施使用行为,而非支付方式。即便合同约定按次付费,若来源权利有瑕疵或授权范围未覆盖使用场景,仍存侵权风险。北京市中伦文德律师事务所上海分所合伙人黄阳阳则认为,在协议框架下,苹果基本规避了直接侵权风险,除非引用的新闻本身侵犯第三方版权,但此类协议通常包含免责条款。
然而,“按量付费”并未解决核心难题。厉彦冰提醒,这只是合同层面的计价方式,不涉及AI使用行为的定性,且带来新的计量认定困境。例如,一次查询调用多家媒体多篇报道生成摘要,究竟算几次使用?技术故障导致的重复调用如何计算?这些细节往往不公开,导致“谁掌握计量数据,谁就掌握定价解释权”。固定年费模式下,平台承担“内容未被使用”的风险;而按量付费则将风险转移给出版商。由于计量数据由平台掌控,内容方难以验证调用次数及总额分配,集体议价能力被削弱。一位出版社从业者透露,目前许多出版社对语料训练问题反应消极被动,虽意识到利益共享优于风险独担,但理想与现实存在分裂。
苹果购版权消息传出当日,A股“AI语料”板块大涨,读客文化一度涨停,中信出版等跟涨。西南证券传媒首席分析师苟宇睿认为,这是典型的“海外映射”行情,具备情绪与主题资金轮动特征。长期看,AI正推动传媒产业从“消费品”转向“数据+IP资产”双重定价,国内逻辑正从规模竞争转向价值质量竞争。但他提醒,Token价值体系短期偏主题弹性,能否沉淀为长期估值中枢,仍需观察后续授权交易及政策落地情况。苹果在2025财年年报中将AI列为风险因素,提及可能涉及的版权材料获取及使用问题,显示其已将AI版权合规视为前置的中长期经营风险。傅钢认为,这对国内厂商的启示是,合规应覆盖数据取得、清洗、训练至输出的全过程。
未来稀缺的或许不再是海量数据,而是能持续、稳定、合规使用的高质量资源。傅钢指出,大模型竞争将从公开抓取转向与新闻媒体、出版机构建立长期授权合作。苟宇睿同样认为,大众通俗文本供应充分,真正稀缺的是高质量、独家、合规、可溯源的专业垂类数据,如医学教材、法律判例、学术期刊及权威新闻。受益资产主要包括专业垂类知识、权威古籍、实时新闻、网文影视IP及数据服务公司。传统出版有望从单纯分红估值向“分红+数据版权重估”双逻辑切换,但受限于权属复杂及工程壁垒,重估更可能发生在少数专业持有方。IDC数据显示,2025年中国人工智能基础数据服务市场规模达62.62亿元,同比增长27.8%,预计2026年将增至78.34亿元。目前国内语料数据以“本地化+私有部署”为主,自建模型、共建国家级正版语料库及专业数据外包三种做法并行。
关于“合理使用”还是侵权,全球争议未定。AI公司主张训练具有转换性,形成新工具;版权方则指责大规模复制作品用于商业目的,削弱原有市场。傅钢判断,不能仅以转换性作为当然抗辩,也不能仅凭用于训练就推定侵权。他建议考量数据取得方式、复制行为、复现能力及市场竞争等因素。今年7月,“巴茨诉Anthropic案”以15亿美元和解收官,法官认定使用受保护书籍训练属转换性使用,但驳回使用盗版书籍的抗辩。厉彦冰提醒,该案无约束力先例,美国尚无联邦上诉法院就AI训练是否构成合理使用作出实体判决,地区法院判决亦存在冲突。
若版权保护不当,恐致原创供给萎缩,AI陷入“自我循环”陷阱。皮尤研究显示,ChatGPT问世后超三分之一网页带有AI生成痕迹。黄阳阳警告,知识凝固在参数权重中,易产生幻觉。一位从业者透露,上游作者人机协同创作导致作品“AI味”浓,引发原创性担忧。黄阳阳指出,新闻报道虽事实不受保护,但文字表达、叙事编排属版权作品,是大模型侵权重灾区。她强调,合规需将版权、内容安全、产品责任统筹评估。上海段和段律师事务所合伙人刘春泉透露,多数大模型企业未主动购买版权,且隐匿数据来源,给举证带来难题。他认为,扫描复制作品用于商业训练应认定侵犯复制权,法院若认定合理使用等于慷他人之慨。
我国现行《著作权法》未明确规定适用于商业大模型训练的文本数据挖掘例外,不能简单照搬美国“转换性使用”概念。未来裁判规则或将沿分阶段、分场景方向细化,重点审查数据来源、训练方式及市场影响。《生成式人工智能服务管理暂行办法》及2025年11月实施的国标《网络安全技术 生成式人工智能服务安全基本要求》,均要求使用合法来源数据。今年5月,22家机构启动“国家级正版高质量语料库”,确立“先授权、后使用”原则并引入区块链留痕。厉彦冰表示,合规义务已落地,但市场基础设施尚在建设,标准化授权模板、透明定价机制及常态化通道处于探索初期。随着技术成熟与案例增多,司法将通过类型化解释逐步达成共识,现代版权法足以应对这一颠覆性技术带来的挑战。
苹果数亿美元购新闻语料背后:AI版权博弈进入深水区
科技区角
2026-08-28 13:30
关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。