2026年7月20日
美国加利福尼亚北区联邦地区法院
法官签署了一项最终法令
正式批准人工智能公司Anthropic
与作者们高达15亿美元的
版权集体诉讼和解协议
这是美国金额最大的版权案件和解
然而,这场创纪录的和解背后
隐藏着一个更加令人不安的故事:
一家AI公司花费数千万美元
购买、切割、扫描并销毁了
数百万册实体书
只为喂养旗下的大语言模型
野心勃勃的“巴拿马计划”
美国Anthropic公司是2021年1月由前OpenAI员工所创立的AI公司,其核心产品是大语言模型Claude,其底层大语言模型(LLM)依靠企业中央素材库中的图书和文本完成训练。2023年3月,Claude正式对外发布,在全球拥有超过5600万的活跃用户,年营收额超10亿美元。
为训练大语言模型,Anthropic公司试图搭建一座囊括“世界上所有书籍”、可永久留存的中央素材库。素材库主要有两种使用场景:一是无论什么来源,所有数字图书都永久存档,供全公司的工程师随时调取;二是用这些书籍制作出训练数据,来迭代大语言模型,以提升Claude付费产品生成文字的文笔、叙事和逻辑能力。Anthropic公司偏好人类作家所写的文学性高、叙事性强的作品,认为依靠这些优秀的文学样本可以更好、更快地训练语言模型。如果不使用这些文学作品作为训练素材,Anthropic公司就需要聘请专业的撰稿人提供不同领域的优秀写作范例,并让工程师修改和应用范文,这会产生更高的训练成本。
2021年到2022年,Anthropic公司在Books3数据库中下载了将近20万册未经授权的盗版书籍;从电子书分享平台“创世纪图书馆”中下载了至少500万册盗版书籍;并从盗版镜像网站里下载了至少200万册盗版图书……据统计,Anthropic公司从不同途径获取了超过700万册盗版电子书,并留存了完整的盗版文件、书名、作者、ISBN元数据目录等信息。
但使用盗版书籍训练大语言模型面临着很大的法律风险,Anthropic公司只能寻找获取书籍的新途径。尽管心存疑虑,但该公司始终未删除已获取的盗版图书文件。2024年2月,Anthropic公司聘用了谷歌图书扫描项目的前负责人汤姆·特维,让他寻找“获取世界上所有书籍”的办法,同时尽可能规避法律纠纷。这个隐秘的行动被称为“巴拿马计划”。
据《华盛顿邮报》报道,Anthropic公司建立了一套工业化的流程:从各大书店和经销商处购买二手图书,使用液压机切掉书脊,再用高速扫描仪对每一页的内容进行数字化,最后将这些纸质图书全部粉碎、打成纸浆。为何用如此冷酷的方式对待实体书,原因很简单:这样做效率更高、成本更低。
为收集这些书,Anthropic公司花费了数千万美元,并在极短的时间内就完成了数百万本书籍的扫描,其中不乏存世稀少的绝版书和其他珍贵书籍。其中,一家名为ISBNdb的服务商为Anthropic公司促成了多达100万册的订单,并承诺为买家保持匿名。根据媒体的调查,Anthropic公司倾向于收集2022年前出版的书籍,因为这些书是“还未遭到人工智能污染的优质资源”。
Anthropic内部文件记载,“‘巴拿马计划’是我们破坏性扫描世界上所有书籍的行动,我们不希望外界知道我们在做这件事”。
作家们的集体诉讼
2023年8月,美国恐怖小说家安德里亚·巴茨在公寓里看到一条新闻《独家!你知道哪些作家的盗版书,正在为生成式AI提供灵感吗?》,巴茨心跳加速,她在一个专门用于训练大语言模型的作品数据库中输入了自己的名字。当巴茨在搜索结果里看到自己的几本小说时,一股巨大的恐惧感涌上心头。
巴茨是美国西北大学新闻学院的毕业生,之前做过记者,现在是全职小说家。巴茨决定,不能让自己的心血成为AI大模型的养料。2024年8月,巴茨联合了另外的两名作家查尔斯·格雷伯和柯克·约翰逊,向加利福尼亚北区联邦地区法院提起了对Anthropic公司的集体诉讼,他们认为该公司从盗版网站下载书籍,并用来训练大语言模型,是侵权行为。
2025年7月,案件主审法官正式对此案作出集体诉讼认证,这意味着此案从“三名作者告Anthropic公司”升级为“代表所有拥有相似处境的权利人告Anthropic公司”。在此案中,法院认证的“集体”规模非常庞大,潜在的成员涉及该公司下载的近700万册图书的权利人。但经后续严格筛查,最终符合赔偿条件的作品数量约为50万部。
应对诉讼,Anthropic公司的核心辩解是:“公司的复制行为是合理使用,因此不构成侵犯版权。”“合理使用”原则是美国版权法第107条规定的法定例外,允许在特定条件下未经许可、无偿使用受版权保护作品而不构成侵权。判定某一作品的使用行为是否满足“合理使用”的条件,核心是四个要素:一是使用的目的,包括是否具有商业性质,或为非营利教育的目的,关键看是否具备“转换性”,即是否通过增加新的表达、意义或信息,赋予了原作品新的价值和功能;二是版权作品的性质,纪实类的作品比高度创造性作品(如小说、绘画)更易被纳入合理使用的范围;三是所使用部分占原作品整体的比例是否具有实质性,不仅要看使用比例是否合理,更要关注使用部分是否属于原作品的核心表达,即使使用比例小,若涉及作品最具独创性和有价值的部分,也不能认定为合理使用;四是对潜在市场或价值的影响,如果使用行为直接替代了原作品,或显著损害了权利人的现有或潜在市场收益,则难以构成合理使用。
在此案中,法院认为Anthropic公司的复制行为有三种不同类型:一是采购纸质书并进行扫描数字化、存入素材库的复制行为;二是从盗版网站下载图书、存入素材库的复制行为;三是从素材库调取这些图书副本用于训练大语言模型的复制行为。不同的复制行为属于独立“使用行为”,必须分开评判。
首先是最具争议的“巴拿马计划”中的破坏书籍并扫描的方式。法院认为,Anthropic公司是通过合法渠道购得实体图书的,该公司所做的仅仅只是格式的转换,他们用更方便、可搜索的数字版本取代了购买的纸质图书,并没有制作新的副本或重新分发它们。只要书籍是通过合法途径进行购买的,扫描后的数字文件仅供内部使用,而非对外分发、销售,这一行为就属于合理使用。
其次则是大家都关心的问题:用他人的文学作品训练AI大语言模型到底是不是侵权行为?法院给出的答案是:该行为属于合理使用,因而Anthropic公司并未侵权。也就是说,只要AI公司通过合法途径获取了训练数据,用这些数据训练大模型本身并不构成侵权。因为训练模型的核心运作原理是:通过海量的文本统计出文字语义的关联,让模型生成全新的原创性文字内容,区别于传统图书的阅读、传播、出版用途,符合转化性使用的定义。我们可以用人类阅读书籍后创作新作品来类比:著作权法并不禁止人类吸收著名作家的文字风格和叙事逻辑,同理不应禁止AI学习人类的文学写作规律。此外,AI大模型仅仅只是内化了书籍的文字风格和特征,并不会向使用者输出完整的原作,所以并不存在完全替代书籍本身的使用场景的情况。
最后,针对Anthropic公司从盗版网站下载图书、存入素材库的复制行为,法院认为此举不构成合理使用。因为通过盗版的途径获取图书本身存在恶意,企业完全可以通过采购图书、获取合法授权等途径来获得图书,却为了节约成本大量下载盗版图书。此外,该公司不能以“部分盗版图书后续用于大语言模型训练”来豁免前期用盗版书籍建库的独立侵权行为。因为在盗版图书库中的大量书籍从未、或许将来也不会用于模型训练,建库本身是独立使用的,并非仅为训练模型服务。
现实与回应
针对法院的判决,美国出版商协会表示此案具有里程碑式的意义,这是“首次有一家大型AI公司会为其在训练数据中使用了盗版的材料而向出版商和作者付费”。
美国出版商协会总裁兼首席执行官玛丽发表声明称:“我们对法院最终批准这份和解协议表示由衷赞许。在大型AI科技企业肆意侵占归属于作者与出版商的知识产权、创意作品的长期斗争中,本次裁决是一场重大胜利。法院明确指出,侵权方从盗版网站抓取资源,不能仅仅因其操作便捷就被默许;相反,此类恶劣行为绝不能被合理化、常态化。”
然而,并非所有人都对这项判决感到满意。据统计,有超过350名作者选择退出这项和解。2026年6月,138名选择退出的作者再次对Anthropic公司提起了独立的版权侵权诉讼。与此同时,针对其他AI公司的类似诉讼仍在继续进行中,比如好莱坞著名制片公司华纳兄弟公司就对AI图像生成公司Midjourney提起了版权侵权的诉讼。
15亿美元的赔偿金看似天价,但在扣除管理费、律师费和各项开支并进行平均分配后,单部被侵权作品的权利人所获得的赔偿金预计在3000美元左右。而对于Anthropic公司来说,他们也有能力处理这笔数额不小的赔偿。据英国《金融时报》报道,anthropic公司的估值有望在近期突破2万亿美元。
有美国出版行业业内人士认为,这项“世纪和解”并不会带来什么革新性的变化:它并未为AI训练大模型建立新的判例,仅仅只是解决了Anthropic公司在盗版网站下载书籍、进行数据收集等过往行为的法律责任,而围绕AI训练的更大法律格局基本保持不变。不过现阶段,法官对“大语言模型用语料库进行训练的行为构成合理使用”的裁决仍然有效,并将继续为整个行业提供重要的法律参考。
更令人不安的是“巴拿马计划”中的毁书行为。一旦这些稀有或绝版的书籍在扫描后被销毁,就很难再有替代性的副本留存。书籍是一个文明最珍贵的知识载体,也凝聚着编辑、校对、美术、装帧、设计、印刷工人等人的集体智慧和心血。当这些书籍被切割、扫描并被销毁后,成为算法的养料时,我们失去的究竟是什么?
更令人感到心寒的是,Anthropic作为头部AI公司,却在具体运营时使用了双重标准。原本,Anthropic是由一群对AI安全有着深刻担忧的科技界人士所创立,他们提出了“宪法AI”的理念,旨在通过为AI模型制定一套明确可行的原则来约束AI的行为,确保它的“安全性”和“可控性”。可正是这家公司,为了利益和效率,野蛮毁掉绝版书籍。这也是很多AI公司的矛盾性:一方面,他们认可并追求人类创造出的艺术,比如认为2022年前未经AI染指过的文字才是“清洁而纯粹的”;另一方面,这些公司却在伤害现实中具体人的利益,比如侵害作者的版权、普通人的肖像权等,但他们并不在乎这些普通人的牺牲。
有些AI企业声称,大语言模型的存在将“释放创作力,让更多的人能创作出艺术”。可事实真的如此吗?
美国科幻小说家特德·姜在一篇名为《为什么AI不会创作艺术》的文章中批判了这种观点。“这些AI公司似乎在说艺术可以只有灵感,无须汗水,但这两者是无法轻易被分割的。艺术要在每一个尺度上都作出选择,在实施过程中作出的无数微观选择,与构思阶段的少数宏观选择,对最终成品同样重要”。他认为,人类的艺术是无数选择的结晶。当一个人写作时,一篇1万字的短篇小说就包含了1万次的抉择。而当你给AI一段指令时,你作出的选择寥寥无几,你仅仅只是写了数百字的提示词而已。
特德·姜坚信:“无论你是在创作小说、绘画还是电影,你都在与你的观众进行沟通。你所创造的并不一定要与人类历史上每一件艺术作品完全不同才能有价值;你是讲述人的事实,它源自你个人独特经历的事实,某个人在特定时刻看到你的作品,这就是让它变得新颖的原因。我们都是过往的产物,但正是在与他人的互动中生活,才为世界赋予了意义,这是任何算法都无法做到的。”
(本文有删减,更多内容请关注《方圆》8月上)
本文杂志原标题:《AI时代的“焚书”真相》
北京正义网络传媒有限公司 版权所有
未经授权 严禁转载
京ICP备13018232号-3 | 互联网新闻信息服务许可证10120230016 | 增值电信业务经营许可证京B2-20203552许可证 | 信息网络传播视听节目许可证0110425 | 广播电视节目制作经营许可证(京)字第10541号许可证 | 网络出版服务许可证(京)字第181号 | 出版物经营许可证京零字第220018号许可证 | 京公网安备11010702000076号 | 网站违法和不良信息举报电话:010-8642 3089