文 | 字母AI

液压切纸机的压板重重落下,刀片利落切入,一本厚书的书脊瞬间被削去。原本紧密相连的书页散开,变成整齐的一摞纸张。

若没人解释这一幕,视频观众或许会觉得画面“引起舒适”,十分解压。

可一旦知晓这是AI公司批量处理纸质书的日常手段,其中甚至包含冷门与绝版书籍,多数人恐怕再难感到轻松。

为获取训练数据,AI企业已从公开互联网、盗版电子书一路延伸至现实世界的纸质书堆。尤其是**2022**年以前出版的书籍,因未混入AI生成内容,也未受现代数据投毒工具干扰,被视为难得的“上品”。

那些网络搜不到、无电子版的冷门及绝版书,能补充互联网抓取不到的内容,更是“上上品”。

Anthropic曝光的“巴拿马计划”对此讳莫如深。

图书数据库公司ISBNdb则公开宣称,可为AI公司代找书籍,能从旧书店、图书馆及绝版书目录中,单次采购**1000**至**100**万本纸质书,并借保密协议隐藏买家身份及书目。

AI公司也清楚此举“不太好看”。

追溯AI公司盯上纸质书的源头,最早见于Anthropic卷入的一场诉讼。

**2024**年**8**月,三名作家将Anthropic告上法庭,指控其未经授权,利用作者作品训练Claude模型。

此类争议自OpenAI推出ChatGPT以来便未曾停歇,并不新鲜,类似官司已累积不少。

核心争议在于:AI公司将整个互联网抓取用于模型训练是否构成侵权?作者作品进入训练集,是否需要本人同意并支付版权费?

在这场诉讼初期,纸质书并非焦点。

为使Claude更懂知识、文笔更佳,Anthropic先扫荡了公开互联网。鉴于网页内容良莠不齐,经作者创作、编辑筛选及出版社校对的书籍遂成为目标。

最直接的办法自然是获取电子书。

法庭文件显示,Anthropic曾从Books3、LibGen和PiLiMi等资源库下载超**700**万本书。其中相当部分源自盗版网站。公司并未用完即删,而是将这些文件存入长期保留的“中央图书馆”,供未来模型训练与研究使用。

随后,代号“巴拿马计划”的内部工程启动。简言之,即Anthropic大规模购入纸质书,扫描后喂给AI。

当时,法庭关注的重点是Anthropic获取及使用这些内容的方式是否合法。

**2025**年**6**月,法官威廉·阿尔萨普给出了对Anthropic颇为有利的裁决。

他认为,大模型读取书籍并非为了向用户复述或出售该书,而是从中学习语言、知识与表达方式,进而生成新内容。这种用途具强“转化性”,类似人读书获知知识后再进行创作,因此属合理使用范畴。

至于购入的纸质书,Anthropic已为每本付费。公司扫描一本即销毁对应实体书,仅在内部留存数字替代品,未制造额外副本流入市场。法官据此认定此举未侵犯版权。

但那份从盗版资源库下载的**700**多万本电子书,理由便站不住脚。

法官指出,训练模型可能属合理使用,但不能反推盗版获取亦合法。怎么用书是一回事,书怎么到你手里是另一回事。

在美国法律体系中,判例影响深远。这位法官的裁决为AI公司开辟了一条路径:AI可学习人类作品,前提是先以合法方式获取。

因此,在去年的Anthropic案中,尽管其购买纸质书并扫描的做法已公开,但法庭及公众的关注点仍集中在老生常谈的“用人类知识训练AI的法律边界”上。

直到今年,两篇报道接连披露,人们才惊觉问题之严峻。

绝版纸质书面临永久消失风险?

今年**1**月,《华盛顿邮报》从刚刚解封的**4000**多页法庭材料中,挖掘出“巴拿马计划”更多细节。

Anthropic在约一年内花费数千万美元,买下数百万本纸质书。供应商切除书脊,将散页送入高速扫描仪,剩余纸张则交由回收公司。仅一份项目方案,就计划在半年内处理**50**万至**200**万本书。

规模已足够惊人,而Anthropic内部文件中的两句话更具杀伤力:

“巴拿马计划,是我们对全球所有书籍进行破坏性扫描的行动。”

“我们不希望外界知晓我们正在做此事。”

这两句话并列,整件事观感极差。

Anthropic一贯强调AI安全、道德与责任,背地里却启动了一项摧毁数百万本书的秘密工程。

切书尚可解释为追求效率,而“不希望外界知道”则让人不禁怀疑:Anthropic自身也清楚,此事一旦曝光,难以自圆其说。

Anthropic究竟偷偷毁了多少书?

《华盛顿邮报》未获完整书目,外界也不清楚这些书中多少是常见畅销书,多少已停止再版。人们对工业化切书的规模感到震惊,却难断言其造成的具体损失。

半年后,404 Media的一篇报道将担忧聚焦于绝版书。

该报道主角为ISBNdb,一家自称拥有全球最大图书数据库的公司。其在官网公开向AI客户兜售纸质书采购服务,宣称单次可采购**1000**至**100**万本书,货源覆盖旧书店、图书馆及绝版书目录。

公司甚至将保密作为卖点:每个项目签署严格保密协议,客户身份、采购策略及目标书目一概不披露。

更具讽刺意味的是,ISBNdb自知这门生意见不得光。宣传中直接提醒客户:“AI公司毁掉**200**万本书”,绝非能赢得同情的新闻标题。

此外值得注意的是,AI公司近期格外青睐**2022**年以前出版的纸质书。

原因直白:生成式AI爆发后,网络充斥着大量AI生成内容,还有人故意使用数据投毒工具干扰模型训练。相比之下,**2022**年前出版的纸质书几乎确认为人类写作,经过编辑、校对及出版流程,且未受现代投毒工具污染。

AI公司亲手制造了越来越多网络垃圾,最后又回头寻找未被AI污染的旧书。

这股需求已传导至二手书市场。一名专营稀有及低流通量图书的书商告诉404 Media,自今年**4**月起,他每周处理的订单从约**20**本猛增至数百本。被买走的书主题杂乱、语种各异,彼此鲜有关联,唯一共同点是均有ISBN编号。

该书商虽无法确认买家即为AI公司,但其库存中外文书、冷门书及绝版书居多。

他一方面借此清除了多年滞销库存,另一方面却深感不适:“我不喜欢这些书最终的用途,也不喜欢那些罕见书被打成纸浆。”正如前文所述,AI公司扫描纸质书的流程粗暴,令生意好转的二手书商也忍不住心疼。

从互联网到盗版电子书,再到可批量购买的纸质书,AI公司拓展训练资源的触角不断延伸。如今,冷门书籍乃至绝版书也难逃一劫。

绝版不等于孤本。目前尚无证据表明某本书在世界上的最后一册已被AI公司销毁。

外界看不到采购清单,不知哪些公司在买书,更不清楚书送进切割机前,是否有人核查过其存世数量。

但风险显而易见。

极其有限的退让

**2025**年的判例(至少在美国范围内)已给予Anthropic一定的法律保护。

法官认为,Anthropic合法购得一本纸质书,将其扫描为数字文件,再销毁纸质原件,最终仅保留一份副本。数字文件未对外出售,未增加市场流通量,相当于一种格式替换另一种,故可构成合理使用。

依此逻辑,切书甚至成了证明合法的一环。原书继续留在市场,Anthropic手中多出数字版,若不清理实体书,可能涉及未经授权的复制;销毁纸质书仅留数字文件,法律风险反而更低。

康奈尔科技学院数字与信息法教授James Grimmelmann认为,Anthropic放弃盗版书库,转而购买、扫描纸质书,是一种“聪明的选择”,体现了更克制、合规的做法。

对于印量达几十万册的畅销书而言,销毁纸质书的问题尚不尖锐,少一册不影响他人阅读购买。

但冷门书、绝版书及带有特殊历史痕迹的版本,显然不能如此计算。

澳大利亚和新西兰古旧书商协会主席Dawn Albinger指出,古旧书的价值不止于印刷正文。书页上可能有亲历者批注,签名、题赠及历任收藏者信息可证明其流传经历,重新装订的封皮里甚至可能藏着更早的手稿。

这些信息依附于具体的实物。即使文字已完成扫描,一旦原有纸张、装帧及各部分关系被破坏,后人便无法重新检视。

换言之,AI公司得到了一份适合训练模型的数字文件,却可能毁掉了一件无法通过数字文件完整还原的实物。

争议扩大后,科技行业迅速出现退让。

马斯克在X平台表示,已要求SpaceX AI团队将稀有书籍保存在图书馆,采用更繁琐的无损方式扫描,不得简单切除书脊。他未公布SpaceX AI购书数量,也未界定何为“稀有”,此次回应更像态度表态。

ISBNdb的退让更快。

404 Media报道发布9天后,ISBNdb删除了面向AI公司的纸质书采购页面,撤下关于保密采购及破坏性扫描的宣传。公司随后改口称,相关页面仅为一次市场需求测试,服务从未真正上线,ISBNdb也从未为AI训练购买、扫描或出售过任何一本书。

此前还在宣传单次采购**100**万本书,遭遇舆论反弹后,整门生意突然变成了“一次测试”。

这番解释能否令人信服另当别论,但它至少说明,匿名协助AI公司大批量采购纸质书,已成为企业不愿承担的声誉风险。

不过,马斯克的一句承诺及ISBNdb删除几个网页,替代不了真正的规则。

谁负责在扫描前判断一本书是否稀有?依据是出版年份、版本及存世量,还是书内的签名、批注及装帧?AI公司是否应公开大规模采购书目?若某书已绝版,是否只能采用无损扫描,并在扫描后交图书馆保存?

目前,这些问题均无答案。

讽刺的是,ISBNdb此前反复强调,**2022**年以前的纸质书之所以珍贵,正因它们保存了未受AI污染、经作者写作及编辑筛选的人类知识。AI公司越承认这些内容不可替代,就越难解释为何承载它们的实体可被视为一次性耗材。