如意小报
版块首页原文 ↗
南京大学 · 新闻详情

花几千万美元买下全世界的纸书,“AI焚书”开始了?

综合 · 搜狐 · 搜狐教育 · 2026-09-01 · 重磅值 16.15
真正值得关注的不是这条新闻本身,而是它可能把「综合」的竞争焦点推向更大范围的连锁反应。
发生了什么:现有调查不能证明 AI 公司在有计划地扫荡“孤本”(Anthropic 声明不买珍本古籍,书商也表示大单基本只要有 ISBN 码的书),但问题在于——很多学术专著、专业手册、地方志和小语种译本,它们本来就少…
为什么重要:它提示了一个值得继续跟踪的变化方向。
观察窗口:接下来观察它是否会引发更多同类动作,以及影响范围能否扩大。
正文来源:原文正文机器翻译
原文链接:https://www.sohu.com/a/1070677364_220034

今年 7 月,一本普普通通的二手书,突然享受到了很少见的待遇:有人往它的封皮里塞了一枚 AirTag。

它和近千本八竿子打不着的旧书一起被打包、装箱,从加州一路来到拉斯维加斯,最后停进亚马逊的一座仓库。仓库里有个小组叫 VGT3,标志是一只捧着书的霸王龙。员工说,他们每天 切掉书脊、扫描书页,再处理掉无法复原的散页。

最近几个月,英国、爱尔兰和澳大利亚的二手书商,陆续遇到了一位让人摸不透的新客人。

它买书不讲价,不心疼跨国运费,也没有固定偏好。 一次订单里,可能同时出现约翰·勒卡雷小说的爱沙尼亚语译本、1983 年 10 月号的《Warship》杂志和安妮·勃朗特《阿格尼丝·格雷》的某个指定版本。另一个包裹里,1970 年代的土力学手册,和新西兰自行车冠军史、澳大利亚早期诗歌选、墨尔本郊区霍桑的地方史挤在一起。

有英国卖家称,今年以来,类似买家已经订走约 6000 本书。几个看似毫无关系的账户,最后却把书送往希思罗机场附近的同一片货运仓库,像是有人拿着一份看不见的书目,在全世界打捞那些无人问津的文字。

最初,书商只能猜测。直到美国科技媒体 404 Media 和一名卖家,把一枚 AirTag 藏进一批约 1000 本书的订单里。

定位最终停在亚马逊位于拉斯维加斯的 LAS8 园区。园区内的 VGT3 小组负责收书、扫 ISBN、切书、扫描。员工说: “我们做的全部工作就是扫描书。”

亚马逊随后承认,公司确实会通过商业渠道购买图书,用于“开发和改进客户使用的产品与服务”。可什么样的业务,需要大批量收购旧书、扫完再销毁呢?

网友们的猜测并不是空穴来风,这事可以从美国人工智能公司 Anthropic 此前曝光的 Project Panama(巴拿马计划)说起。

2024 年初,Anthropic 聘请曾参与 Google Books 项目的 Tom Turvey 为公司找书。内部文件写道: “Project Panama 是我们破坏性扫描全世界所有书籍的行动。” 使用代号的理由是“公司不希望外界知道”。

紧接着,Anthropic 砸下几千万美元,在市场上疯狂采购数百万本纸质书。供应商的流水线半年就能吃掉 50 万到 200 万本: 液压切纸机咔嚓一刀切掉书脊,散页塞进高速扫描仪生成 PDF 和 OCR 文本,至于残余的纸片?直接由回收公司当垃圾拉走。

这些被“嚼碎”的书,一部分直接喂进大模型的训练集,另一部分数字副本则留存进 Anthropic 的永久研究资料库,留着以后慢慢消化。

有意思的是,美国法院居然给这套流程开了绿灯。 法官认为,Anthropic 是合法买下的实体书,扫描后又销毁了原件,这无非是把属于自己的一份纸质副本换成了数字副本,“用一个取代了另一个”。既然纸本书和扫描件没有同时在市场上二次流通,那就符合“合理使用”。

但 真正让人愤怒的,恰恰也是“销毁原件”这四个字。 Anthropic 的采购清单里有许多还没被数字化的冷门书。 它们未必值钱,却可能已经绝版;每切掉一本,二手市场上可供下一位读者买到的副本就少一本。

现有调查不能证明 AI 公司在有计划地扫荡“孤本”(Anthropic 声明不买珍本古籍,书商也表示大单基本只要有 ISBN 码的书),但问题在于—— 很多学术专著、专业手册、地方志和小语种译本,它们本来就少得可怜啊! 有出版业调查显示,绝大多数商业出版社和大学出版社的专著,前三年纸本销量甚至卖不到 400 册,很多甚至连 200 册都不到。

这些书进不了昂贵的珍本库,也没人会去统计全球到底还剩几本。一本绝版的地方史从二手书架上被抽走销毁,世上究竟还剩 300 本、30 本还是 3 本?根本无人知晓。

澳大利亚书商尼克·道斯坦言,清掉普通库存固然高兴;但如果卖掉的是这世上已知的最后一本,他宁可烂在手心里。另一位书商更直白:“如果它是独一无二的,那这事可太可怕了。”

其实,想数字化一本书,并不只有切书这一条路。图书馆和 Google Books 早就用上了 V 形托架等方法,可以在不破坏装订的情况下扫描书页。 破坏性扫描赢在速度快、成本低、流水线稳定。科技公司只是选了更快的那条路。

互联网明明装着比任何图书馆都多的文字,AI 公司为什么还要花几千万美元,雇人从纸堆里抢救数据?

ChatGPT 出现以后,新闻摘要、博客、商品介绍、论文、旅游攻略、网友评论,甚至悼念死者的讣告里,都开始混入机器生成内容。生产这些内容的人未必真的有什么想说,只是想批量占领搜索结果、赚广告费、骗点击,或者每天在社交平台完成几十次更新。

康奈尔大学研究者让 OpenAI、Anthropic、Google 和 AI2 的四种模型写了 2 万篇故事, 结果一半以上出现了灯塔,26.5% 使用了 Elias 这个名字,守塔人、钟表匠和图书管理员也一再登场。 模型来自不同公司,只要收到“给我讲个故事”这种宽泛指令,就很容易绕回同一批人物和场景。

一篇这样的内容可能只是无聊,成千上万篇一起发布,就会让搜索结果充满换汤不换药的车轱辘话,正着说完反着说,经常说着说着还说错了。

2025 年,《芝加哥太阳报》和《费城问询报》随报附赠了一份夏季生活增刊,极其郑重地向读者推荐了 15 本“暑期必读好书”。结果读者兴冲冲一查直接傻眼: 其中 10 本书根本不存在! AI 凭空给真实作家安排了虚构新作:伊莎贝尔·阿连德“出版”了《潮水之梦》,安迪·威尔“写出”了《最后的算法》,连故事简介和推荐语都编得有模有样。

后来的撰稿人这才承认,自己用 AI 辅助写作,却压根没去核实。 这些 AI 凭空捏造的幻觉,就这么夹杂在严肃新闻里投递给了读者,让人真假难辨。

如果下一代大模型继续不加区分地吞下这些垃圾,问题就会像滚雪球一样放大。2024 年《自然》杂志的一篇研究就把这叫作“模型坍塌”(Model Collapse):当模型一遍遍学习上一代 AI 生成的数据,它对真实世界的理解就会开始扭曲。

最先被抹杀掉的,往往是边缘化的信息—— 那些低频、少见、不符合统计平均规律的内容。

这就好比你把一张原稿连续复印十次,粗线条可能还在,但细小的阴影和纹理会最先糊成一片。对应到文字世界,最先被“复印糊掉”的,恰恰是小语种表达、地方独特经验、冷门专业知识,以及那些古怪却真实的人类叙述。

名著、畅销小说和热门教材早已被反复数字化。模型真正缺少的,是图书数据库没有收录、搜索引擎也找不到全文的部分。这也解释了为什么神秘买家的清单如此离奇: 一 本书越冷门,就越可能贡献出大模型还没啃过的全新词汇、事实和表达方式。

Anthropic 内部曾讨论,书籍可以教模型“怎样好好写作”,让它少模仿互联网里的“低质量说话方式”。毕竟,一本书凝聚着作者长年累月的思考、编辑的严苛审校,能维持几十万字的严密结构;而网页上的段落早就被拆得七零八落、抄来抄去,连原作者是谁都认不出来。

旧书当然也会写错,但至少在那个时代,“一本正经地胡说八道”还是一件门槛极高的体力活。 想凑够几百页,作者得真真切切坐在桌前抓破头皮,编辑得一页页帮忙抓虫。 因此,在数据商的心目中,2022 年是一条特殊的分界线,在这之前出版的书,基本可以百分百排除 ChatGPT 的污染——它们是带着明确生产日期和配料表、纯天然无污染的“有机数据”。

AI 公司花几千万美元购买的,正是这种可追溯性。网页可能经过多次转载和改写,一本出版物却带着作者、编辑、出版年份和版本记录。公司可以知道一段文字来自哪里,也更容易判断它值不值得放进训练集。

有点讽刺的是,AI 一天可以生产成千上万篇内容,把互联网填得满满当当;而真正昂贵的原料,依然是一个人花几年写完,又在旧书仓库里沉睡了几十年的那一本。

当人类的心血被 AI 搞成了可以随意开采的“矿产资源”,创作者们终于坐不住了,开始在互联网的田地周围筑起高墙。

早在 2023 年,就有超过 1.5 万名作家联署公开信,要求 AI 公司取得许可、注明来源,并为使用作品支付报酬。此后,作家、画师、媒体和出版社陆续把争议送上法庭。

到了 2026 年 7 月,美国法院最终批准了 Anthropic 支付 15 亿美元 与作者及出版商和解,赔偿覆盖了超过 48.2 万部作品,算下来一本大约赔 3000 美元。 但这笔赔偿只针对于他们从盗版网站搜刮的电子书;而他们合法买书、切书扫描的“巴拿马计划”,依然获得了法院的合理使用认定。

企鹅兰登在所有新书和再版书的版权页里明确加了一句话: 严禁将本书用于 AI 训练。 2026 年,国内华夏出版社的《新译黄庭经 阴符经》等书页上也赫然印着:“禁止将本书内容用于人工智能训练,违者必究。”一句声明或许拦不住切书机和爬虫,却可以提前说清权利人的态度,为后续投诉或诉讼留下一份明确的书面依据。

美国作家协会则推出“Human Authored”认证。 作者核验身份并承诺正文由人类完成后,可以在书封上使用“人类创作”标志。 到 2026 年 3 月,约 3000 名作者认证了 5000 本书。

文学出版走到这一步,多少带点黑色幽默。 过去是食品包装袋上写着“手工制造、零添加”,现在居然连一本书也要被迫高呼:这真是我亲手写的啊!

画师们开始在作品上铺满密集的水印,只敢上传低清缩略图;芝加哥大学团队还研发了防抓取工具 Glaze,能给图像加上肉眼看不出、但能搞糊 AI 的干扰纹路。他们甚至推出了更狠的“毒药”工具 Nightshade—— 如果 AI 强行抓取涂了 Nightshade 的图片,大模型的逻辑链就会发生错乱,把狗学成猫,把飞船学成挂毯。

文字写作者们则纷纷在网站根目录下设置 robots.txt 协议。这相当于贴在门口的一张告示:“爬虫与 AI 请勿入内”。不过,这份说明没有强制力。守规矩的爬虫会绕开,完全不理会它的机器人依然可以继续抓取。

机器翻译/自动整理可能存在误差,请以原文为准。

继续阅读

正在加载推荐…