全球最大线上书店,正悄悄为 AI「焚书」

一批纸质书被买下,送进仓库。 工作人员切掉书脊,把完整的书拆成一页页散纸,再送去扫描。文字被留下,原来的书却无法恢复。 如果我告诉你,这是 Anthropic 为了 AI 干的,你可能不会太意外。 但如果我说这次干这事的公司,是全球最大的「线上书店」亚马逊呢? 404 Media 在一批旧书里放入追踪器,发现它们一路被送到拉斯维加斯的一座 亚马逊设施。员工向该媒体描述,公司收到纸质书后,会切掉书脊,再把散开的纸页送去扫描。 亚马逊回应称,公司通过商业渠道购买这些书,用于开发和改进客户使用的产品与服务。 有意思的是,亚马逊当年就是靠卖书起家的。 现在,一些书到了它手里,先见到的却是扫描仪。 AI
一批纸质书被买下,送进仓库。
工作人员切掉书脊,把完整的书拆成一页页散纸,再送去扫描。文字被留下,原来的书却无法恢复。
如果我告诉你,这是 Anthropic 为了 AI 干的,你可能不会太意外。
但如果我说这次干这事的公司,是全球最大的「线上书店」亚马逊呢?

404 Media 在一批旧书里放入追踪器,发现它们一路被送到拉斯维加斯的一座 亚马逊设施。员工向该媒体描述,公司收到纸质书后,会切掉书脊,再把散开的纸页送去扫描。
亚马逊回应称,公司通过商业渠道购买这些书,用于开发和改进客户使用的产品与服务。

有意思的是,亚马逊当年就是靠卖书起家的。
现在,一些书到了它手里,先见到的却是扫描仪。
AI 公司已经能从互联网得到海量文本,为什么还要回来收购纸书?得到书以后,又为什么要先把它拆掉?
最快的扫描,从切掉书脊开始
一本装订完好的书,并不适合直接进入高速扫描流水线。
如果想保留原书,通常要把书放在书托上,用顶置相机逐页拍摄。扫描时还要照顾到装订角度、纸张状态,以及文字是否被书脊遮挡。
美国国会图书馆的数字化保存指南要求,如果书本比较脆弱或珍贵,扫描时应使用书托、顶置相机等设备,尽量避免损伤书脊和纸张。
可切掉书脊后,一本书就变成了几百张可以连续进纸的散页。扫描速度更快,也更容易在同一条流水线上处理不同尺寸的书。
拆书这事发生在模型训练之前。它解决的是怎样用更少的人工,把更多纸页变成机器可以处理的文件。

公众第一次看清这种流程,来自 Anthropic 的版权诉讼。
法院裁定文件记载,Anthropic 购买了大量纸质书,拆除装订、裁切纸页,再将扫描结果放进内部数字资料库。纸本随后被丢弃,一份实体副本以后就对应一份数字副本。
亚马逊从卖书起家,三十多年后,书又以另一种方式回到了它新开的「旧书屠宰场」。
书:「我与你们不共戴天!!!」
旧书在AI的视角下越来越像数据
模型公司当然不缺网页。
它们缺的是来源清楚、质量稳定,而且能确认主要由人类写成的文本。
过去几年,生成式 AI 制造的文章、商品描述、问答和网站迅速增加。网页不会因此立即失去训练价值,合成数据也并非天然有害。
但如果训练材料不加甄别地混入上一代模型生成的内容,模型可能逐渐丢失原始数据中那些低频、少见的信息。
一项发表于《Nature》的研究,将这种递归训练造成的退化称为「模型崩溃」。

出版时间较早的纸质书,则有一个很简单的优势:它们出现在生成式 AI 普及以前。
一本书通常还经历过作者写作、编辑加工和出版筛选,能够提供比零散网页更连贯的长文本。
那些没有电子版的专业书、小众出版物和绝版书尤其特殊。很多内容单靠网页抓取根本拿不到。
今年 7 月,404 Media 曾报道,已经有服务商开始把旧书包装成适合 AI 训练的人类文本来源。
到了这次追踪调查,原本藏在匿名订单和中间商之后的采购链,第一次指向了一座 亚马逊设施。
网页已经不够干净了,AI 又回来翻人类的旧书架。
AI写的书越来越多,人写的旧书反而值钱了
这件事放在 亚马逊身上,还有一层很特别的背景。
亚马逊 最早就是靠卖书起家的。到了生成式 AI 的时代,它的书店里开始出现越来越多 AI 生成的内容。
2023 年,亚马逊修改了 Kindle Direct Publishing 的规则,要求作者在出版时申报书中的文字、图片或翻译是否由 AI 生成。
随后,它还把单个作者每天能够发布的新书数量限制在三本——看到这里很难不愣一下:三本?一天?这到底是「写书」,还是「印刷厂限流版体验卡」?
估计各位读者读到这里的第一反应大概也是:等等,这个数字是不是不太对?

一些 AI 研究者自己也遇到了这件事。
AI 学者 Melanie Mitchell 出版过《Artificial Intelligence: A Guide for Thinking Humans》。后来,亚马逊上出现了一本和它同名的 45 页电子书。 WIRED(《连线》杂志)找检测公司分析后认为,这本书有很高概率由 AI 生成,亚马逊随后将它下架。

此外,李飞飞的回忆录《The Worlds I See》出版以后,亚马逊上也很快出现了十多本各种「总结」和「分析」。WIRED 检查其中一些内容后,也认为它们很可能使用了生成式 AI.
记者问李飞飞怎么看,大家猜一下她怎么回?
——她只回了一个表情:🤯。

一边是越来越容易被生产出来的新书,另一边,AI 公司又开始寻找那些几十年前出版、没有电子版、还没有进入互联网的纸质旧书。

机器一边像「永不停歇的印刷机」一样吐出层出不穷的新书,另一边却像在黑暗图书馆里觅食的「图书考古学家」,执着且贪婪地,寻找那些人类一页一页写下、尚未被数字化的旧书。
以后和你抢旧书的,可能不只是另一个读者
这种采购目前还谈不上改变整个旧书市场。
但有一些书商现在已经感受到了变化。
英国和爱尔兰多家旧书商最近告诉《卫报》,他们收到过规模异常的订单。有人一次卖出数千本书,也有人从今年开始陆续接到数千本类似采购。

这些订单和普通藏家的买法不太一样。
买家并不集中购买某位作者、某个题材或者某个年代的书。有些订单横跨完全没有关系的类别。
他们也很少议价。
一位书商提到,这些买家愿意直接支付网站上的价格。还有书商认为,大规模采购已经开始影响正常的二手书交易。
被买走的也不全是昂贵的珍本。
此前《The Atlantic》梳理这轮旧书采购时发现,其中有不少只是几十年前出版的冷门书籍。它们可能已经绝版,但并不一定稀有到只有一两本存世。

这类书过去可能会在旧书网站上挂很久。
等待它的通常是某个刚好需要这本书的读者、研究者或者收藏者。
现在它们又多了一类买家。
2014 年,科幻作家厄休拉·勒古恩在美国国家图书奖的领奖台上说过一句话:「书不只是商品。」当时她批评的是出版业越来越被商业逻辑支配,其中还特别提到了亚马逊。

现在它们又多了一类买家。
读者买一本书,是想把它留下。AI 公司买一本书,可能恰恰是为了把它拆掉。
这类买家并不一定在意书的品相,也不准备把它重新卖出去。他们需要的是里面还没有被数字化的文字。
现在还没有证据表明 AI 公司的采购已经普遍推高了旧书价格。但对于供应量本来就很少的版本,只要实体副本不断退出流通,未来寻找它的人就会面对更少的选择。
有些书被数字化以后,反而更难读到了
过去我们很容易把「数字化」理解成是一种更方便阅读的手段。
图书馆扫描一本旧书,通常是为了保存它。条件允许的话,数字版本还会让更多人看到原本只能在馆内阅读的资料。
AI 公司做的数字化可不一定如此。

这些冷门的旧书过去没有被数字化,往往就是因为读者太少。
现在,没有被数字化反而成了它们被购买的理由。
分享一位科学科普博主 @李苦舟 对此的评价:
「搞笑的是,在AI公司购买这些所谓具有关乎人类命运的、不可替代的、无比宝贵的旧书之前,它们是无人问津的。」
以前,一本冷门旧书可能在书架上放很多年,等一个刚好需要它的人。
现在,AI 公司开始批量寻找这类书,把它们拆开,再扫描成数字文件。
可这些数字文件并不会像图书馆的数字藏书一样,兜兜转转又回到普通读者手里,而是留在公司内部的数据库。
于是,一本过去只是很难找到的书,被数字化以后,可能依然很难找到。
机器终于读到了它,下一位读者却未必还能读到。
文章来自于"APPSO",作者 "APPSO"。
相关主题
读完之后
加入 AINRK 交流群
了解加入交流群的方式,与更多 AI 从业者交流。




