ITBear旗下自媒体矩阵:

全球最大线上书店,正悄悄为AI“焚书”

   时间:2026-08-19 15:47:47 来源:爱范儿编辑:快讯 IP:北京 发表评论无障碍通道
 

一批纸质书被买下,送进仓库。

工作人员切掉书脊,把完整的书拆成一页页散纸,再送去扫描。文字被留下,原来的书却无法恢复。

如果我告诉你,这是 Anthropic 为了 AI 干的,你可能不会太意外。

但如果我说这次干这事的公司,是全球最大的「线上书店」亚马逊呢?

404 Media 在一批旧书里放入追踪器,发现它们一路被送到拉斯维加斯的一座 亚马逊设施。员工向该媒体描述,公司收到纸质书后,会切掉书脊,再把散开的纸页送去扫描。

亚马逊回应称,公司通过商业渠道购买这些书,用于开发和改进客户使用的产品与服务。

有意思的是,亚马逊当年就是靠卖书起家的。

现在,一些书到了它手里,先见到的却是扫描仪。

AI 公司已经能从互联网得到海量文本,为什么还要回来收购纸书?得到书以后,又为什么要先把它拆掉?

01

最快的扫描,从切掉书脊开始

一本装订完好的书,并不适合直接进入高速扫描流水线。

如果想保留原书,通常要把书放在书托上,用顶置相机逐页拍摄。扫描时还要照顾到装订角度、纸张状态,以及文字是否被书脊遮挡。

美国国会图书馆的数字化保存指南要求,如果书本比较脆弱或珍贵,扫描时应使用书托、顶置相机等设备,尽量避免损伤书脊和纸张。

可切掉书脊后,一本书就变成了几百张可以连续进纸的散页。扫描速度更快,也更容易在同一条流水线上处理不同尺寸的书。

拆书这事发生在模型训练之前。它解决的是怎样用更少的人工,把更多纸页变成机器可以处理的文件。

公众第一次看清这种流程,来自 Anthropic 的版权诉讼。

法院裁定文件记载,Anthropic 购买了大量纸质书,拆除装订、裁切纸页,再将扫描结果放进内部数字资料库。纸本随后被丢弃,一份实体副本以后就对应一份数字副本。

亚马逊从卖书起家,三十多年后,书又以另一种方式回到了它新开的「旧书屠宰场」。

书:「我与你们不共戴天!!!」

02

旧书在AI的视角下越来越像数据

模型公司当然不缺网页。

过去几年,生成式 AI 制造的文章、商品描述、问答和网站迅速增加。网页不会因此立即失去训练价值,合成数据也并非天然有害。

但如果训练材料不加甄别地混入上一代模型生成的内容,模型可能逐渐丢失原始数据中那些低频、少见的信息。

一项发表于《Nature》的研究,将这种递归训练造成的退化称为「模型崩溃」。

出版时间较早的纸质书,则有一个很简单的优势:它们出现在生成式 AI 普及以前。

一本书通常还经历过作者写作、编辑加工和出版筛选,能够提供比零散网页更连贯的长文本。

那些没有电子版的专业书、小众出版物和绝版书尤其特殊。很多内容单靠网页抓取根本拿不到。

到了这次追踪调查,原本藏在匿名订单和中间商之后的采购链,第一次指向了一座 亚马逊设施。

网页已经不够干净了,AI 又回来翻人类的旧书架。

03

AI写的书越来越多,人写的旧书反而值钱了

这件事放在 亚马逊身上,还有一层很特别的背景。

亚马逊 最早就是靠卖书起家的。到了生成式 AI 的时代,它的书店里开始出现越来越多 AI 生成的内容。

2023 年,亚马逊修改了 Kindle Direct Publishing 的规则,要求作者在出版时申报书中的文字、图片或翻译是否由 AI 生成。

随后,它还把单个作者每天能够发布的新书数量限制在三本——看到这里很难不愣一下:三本?一天?这到底是「写书」,还是「印刷厂限流版体验卡」?

估计各位读者读到这里的第一反应大概也是:等等,这个数字是不是不太对?

一些 AI 研究者自己也遇到了这件事。

AI 学者 Melanie Mitchell 出版过《Artificial Intelligence: A Guide for Thinking Humans》。后来,亚马逊上出现了一本和它同名的 45 页电子书。 WIRED(《连线》杂志)找检测公司分析后认为,这本书有很高概率由 AI 生成,亚马逊随后将它下架。

李飞飞的回忆录《The Worlds I See》出版以后,亚马逊上也很快出现了十多本各种「总结」和「分析」。WIRED 检查其中一些内容后,也认为它们很可能使用了生成式 AI.

记者问李飞飞怎么看,大家猜一下她怎么回?

——她只回了一个表情:

 
 
更多>同类资讯
全站最新
热门内容
网站首页  |  关于我们  |  联系方式  |  版权声明  |  争议稿件处理  |  English Version