一批纸质书被买下,送进仓库。
工作人员切掉书脊,把完整的书拆成一页页散纸,再送去扫描。文字被留下,原来的书却无法恢复。
如果我告诉你,这是 Anthropic 为了 AI 干的,你可能不会太意外。
但如果我说这次干这事的公司,是全球最大的「线上书店」亚马逊呢?
404 Media 在一批旧书里放入追踪器,发现它们一路被送到拉斯维加斯的一座 亚马逊设施。员工向该媒体描述,公司收到纸质书后,会切掉书脊,再把散开的纸页送去扫描。
亚马逊回应称,公司通过商业渠道购买这些书,用于开发和改进客户使用的产品与服务。
有意思的是,亚马逊当年就是靠卖书起家的。
现在,一些书到了它手里,先见到的却是扫描仪。
AI 公司已经能从互联网得到海量文本,为什么还要回来收购纸书?得到书以后,又为什么要先把它拆掉?
01
最快的扫描,从切掉书脊开始
一本装订完好的书,并不适合直接进入高速扫描流水线。
如果想保留原书,通常要把书放在书托上,用顶置相机逐页拍摄。扫描时还要照顾到装订角度、纸张状态,以及文字是否被书脊遮挡。
美国国会图书馆的数字化保存指南要求,如果书本比较脆弱或珍贵,扫描时应使用书托、顶置相机等设备,尽量避免损伤书脊和纸张。
可切掉书脊后,一本书就变成了几百张可以连续进纸的散页。扫描速度更快,也更容易在同一条流水线上处理不同尺寸的书。
拆书这事发生在模型训练之前。它解决的是怎样用更少的人工,把更多纸页变成机器可以处理的文件。
公众第一次看清这种流程,来自 Anthropic 的版权诉讼。
法院裁定文件记载,Anthropic 购买了大量纸质书,拆除装订、裁切纸页,再将扫描结果放进内部数字资料库。纸本随后被丢弃,一份实体副本以后就对应一份数字副本。
亚马逊从卖书起家,三十多年后,书又以另一种方式回到了它新开的「旧书屠宰场」。
书:「我与你们不共戴天!!!」
02
旧书在AI的视角下越来越像数据
模型公司当然不缺网页。
过去几年,生成式 AI 制造的文章、商品描述、问答和网站迅速增加。网页不会因此立即失去训练价值,合成数据也并非天然有害。
但如果训练材料不加甄别地混入上一代模型生成的内容,模型可能逐渐丢失原始数据中那些低频、少见的信息。
一项发表于《Nature》的研究,将这种递归训练造成的退化称为「模型崩溃」。
出版时间较早的纸质书,则有一个很简单的优势:它们出现在生成式 AI 普及以前。
一本书通常还经历过作者写作、编辑加工和出版筛选,能够提供比零散网页更连贯的长文本。
那些没有电子版的专业书、小众出版物和绝版书尤其特殊。很多内容单靠网页抓取根本拿不到。
到了这次追踪调查,原本藏在匿名订单和中间商之后的采购链,第一次指向了一座 亚马逊设施。
网页已经不够干净了,AI 又回来翻人类的旧书架。
03
AI写的书越来越多,人写的旧书反而值钱了
这件事放在 亚马逊身上,还有一层很特别的背景。
亚马逊 最早就是靠卖书起家的。到了生成式 AI 的时代,它的书店里开始出现越来越多 AI 生成的内容。
2023 年,亚马逊修改了 Kindle Direct Publishing 的规则,要求作者在出版时申报书中的文字、图片或翻译是否由 AI 生成。
随后,它还把单个作者每天能够发布的新书数量限制在三本——看到这里很难不愣一下:三本?一天?这到底是「写书」,还是「印刷厂限流版体验卡」?
估计各位读者读到这里的第一反应大概也是:等等,这个数字是不是不太对?
一些 AI 研究者自己也遇到了这件事。
AI 学者 Melanie Mitchell 出版过《Artificial Intelligence: A Guide for Thinking Humans》。后来,亚马逊上出现了一本和它同名的 45 页电子书。 WIRED(《连线》杂志)找检测公司分析后认为,这本书有很高概率由 AI 生成,亚马逊随后将它下架。
李飞飞的回忆录《The Worlds I See》出版以后,亚马逊上也很快出现了十多本各种「总结」和「分析」。WIRED 检查其中一些内容后,也认为它们很可能使用了生成式 AI.
记者问李飞飞怎么看,大家猜一下她怎么回?
——她只回了一个表情:








