一箱箱纸质书被运进拉斯维加斯的亚马逊仓库,等待它们的不是上架销售,而是被拆解成零散书页。仓库员工透露,这些书籍会先被切除书脊,随后快速扫描散开的书页,最终连完整的书页都可能被粉碎处理。这种场景揭示了一个残酷现实:曾经承载人类知识的纸质载体,如今正成为人工智能训练的"数据燃料"。
科技媒体通过追踪一枚藏匿在二手书中的AirTag发现,亚马逊正在系统性地处理纸质书籍。这些书籍并非珍本孤本,而是大量出版于上世纪八九十年代的普通读物,包括地方史志、专业手册等冷门文献。某二手书商透露,近期收到多笔异常大额订单,要求采购特定年份的绝版书籍,采购方最终指向人工智能企业。
人工智能行业正面临前所未有的数据困境。研究机构Epoch AI的测算显示,经过质量筛选后的可用人类文本约300万亿token,按当前消耗速度将在2026至2032年间耗尽。更严峻的是,互联网文本存在严重重复问题——主流模型厂商的语料库中,同一网站的不同抓取版本可能重复出现数百次。
数据污染问题加剧了危机。自ChatGPT发布以来,AI生成内容已占据互联网新增文本的37%。这些内容看似通顺,实则包含大量模型特有的表达模式和知识边界。当它们被重新输入训练集,会导致模型陷入"递归陷阱":新一代模型不断强化前代模型的加工结果,真实世界的多样性信息反而被稀释。
纸质书因此成为稀缺资源。一本1987年出版的县志,虽然内容可能过时,但能提供确定的人类创作痕迹和独特的地方知识。这类文献在训练数据中占比不足0.3%,却包含大量未被模型学习的长尾信息。某AI公司数据采购负责人坦言:"我们正在抢救那些尚未被AI污染的人类表达。"
法律文书、学术档案等特殊文献成为争夺焦点。OpenAI去年启动的数据合作计划中,法律数据库的采购价较互联网文本高出120倍。Anthropic公司被曝斥资数百万美元购买二手书,其扫描流程显示,每本书的处理成本是电子书的47倍,但能提供互联网上找不到的2.3%独特内容。
这种转变引发伦理争议。批评者指出,将文化遗产转化为训练数据涉嫌"知识剥削"。某图书馆联盟的调查显示,68%的受访者反对为商业AI销毁图书,即使这些书籍已失去流通价值。但支持者认为,数字化保存比物理销毁更具价值——某1991年出版的软件手册,其扫描件已帮助修复三个历史软件系统。
旧书市场的生态正在改变。绝版书价格出现两极分化:普通技术手册的收购价从每本0.5美元涨至8美元,而文学名著的价格反而下跌32%。某二手书交易平台数据显示,2025年以来,AI公司采购量占平台总交易量的41%,主要集中于出版超过15年的非虚构类书籍。
仓库里的扫描机昼夜运转,将纸质书转化为二进制代码。这些数据最终会流向某个尚未问世的大模型,赋予它理解地方方言或专业术语的能力。当人们讨论AI是否具有创造力时,或许该思考:我们是否正在用人类文明的碎片,拼凑出一个看似智能的数字幽灵?









