你在二手书平台卖出一本绝版书,以为它会进入某位藏书家的书架。结果,它被送进一座批量扫描设施,书脊可能被切掉,书页拆开成像,原书再也无法复原。404 Media 的一项追踪调查称,这正发生在 Amazon 的设施里。它值得关注,不只因为书被毁了,更因为 AI 公司对高质量文本的争夺,已经从公开网页伸向尚未数字化的实体藏书。
不过,关键归因仍需谨慎:Amazon 只确认通过商业渠道购买图书,用于改进客户使用的产品和服务;“这些书被破坏式扫描并用于 AI 训练”主要是 404 Media 根据追踪结果、设施标识和员工论坛讨论得出的调查结论,并非 Amazon 明确承认。
一本书去了哪里?
据 404 Media 调查,7 月,一名书商在 Biblio 平台收到一笔约 1,000 本书的订单。调查方提供了一枚 Apple AirTag,请书商把它放进其中一本书里,以便追踪这批货物的去向。
这本书最终抵达拉斯维加斯 Amazon LAS8 设施的 VGT3 区域。入口处有一个颇醒目的标志:一只恐龙爪里拿着一本书。调查还引用 Amazon 员工在线论坛的讨论,称 VGT3 会对大量图书进行破坏式扫描。
所谓破坏式扫描,通常是切除书脊,把书页拆开,再用设备高速成像。这样做适合批量数字化,却会永久改变甚至毁掉原书。调查所涉采购中包括绝版、网上无法取得的稀有文本,但现有材料没有披露被追踪书籍的书名、年代、市场存量或鉴定依据。因此,不能把这一订单中的约 1,000 本书全部称为“珍本”,也不能把这一次订单的数量外推成 Amazon 的整体采购规模。
AI 为什么又回到纸上?
大语言模型(LLM)会阅读海量文本,学习词语之间的统计关系,再据此理解和生成语言。对模型来说,纸质书本身不能直接使用。书页必须先被扫描,再转换成机器可读的文字,才可能进入训练或其他产品处理流程。
公开网页容易获取,却不是无限的。随着大型模型继续扩张,高质量文本的需求正把数据获取范围推向授权数据库,以及仍躺在书架上的实体书。绝版、未数字化、网上找不到的文本因此具有特殊吸引力:它们能提供网络语料中没有的内容。
还有一层压力来自“model collapse”,即模型坍塌。简单说,如果大语言模型反复学习大量 AI 生成文本,而不是人类产生的原始材料,输出质量可能逐渐下降。未经数字化的旧书由此成为一种稀缺语料来源。不过,材料中“用于训练 AI”的说法仍是调查判断;Amazon 的官方表述只到“改进产品和服务”为止。
买下书,不等于买下所有权利
这件事把争议从熟悉的网络抓取推进了一步。网页训练数据的争论,往往围绕平台条款、授权和复制展开;实体书则多了一层不可逆的物质损失。一本书被合法买下后,持有者通常可以处置这件实物,但买下实体书与取得复制、数字化或训练所需的版权许可,并不是同一件事。
这正是“数据来源”(data provenance)值得追问的原因。它指的是一套可核查的记录:训练材料从哪里来,依据什么授权取得,又经过了怎样的处理。二手市场能说明一本书如何完成交易,却不能自动回答扫描后的文字可以被怎样使用。
更棘手的是,稀有文本的价值不只在内容,也在作为实体保存下来的版本。批量扫描若以切除书脊为代价,语料库增加了一份数字文本,现实世界却可能永久少了一件藏书。稀缺语料之争因而不再只是版权人与模型公司的利益分配,也开始触及实体文化材料该如何保存。
局限与未知
- Amazon 未明确确认这些书用于 AI 训练,也未确认 VGT3 切除书脊;相关判断来自 404 Media 的追踪、设施线索和员工论坛讨论。
- 现有材料没有披露被追踪图书的具体身份,也没有给出“珍本”或“稀有文本”的统一标准。
- Amazon 只表示其通过商业渠道购书以改进产品和服务,尚未说明扫描数据进入了哪些产品、是否用于模型训练,以及相应的授权依据。