亚马逊正批量采购纸质书籍,将书籍内容扫描后用于人工智能训练,扫描过程中会直接销毁部分原书。

这项调查通过在一批珍贵书籍货件中放置苹果 AirTag,追踪书籍在美国境内的流向。货件最终抵达亚马逊位于拉斯维加斯的一座仓库,调查人员发现,仓库内有一支名为 VGT3 的团队。员工称,为提高扫描效率,团队会先切除书籍的书脊,使书页能够更适合快速扫描,因此原书会在处理过程中被毁。
报道称,亚马逊随后使用扫描得到的数据训练 Nova 模型。亚马逊发言人表示,公司通过正常商业渠道采购书籍,用于改进产品。IT之家援引书商观点称,一些人工智能公司可能正尝试按照 ISBN 编号系统性扫描出版过的书籍,因为不少纸质书内容此前从未出现在互联网上。
类似做法此前也出现在 Anthropic 的“巴拿马计划”中。美国法院在相关案件中认定,对合法购买的纸质书进行格式转换,将其扫描为数字文件,属于合理使用;但法院同时指出,获取并长期保存通过盗版渠道取得的数字书籍,不能仅因其可能用于人工智能训练就自动受到合理使用保护。
亚马逊此次被曝的做法将人工智能训练数据的获取效率、版权边界与实体书保存问题集中到了一起。对企业而言,切除书脊可以提升批量扫描效率;但对珍贵、绝版或难以替代的书籍来说,扫描后销毁原件也意味着实体版本可能永久消失。现有报道主要披露了调查结果与亚马逊回应,尚未显示亚马逊已经公开说明相关书籍的具体规模、采购清单或数据使用范围。