**人工智能公司为了训练其模型而销毁印刷书籍的消息引发了图书馆员、书商和文化爱好者的愤怒。科技巨头们在购买大量冷门书籍后将其扫描并粉碎,而互联网档案馆则证明了另一种方式:小心翼翼地逐页扫描,而不破坏原件。
为了训练人工智能模型,销毁书籍的做法在硅谷变得越来越普遍。科技公司为了开发更先进的模型,正在采用一种更便宜、更快速的方法:购买印刷书籍,剪掉书页,扫描后再粉碎这些书籍。
这一动态是在2025年夏季的一起诉讼中曝光的,诉讼揭示Anthropic销毁了数百万本印刷书籍以训练其模型。该公司使用代号“巴拿马计划”来掩盖这一操作。
这一揭露在重视文献遗产保护的人群中引发了愤怒。书籍脊背堆成山,喂养木材粉碎机的想法对珍稀版本的爱好者来说尤其痛苦。
破坏性扫描是大规模处理书籍的最便宜方式。人工智能公司正在竞相通过长文本和高质量文本来提升其模型,而这些文本仅以书籍格式提供。
保护主义者担心,这种做法可能在更大范围内发生,远超报道的规模。更糟糕的是,一些稀有书籍的实体副本可能会永远消失。
书籍的销毁并非不可避免。谷歌在2009年申请了一项无损扫描技术的专利,人工智能公司如果愿意放慢速度并投入更多资源,可以实施这一技术。
然而,谷歌的方法并不完美。研究发现,书页的弯曲可能会扭曲文本,并且在过程中可能会遗漏某些页面。
当工作人员移动得太快时,可能会发生额外的故障。有记录显示,在扫描中出现了没有身体的手遮挡页面,影响了数字化材料的质量。
互联网档案馆早已明白,扫描古老文本需要时间和特别的关注。该组织通过一种优先考虑书籍物理完整性的过程,帮助图书馆保护老化的收藏。
互联网档案馆的方法对于寻求捷径的人工智能公司来说可能显得几乎外星人般陌生。但正是这种奉献精神保护了那些如果被销毁将永远无法替代的书籍。
自2010年以来,Eliza Zhang一直是互联网档案馆的书籍扫描员,她在2021年的一篇文章中描述了她的工作。对她来说,以“困难的方式”进行扫描具有超越效率的内在价值。
在十多年的工作中,Zhang已经扫描了超过300万页。她还处理了超过14,000个折叠页和18,000个项目,其中大多数是书籍。
她的目标是达到“零错误”。每一页都需要高度集中,因为古老的书籍纸张极其脆弱,“薄如纸”。
Andrea Mills,负责扫描操作的管理,解释道:“干净且干燥的人手是翻页的最佳方式。”带有真空臂的自动扫描仪在处理珍贵书籍时效果不佳。
互联网档案馆试验了商业自动化扫描仪,但结果令人失望。对于脆弱的书籍和特殊收藏,人为干预仍然不可或缺。
张在处理每本书时都很细心。他小心翼翼地用踏板抬起扫描仪的玻璃,调整相机,并在继续之前检查每一页是否清晰可读。
他还记录下任何可展开的页面,设定提醒以便返回扫描额外的插页。这样可以确保在记录主要作品时不会遗漏补充材料。
如果漏掉一页或某张图片模糊,互联网档案馆的专有软件会停止处理。张必须重新扫描有缺陷的材料才能继续。
互联网档案馆的图书馆服务主任Chris Freeland确认,2021年的出版物仍然是“我们今天扫描过程的最佳描述”。该方法在本质上没有改变。
张的工作视频在Twitter上获得了150万次观看。配文引起了书籍爱好者的共鸣:“我们从不通过切割装订来毁坏一本书。”
自从对Anthropic的诉讼揭露了大规模书籍销毁以来,文化爱好者们开始行动。最大的担忧是人工智能公司可能会不加考虑地粉碎那些无法替代的书籍。
上周,两份最新报告加剧了这种警报。《每日电讯报》指责硅谷销毁数百万本稀有书籍,并“粉碎原件”。
媒体如404 Media报道,ISBNdb,一个书籍数据库,正在推广其服务以帮助人工智能公司批量获取书籍。该公司据称警告客户光学效果不佳。
Anthropic开始使用代号“巴拿马项目”来掩盖其破坏性扫描操作。没有迹象表明该公司销毁了稀有书籍,并在公开声明中否认了这一点。
然而,稀有书籍卖家仍然发现可疑的订单。合法买家通常倾向于寻找单本书籍,而不是大量多样化的选择。
就在本周,爱尔兰的Kennys书店指出了一个“疯狂”的订单,包含5000本冷门书籍。买家没有试图讨价还价,这已成为可能涉及人工智能的“红旗”。
Kennys书店的Tomás Kenny表示,人工智能正在“恐吓我们的行业”。他计划拒绝那些可能用于训练模型的订单,以保护作者和读者的权益。
Kenny表示,书商通常处于道德和伦理困境的前沿。但在人工智能涉及知识产权的情况下,“Kennys不想成为其中的一部分”。
一些书商担心,向那些无差别销毁其收藏的人工智能公司出售书籍就等于“签署自己的死亡判决”。短期利益无法弥补长期损害。
读者和图书馆员社区呼吁透明,了解哪些书籍被购买以及目的是什么。然而,缺乏监管使得人工智能公司在灰色地带运作。
一些科技公司正在与机构合作,以保护稀有书籍。OpenAI和微软正在与哈佛大学的图书馆员合作,开展一项计划,利用大约100万本15世纪的公共领域书籍来训练模型。
xAI的创始人埃隆·马斯克公开表示,不会为了训练人工智能而销毁珍贵书籍。马斯克要求团队保留任何珍贵书籍,并以“困难的方式”进行扫描,而不是直接切割书脊。
然而,批评者对此并不完全信服。马斯克并没有明确表示他的团队不会销毁任何书籍,而且他的公司如何定义“珍贵书籍”也不清楚。
版权法允许公司销毁他们购买的书籍副本。这为这种破坏性行为提供了法律框架,尽管在伦理上存在争议。
公众的反应可能会迫使大型科技公司采用类似互联网档案馆的非破坏性方法。社会压力曾迫使一些人工智能公司修改有争议的做法。
然而,经济激励依然倾向于破坏。以非破坏性的方法扫描数百万本书需要更多的时间、金钱和专业人员。
互联网档案馆已经证明,在不牺牲原件的情况下进行大规模数字化是可能的。但他们的模式依赖于保护使命,而不是最大化模型训练的速度。
对于那些对破坏标题感到痛心的书籍爱好者来说,互联网档案馆的方法提供了一种安慰。存在一种既尊重知识又尊重物理对象的替代方案。
珍贵书籍的吸引力超越了其内容。手握一本古老的书籍,翻阅着泛黄的页面和百年书脊,读者与过去的世代建立了联系。
互联网档案馆的扫描员张偶尔暂停工作,阅读她正在处理的书籍片段。每一套书籍对她来说都很重要。
当被问及她最喜欢工作中的哪一部分时,她以感染力十足的热情回答:“一切!我觉得一切都很有趣。”并补充说,她并不觉得工作无聊。
这种热情与工业化逻辑的书籍粉碎形成了鲜明对比。不同的视角揭示了对知识及其保护的两种对立看法。
如果破坏性做法继续失控,珍贵书籍将变得更加稀缺。未来的读者可能会失去对今天我们认为不可替代的实体副本的访问。
书商、图书馆员和读者的社区要求承担责任。与此同时,像Kennys这样的公司决定拒绝可疑的订单,尽管这意味着放弃收入。
这一辩论远未解决。对书籍大规模销毁的需求可能为人工智能行业设立重要的法律先例。
保护主义者希望透明度和公众压力能迫使公司改变。每一本被粉碎的书籍都代表着对共享文化遗产的不可逆转的损失。
互联网档案馆的方法证明,效率不必与对原件的尊重相悖。真正的创新可能在于更慢地扫描,而不是更快。
对于重视书面文化的人来说,抵制书籍破坏的斗争也是对知识未来的斗争。所涉及的利益超越了人工智能。
最终的决定将落在公司、监管者和消费者身上。现在,像托马斯·肯尼这样的书商已经选择了一个阵营:书籍,而不是数据。
本内容仅供参考,不构成任何金融、投资、法律或税务建议。文中提及的任何活动、奖励、线上活动或相关信息,不应被视为对购买、出售或交易任何加密资产的推荐、招揽或邀请。加密资产具有高波动性,存在价值损失风险。WEEX服务、产品及相关活动的可用性可能因地区而异。用户在参与前有责任确保符合当地适用法律法规。

















