文章来源:智汇AI 发布时间:2025-06-26
人工智能公司 Anthropic 曾斥资数百万美元,将实体图书拆解并扫描成数字文件,用于训练类似 ChatGPT 的 AI 助手 Claude。为了获取训练数据,公司将大量图书拆除装订、扫描进系统,随后直接丢弃原件。
暂无访问智汇AI6月26日消息,据外媒ArsTechnica今日报道,当地时间周一公开的法庭文件披露,人工智能公司Anthropic曾斥资数百万美元,将实体图书拆解并扫描成数字文件,用于训练类似ChatGPT的AI助手Claude。为了获取训练数据,公司将大量图书拆除装订、扫描进系统,随后直接丢弃原件。
判决书长达32页,披露了Anthropic在2024年2月雇佣TomTurvey的经过。Turvey曾负责GoogleBooks项目的合作事务,公司委托他“获取全世界的图书”。这一战略性人事安排,显然是希望复制谷歌曾被法院认定为合理使用的图书数字化模式。
最终,法官WilliamAlsup裁定,该扫描方式构成合理使用,理由是图书已由Anthropic合法购买、扫描后即刻销毁,且数字文件仅限内部使用,未向外传播。他认为这类转换相当于“节省空间”的数字化转化,具有合理使用中的“转化性”特征。如果公司一开始就遵守这一路径,或许已树立AI合理使用的首个判例,但早期的盗版行为削弱了其合法性。
核心原因其实很简单:AI训练需要海量优质文本。为了构建大语言模型,研究人员需将亿万词语输入神经网络,反复训练模型,建立词语与概念之间的关系。
训练数据的质量直接影响模型输出的准确性。相比网络评论等杂乱信息,编辑过的书籍和文章能显著提升AI的语言能力。
AI公司急需出版内容,但通常不愿耗费时间谈授权。美国的“首次销售原则”提供了法律空间:买下实体书之后,使用者可以自行处理。这就让购买图书成为一种合法的“绕道方案”。
和许多同行一样,Anthropic最初选择了绕过版权的捷径。智汇AI从法庭材料获悉,为了绕开冗长复杂的授权流程,CEO阿莫代伊曾主张使用盗版电子书。但到了2024年,出于法律考虑,公司开始寻求更安全的替代方案。
收购二手书成为理想选择:不必谈授权,又能获得质量上乘的训练文本。为了加快数字化进程,Anthropic采用“破坏式扫描”,大量购入图书,拆封、裁剪、整批扫描为机器可读的PDF文件,完成后纸本全部废弃。整个流程耗资数百万美元。
该公司的购买对象大多是零售渠道的普通旧书。但事实上,非破坏性扫描技术早已成熟。比如InternetArchive就开发出可保留原书的数字化手段。本月早些时候,OpenAI和微软也宣布与哈佛大学图书馆合作,计划使用近百万本公版书籍训练AI,这些书籍在被数字化的同时依旧妥善保存。