首页 / 正文

AI训练数据碰上绝版书:扫描之后,原书该不该被毁?

Mooko
发布于 2026-08-18 · 5分钟阅读
1016 浏览
0 点赞 暴击点赞!

AI训练数据碰上绝版书:扫描之后,原书该不该被毁?

你买到一本老书,切开书脊,送进高速扫描机。

几分钟后,几十万字进了 OCR 流程,变成可检索、可训练的文本。纸质书呢?被丢弃,或者直接销毁。

如果这只是一本随处可见的旧畅销书,很多人会觉得没什么。可要是一本 18 世纪植物学图谱,全球只剩几本呢?事情立刻变味了。

这不是“扫描技术好不好用”的问题。

这是一个更刺耳的问题:为了训练 AI,我们能不能把不可再生的实体文献,当成一次性耗材?


一、为什么 AI 公司偏爱旧书?

训练语言模型,缺的从来不只是文字数量。

真正稀缺的是:

  • 结构完整的长文本
  • 编辑校对过的正式出版内容
  • 专业领域的冷门知识
  • 语气稳定、格式干净的文本
  • 不含大量机器生成痕迹的历史语料

2022 年以前出版的图书经常被看重,原因很现实:那时大规模生成式 AI 文本还没铺满互联网。

你拿一本 1998 年出版的医学史著作去做训练,里面大概率是人写、人校、人出版的内容。拿一篇今天网页上抓到的文章呢?谁敢保证它不是模型写的、模型洗的、模型再加工的?

训练数据一旦混入太多 AI 生成文本,模型就容易“吃自己吐出来的东西”。结果是语言越来越空,事实越来越漂,风格也变得一股模板味。很难看,真的。


二、“拆书扫描”到底是怎么回事?

很多人以为图书数字化,就是把书放在扫描仪上,一页页翻。

博物馆和档案馆确实常这么干,目的是保护原件。可这种方式慢,也贵。一册脆弱的老书,扫描人员可能得戴手套、调光、压平纸张,还要处理卷曲和透印。

另一条路线粗暴得多:拆书高速扫描。

典型流程是这样的:

  1. 采购纸质书,来源可能是旧书商、库存商或图书数据服务商。
  2. 切开书脊,把装订成册的书拆成单页。
  3. 用高速馈纸扫描机批量扫描。
  4. 通过 OCR 把页面图片转成可搜索文本。
  5. 清洗页码、目录、脚注、乱码和重复段落。
  6. 将文本进入检索库、标注流程或模型训练管线。
  7. 原始纸书被回收、丢弃或销毁。

这种方案确实快。

一台高速设备一天能扫几千页。对海量数据项目来说,时间就是钱。问题也恰好出在这里:速度把书当成了“数据容器”,却抹掉了书作为文物、版本证据和历史实物的价值。


三、数字副本能替代实体书吗?不能完全替代

“扫描过了,不就保存下来了吗?”

这句话听起来合理,却漏掉了很多东西。

一本书不是只有字符。

它还有:

  • 纸张纤维和水印
  • 装帧方式
  • 墨色、印刷误差与补印痕迹
  • 前主人留下的批注、藏书票、签名
  • 插图的颜色和套印细节
  • 版本之间细小却关键的差异
  • 书页边缘的裁切、虫蛀、修补痕迹

举个具体场景。

某本 18 世纪植物学书里画了一株植物。OCR 能识别正文,甚至能把拉丁文转成可搜索文本。但纸张上的压印、彩色铜版画的颜料层、手写修订符号,往往不会被普通扫描完整保留。

研究者几十年后想确认“这是不是某次早期修订版”,靠纯文本根本做不到。

数字文件保存的是内容的一部分

实体书保存的是内容诞生和流传的证据

两者不是一回事。


四、合理使用不等于“想拆就拆”

围绕 AI 训练的版权案件里,法院对“转换性使用”“是否替代原作市场”“是否造成实质损害”等问题,会有不同判断。

有报道提到,个别案件中,法官关注过合法购书、数字化处理以及访问控制等因素。可别把这理解成一张“毁书许可证”。

版权问题和文献保护问题,本来就是两条线。

  • 一本书版权到期,不代表它没有收藏或研究价值。
  • 购买了实体书,不代表销毁原件没有文化损失。
  • 拿到了数字文本,不代表有权把文本用于任何训练场景。
  • 法律风险可控,不代表伦理上站得住脚。

更现实的一点是:训练数据链条往往很长。

采购商、扫描商、数据聚合平台、模型公司,可能各做一段。到了出问题的时候,大家都说“我只负责其中一环”。这套说法,听着就让人头疼。


五、做 AI 数据采购,给稀有书留一条红线

如果你在做模型训练、知识库建设或 OCR 数据项目,可以直接照着下面这套规则执行。

1. 采购前先做“稀有度筛查”

别看到书就扫。

给每一本书建立基础字段:

| 检查项 | 要看什么 | | --- | --- | | 出版年代 | 是否为早期出版物、特殊历史时期版本 | | 馆藏数量 | 公共图书馆、大学馆、档案馆是否仅存少量馆藏 | | 版本信息 | 初版、限量版、地方版、作者签名本、手工装帧本 | | 实物特征 | 批注、题字、插图、地图、折页、藏书章 | | 替代来源 | 是否已有高质量公开数字版或可借阅副本 | | 权利状态 | 版权是否有效,是否存在特殊权利限制 |

一个简单的原则:越难替代,越不能拆。

2. 设定“禁止破拆清单”

下面这几类,建议默认不进入拆书扫描线:

  • 1850 年前出版的书籍
  • 已知存世量很少的版本
  • 手稿、信件、题字本、批注本
  • 含彩色插图、折页地图、特殊装帧的图书
  • 地方志、族谱、少数语言文献
  • 医学、植物学、地理学等带历史图版的资料
  • 来源不明、疑似流失文物或特殊馆藏

宁可少扫一千本普通旧书,也别毁掉一本没法重来的书。

3. 稀有资料改用“非破坏式数字化”

遇到有价值的书,换方法,不要硬上高速馈纸机。

可选方案包括:

  • V 型书籍扫描仪:减少书脊受力
  • 顶置式相机扫描:适合脆弱纸张与厚书
  • 专业色彩管理:保留插图和纸张色彩信息
  • 多光谱成像:用于模糊字迹、褪色文字等研究需求
  • 高分辨率 TIFF/PDF-A 存档:别只留压缩 JPEG

成本会高一点。可你保存下来的,是未来还能复核的资料,不是一堆“看起来差不多”的文本。

4. 建立可追溯的数据账本

每份入库文本,都该能回答四个问题:

  • 书从哪里来的?
  • 什么时间被扫描?
  • 用了什么设备和 OCR 模型?
  • 原件现在还在不在?存在哪里?

建议最少记录这些元数据:

book_id
ISBN / OCLC / 版本标识
采购来源
采购日期
版权状态
扫描方式:破拆 / 非破拆
扫描分辨率
OCR 引擎与版本
文本清洗规则
原件处置状态
复核负责人

别小看这张表。

等到有人质疑数据来源,或者研究人员发现版本异常,它就是你唯一能把事情讲清楚的证据。


六、避坑清单:这几种做法很危险 ⚠️

把“绝版”误判成“稀有”

绝版不等于只剩一本。

反过来也一样,一本没绝版的地方出版物,也可能在馆藏体系里极少见。采购前要查馆藏,不要只看二手平台价格。

只保存 OCR 文本,不保存原始页面

OCR 会错。

老书里的异体字、拉丁文、表格、脚注、双栏排版,都是 OCR 翻车重灾区。至少保留页图和文本之间的对应关系,未来才能校正。

把扫描件当成“永久保存”

硬盘会坏,格式会过时,链接会失效。

重要资料至少准备多副本存储,并放在不同地点。条件允许的话,交给公共机构或可信数字档案平台长期托管。

用匿名采购掩盖来源问题

商业采购可以保护隐私。可数据治理不能完全黑箱。

不公开卖家姓名没问题,内部审计记录必须有。来源不清的材料,别急着送进训练集。

用“模型需要数据”压过一切

模型缺数据,可以找公开版权文本、授权内容、合成数据和普通二手书。

真正稀有的文献毁了,就没了。这个账一点也不复杂。


七、一个更靠谱的行动方案

如果你负责 AI 数据项目,可以把流程定成三道门:

绿灯:可规模化处理

适用于大量普通现代旧书、已有多个馆藏副本的资料、明确授权内容。

可以采用高速扫描,但仍要保留来源记录和基础页面存档。

黄灯:人工复核后处理

适用于年代较早、版本不明、含插图或地方资料的书。

由图书馆员、版本研究人员或档案人员复核。确认普通副本后再决定是否扫描、采用哪种方式扫描。

红灯:禁止破拆

适用于孤本、善本、手稿、特殊版本和少量存世文献。

采用非破坏式数字化。必要时只做高质量影像保存,不进入通用训练集。

这套分级不花哨,执行起来却很管用。


写在后面:别把保存和销毁混成一个词

数字化当然有价值。

它能让偏远地区的学生读到旧书,让研究者跨国检索资料,也能让大量脆弱文本拥有备份。问题不在扫描本身。

问题在于,有人把“拿到文本”当成唯一目标,把原书的命运当成无关紧要的尾料。

对普通书,规模化扫描是效率。

对稀有书,破拆销毁可能就是一场包装得很体面的损失。

技术可以跑得很快。可碰到只剩几本的旧书时,咱们最好慢一点。

OpenClaw
木瓜AI - 中转平台
木瓜AI - 大模型中转平台上线啦
注册即送免费tokens
聚合 全球顶尖大语言模型,支持 GPT, Claude, Gemini 等。
立即领取tokens