FineBooks 为历史书籍 OCR 建立基准

The Decoder··作者 Matthias Bastian

关键信息

FineBooks 使用字符错误率(CER)作为指标,并提供“外交式”模式和“阅读式”模式:前者把像长 s(ſ)这类古体字符的现代化处理算作错误,后者则允许这种变化。该评测仅覆盖四种语言的 Antiqua 字体和单栏书页,不包括 Fraktur、手写体或非拉丁文字。

资讯摘要

FineBooks 是 Hugging Face 和 EleutherAI 的一个新项目,关注的是 AI 数据质量中的一个实际问题:历史书籍往往在多年以前就已经用不完美的 OCR 完成数字化,而这些错误会损害语言模型训练效果。文章引用了 Talkie 项目的先前研究,指出用 OCR 文本训练的模型,其学习效率只有用人工转录文本训练模型的 30%。为了验证现代开源权重 OCR 系统是否能缓解这一问题,FineBooks 团队在 2,165 页历史书籍页面上评测了 14 个模型,并把结果做成了排行榜。表现最好的系统字符准确率超过 97%,而每千页成本不到 2 美元,这意味着大规模重跑历史文档在经济上是可行的。一个有意思的结果是,小模型有时会胜过大模型:dots.mocr 只有 30 亿参数,却排在第一;而参数接近三倍的 Qwen3.5-9B 反而得分更低。

OvisOCR2 以仅 9 亿参数拿到第二名,每千页成本只有 46 美分。该项目使用的真值数据来自 IMPACT 和 BHL-Europe 对 6 卷 BHL 文献的人工转录,这些转录覆盖英语、法语、德语和拉丁语。FineBooks 认为这些输出已经足够用于 AI 训练,但仍然不够准确,不能用于学术或科学用途。团队计划用其中一个高分模型重新处理大约 20 万份公共领域的 Biodiversity Heritage Library 文档,并将清洗后的文本作为开放数据集发布。

FineBooks 为历史书籍 OCR 建立基准

资讯正文

旧 OCR 文本会严重拖累语言模型训练,FineBooks 想在大规模上解决这一问题

要点

- FineBooks 项目由 Hugging Face 和 EleutherAI 合作开展,基准测试了 14 个开源 OCR 模型在 2,000 多页历史书籍页面上的表现,以评估它们将扫描文本转换为适合 AI 语言模型训练的干净数据的能力。

- 较小的模型经常优于更大的模型,其中表现最好的模型以低于每千页 2 美元的成本实现了超过 97% 的字符准确率。

- 研究人员认为,这样的输出质量已足以用于 AI 训练,但也指出,这些模型仍然存在过多错误,不适合用于学术或科学应用。

Hugging Face 和 EleutherAI 的 FineBooks 项目测试了 14 个开放权重 OCR 模型在 2,000 多页历史书籍页面上的表现。最佳模型已经能生成足以用于 AI 训练的文本,但还未达到学术用途的要求。

用公共领域图书训练开源 AI 语言模型,意味着必须处理质量很差的文本。图书馆多年前就用光学字符识别技术从扫描件中提取了这些文本,而结果往往充满错误。Talkie 项目曾量化过这种潜在损害:用 OCR 文本训练的语言模型,其学习效率只有用同一本书的人类转写文本训练的模型的 30%。

FineBooks 是 Hugging Face 和 EleutherAI 的合作项目,旨在测试现有开源 OCR 模型能否解决这一问题。团队在 2,165 页历史书籍页面上运行了 14 个开放权重模型,并将结果发布为排行榜。表现最好的模型字符准确率超过 97%,而每千页成本不到 2 美元。

数百万公共领域页面需要更好的文本识别

去年,当 EleutherAI 及其合作伙伴发布 Common Pile——迄今为止最大的开放许可训练语料库——时,其中包含约 300,000 本公共领域图书,文本来自更早期的 OCR 运行。FineBooks 的作者表示,用更好的模型重新处理这些书籍,是改进开放 AI 训练数据集最有效的方法之一。

该项目首先选择了 Biodiversity Heritage Library(BHL)作为目标,该馆藏有超过 300,000 份已数字化的自然历史文献,总页数超过 6400 万页。BHL 通过 AWS 提供其馆藏的批量下载。

衡量 OCR 质量需要有已知正确转写的页面。团队使用了 IMPACT 项目和 BHL-Europe 的研究成果:在 2011 年至 2012 年间,专家转写了 6 卷英文、法文、德文和拉丁文的 BHL 文献,错误率约为每 2,000 个字符错 1 个。该数据以 CC-BY 许可形式存放在一个 GitHub 仓库中,并构成了新的真值数据集的基础。

小模型击败了更大的竞争对手

这 14 个模型都可免费使用,并可在本地硬件上运行,无需 API key。衡量指标是字符错误率(CER),即被错误识别字符所占的比例。排行榜将结果分为“diplomatic”和“reading”两种变体:前者将长 s(ſ)等古老字符的现代化处理也计为错误,后者则允许这类变化。

领先的 dots.mocr 模型仅使用 30 亿参数,而 Qwen3.5-9B 尽管规模几乎大了三倍,得分却更低。OvisOCR2 以仅 9 亿参数、每千页 46 美分的成本位居第二。对于历史文献来说,模型规模与 OCR 质量并不相关。

这项评估只覆盖了四种语言中的 Antiqua 字体。它没有考虑 Fraktur、非拉丁文字或手写体,而且 FineBooks 也仅限于单栏书页。团队计划用其中一个顶级模型重新处理大约 20 万份公共领域的 BHL 文档,并将文本作为开放数据集发布。新的模型会滚动加入排行榜,而评估框架也已公开提供。

足以用于 AI 训练,但对学术研究来说仍不够准确

FineBooks 的作者根据不同的预期用途来判断结果。他们写道,对于训练语言模型来说,表现最好的模型已经足够好。与旧有流程相比,这些模型产生的错误要少得多,而按目前测得的成本,重新处理一个 BHL 规模的馆藏也是现实可行的。

团队指出,图书馆面临的是另一个问题。他们的系统依赖 ALTO XML,这是一种包含词级坐标的格式。而新模型输出的是 Markdown 或纯文本,不包含词位置,因此无法接入现有的图书馆基础设施。

对于学术转录而言,准确性仍然不够,但问题并不在于模型误读了字符。它们会悄悄地把字符现代化,把长体“s”或连字替换成现代等价形式。团队表示,有针对性的微调可以解决这个问题。

来源与参考

  1. 原始链接
  2. Old OCR text cripples language model training, and FineBooks wants to fix that at scale

收录于 2026-08-11