← 最新论文
💻 computer science

A Survey of OCR Evaluation Methods and Metrics and the Invisibility of Historical Documents

该论文基于 PRISMA 框架综述了 2006 至 2025 年间的 OCR 评估方法,指出当前评估体系过度依赖现代西方文档,导致黑人民众历史报纸等边缘化档案在训练数据与基准测试中严重缺失,进而引发结构性不可见与代表性伤害,并建议从组织与制度层面解决这一由评估激励和数据治理偏差造成的问题。

原作者: Fitsum Sileshi Beyene, Christopher L. Dancy

发布于 2026-03-30
📖 1 分钟阅读☕ 轻松阅读

原作者: Fitsum Sileshi Beyene, Christopher L. Dancy

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇文章就像是在给一群正在学习“认字”的超级电脑老师(OCR 系统)做体检,结果发现了一个大问题:这些老师虽然能认出很多现代报纸上的字,但一旦让他们去读几百年前黑人社区出版的旧报纸,他们就“瞎”了,而且读得乱七八糟。

为了让你更容易理解,我们可以把这篇论文的内容想象成以下几个生动的场景:

1. 只练过“标准试卷”的优等生

想象一下,现在的 OCR 技术(光学字符识别)就像是一个在顶尖私立学校读书的优等生。

  • 他的教材(训练数据): 全是现代、整洁、排版完美的商业文件、科学论文和现代 PDF。就像他每天只练做标准的数学题和英语阅读理解。
  • 他的考试(评估标准): 老师只关心他能不能把字一个不错地抄写下来(比如“字符错误率”)。只要他抄下来的字是对的,哪怕他把文章里的段落顺序搞反了,或者把两栏内容混在一起了,老师依然会给他打满分,因为“字”是对的。

问题在于: 这个优等生从来没读过几百年前黑人社区出版的报纸。那些报纸纸张发黄、字迹模糊、排版非常复杂(比如密密麻麻的七栏布局),而且用的是当时特有的古老字体。

2. 当优等生遇到“古董书”

论文作者让这位优等生去读一份 1837 年的黑人报纸《The Weekly Advocate》。结果发生了三种灾难性的“幻觉”:

  • 场景一:把“栏杆”当成了“字”
    旧报纸上有很多用来分隔栏目的竖线。优等生(传统 OCR 系统)分不清这是线还是字,于是把线也读成了文字,或者完全搞错了阅读顺序(把竖着排的内容横着读)。

    • 比喻: 就像你让一个人读一本竖排的书,他却非要横着读,结果把“第一章”读成了“第一行”,把“作者”读成了“标题”。
  • 场景二:过度自信的“脑补”
    有些字太模糊了,看不清。优等生(最新的 AI 模型)太想表现自己了,它没有说“这里看不清”,而是根据上下文瞎编了一个它觉得合理的词填进去。

    • 比喻: 就像你让一个没去过古代的人去翻译甲骨文,他为了显得博学,把看不清的符号强行解释成了现代词汇,结果把历史事实改得面目全非。
  • 场景三:把“结构”弄丢了
    黑人报纸的排版往往很有深意,比如用特殊的字体强调政治口号,或者用复杂的分栏来展示社区团结。优等生为了追求“字”的准确,把这些精心设计的排版全部抹平,变成了毫无生气的纯文本。

    • 比喻: 就像把一幅精美的马赛克壁画,强行拆成一块块普通的砖头,虽然砖头还在,但画里的故事和美感全没了。

3. 为什么会出现这种情况?(核心原因)

论文指出,这不仅仅是技术问题,而是**“考试指挥棒”的问题**。

  • 教材太单一: 用来训练 AI 的数据集里,几乎没有黑人历史报纸。就像你只教学生认现代简体字,却指望他能读懂几百年前的繁体字和手写体,这显然不公平。
  • 评分标准太死板: 现在的评分标准只看“字对不对”,不看“意思有没有变”或者“结构有没有乱”。这导致 AI 即使把历史文章读得支离破碎,只要字没拼错,它依然被认为是“最先进的”。
  • 隐形伤害: 这种技术上的“看不见”,实际上是在抹除历史。如果 AI 读不懂这些报纸,那么黑人社区的历史、政治主张和文化表达在数字世界里就会变得“隐形”,仿佛他们从未存在过。

4. 作者的建议:我们需要什么样的新老师?

作者呼吁,我们需要重新设计“考试”和“教材”:

  1. 教材要多样化: 必须把黑人报纸、社区档案、古老字体加入到 AI 的教材里,让它们真正“见世面”。
  2. 评分标准要升级: 不能只数错几个字。要考考 AI 能不能看懂文章的结构(比如分栏对不对)、排版(比如标题有没有被乱改)以及历史背景
  3. 尊重文化: 要把这些历史档案看作是核心内容,而不是边缘的“特例”。

总结

这篇论文就像是在敲警钟:如果我们只用现代的标准去衡量和训练 AI,那么历史中那些最珍贵、最独特的声音(特别是边缘群体的声音)就会被 AI 的“完美”所掩盖。

我们要做的,不是让 AI 变得更“聪明”去猜字,而是让它学会尊重那些古老、复杂且充满文化意义的文档,让它们真正被“看见”和“读懂”。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →