Optimal Transport for Handwritten Text Recognition in a Low-Resource Regime
本文提出了一种利用最优传输(Optimal Transport)来对齐视觉特征与语义词表示的迭代自举(bootstrapping)框架,通过从无标签数据和极少量有标签样本中生成伪标签,从而在低资源场景下实现有效的手写文本识别。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在数字历史的寂静角落,大量的手写信件、日记和官方记录正静静地等待着被阅读。几个世纪以来,解锁这些脆弱页面中秘密的唯一方法是通过缓慢且艰苦的人工转录工作,这项任务往往导致整个藏书集无法被研究人员获取。如今,计算机可以自动完成这项工作,这一领域被称为手写文本识别。然而,目前最强大的计算机程序面临着一个重大障碍:它们就像那些只能通过大量完美教科书来学习阅读的天才学生。它们需要海量的标注示例——即成千上万张由人类已经打出其手写内容内容的图像——来学习如何识别单词。当面对一个新的、独特的历史文献集,且此类标注示例稀缺或不存在时,这些先进系统往往会跌跌撞撞,无法适应新材料的特定风格或有限词汇量。
来自希腊的一个研究小组提出了一种不同的前进方式,这种方式不依赖于大规模数据集,而是使用一种巧妙的“引导式猜测”来教计算机如何阅读。他们的方法并不将问题视为简单的模式匹配练习,而是将其视为一种视觉外观与含义之间的匹配游戏。他们从极少量的已知示例开始,也许仅有几十个单词,并使用一种称为“最优传输”(optimal transport)的数学原理,将这些视觉图像与可能的单词列表进行对齐。可以将这个过程想象成一位知道特定书籍中每个单词出现频率的图书管理员;即使没有看到文本,图书管理员也知道“the”出现的频率远高于“philosopher”。通过利用这种对单词频率的了解,计算机可以做出有根据的猜测,以高置信度识别出最可能的匹配项。
研究人员构建了一个以学习和改进为循环运行的系统。它首先分析来自一小组已知示例和一组更大的未知示例的单词视觉形状。然后,计算机将这些视觉形状投影到一个单词按其含义和出现可能性进行组织的空间中。利用最优传输这一数学工具,系统计算出将未知图像与已知单词进行配对的最有效方式,实际上是在问:“考虑到我们对单词出现频率的了解,哪个单词最符合这张图像?”系统随后选择最自信的匹配项——即视觉形状与单词频率完美契合的项——并将它们分配为新的训练标签。这些新标注的图像被添加到训练集中,随后计算机会在扩充后的集合上进行重新训练。通过每一次循环,系统变得越来越擅长区分外观相似的单词,从而在不需要人类标注每一页的情况下,逐渐建立起稳健的理解能力。
在实验中,该团队在包括乔治·华盛顿书信、IAM数据集和CVL集合在内的多个历史文献集中测试了这种方法。他们发现,即使在仅有1%的数据被标注的情况下,他们的系统也能实现足以媲美甚至显著超越现有方法的识别准确率,而现有方法则需要更多的训练数据。例如,在处理乔治·华盛顿的藏品时,该系统在处理有限数据时,比目前的尖端模型降低了10%以上的错误率。研究人员指出,当词汇相对可预测时,该方法效果最好,因为系统依赖于了解单词的相对频率来进行猜测。当词汇量极其庞大且多样化时(如IAM数据集),其表现虽然仍具竞争力,但并未达到同样的统治地位,这表明该方法在文本遵循可识别的用法模式的情景下最为强大。
他们成功的关键组件是使用了“词汇先验”(lexical prior),这简单来说就是计算机对于目标语言中哪些单词常见、哪些单词罕见的知识。研究人员证明,如果忽略这种知识并将每个单词视为等概率出现,系统的正确猜测能力会显著下降。相比之下,当系统被允许使用单词的自然频率来引导其选择时,它就能过滤掉不确定的猜测,并专注于最可靠的匹配。这使得计算机能够从自身的错误和成功中学习,随着每一次迭代不断精炼其对手写风格的理解。这个过程是完全自我修正的;随着系统识别出更多单词,它获得了标注更困难示例的信心,最终从极小的初始信息种子中创建出一个大规模、高质量的数据集。
研究人员还展示了,即使在最终阅读阶段没有被给予候选单词列表时,他们的方法仍然有效。虽然系统在训练阶段使用单词列表进行学习,但最终输出是直接从视觉模式中生成的,这使其具备足够的灵活性来阅读它从未见过的单词。这种区别至关重要,因为在现实应用场景中,计算机可能需要阅读包含其初始训练词汇之外的名称或术语的文档。这项研究证实,通过将问题重新定义为视觉与语义的对齐任务,而非简单的分类问题,可以构建出更加高效且适应性更强的识别系统。
最终,这项工作为数字人文领域提供了实用的解决方案,在这些领域中,资源往往有限,且人工标注的成本极高。通过利用语言的内在结构和单词使用的统计规律,研究人员创造了一个能够以极少的人为干预来解锁历史档案的工具。结果表明,我们不需要数百万个标注示例来教会机器阅读;只要有少量的引导和聪明的学习策略,计算机就可以逐渐教会自己去破译过去的笔迹,从而为后代保存文化遗产。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。