← 最新论文
💻 computer science

ViHistScriptBench: Benchmarking Vietnamese Historical Script and Document–Type Classification in Low–Resource Settings

本文介绍了 ViHistScriptBench,这是一个轻量级基准测试和评估流水线,旨在通过提供精选语料库、定义的任务以及基准模型,解决由数据有限和复杂书法带来的挑战,从而推动越南历史文字及文档类型的分类研究。

原作者: Nguyễn Tuệ An

发布于 2026-07-02
📖 1 分钟阅读☕ 轻松阅读

原作者: Nguyễn Tuệ An

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你拥有一座巨大的、布满灰尘的图书馆,里面装满了古老的越南书籍。有些是用古汉字写的,有些是用一种看起来像汉字但读音是越南语的独特越南文字(喃字)写的,还有一些是早期尝试使用我们今天使用的拉丁字母来书写越南语的尝试。

问题在于这些书很难阅读。墨迹已经褪色,纸张破损,而且书写风格迥异。如果你想搜索这些书籍或将它们转化为数字文本,你需要一个计算机程序(称为 OCR)来阅读它们。但现在的多数计算机程序就像那些只学过现代英语的学生;当它们看到这些古老且凌乱的脚本时,会感到完全不知所措。

这篇论文介绍了一个名为 ViHistScriptBench 的新工具。你可以把它想象成一个专门为训练计算机阅读这些古老越南书籍而设计的模拟考试

以下是该论文通过简单的类比进行的拆解:

1. 计算机的“健身房”(数据集)

为了训练计算机识别这些脚本,你需要大量的例子。作者从公共数字档案馆(如越南国家图书馆)中收集了 500 页内容。

  • 收藏内容: 他们挑选了展示不同“风味”书写方式的页面:纯汉字(Hán)、纯越南喃字(Nôm)、两者混合,以及早期的拉丁化越南语(Quốc Ngữ)。
  • 标签: 他们并没有只是把图像堆在一起。他们聘请了专家来为每一页进行标注,告诉计算机:“这是手写稿”、“这是木刻版画”或者“这一页混合了两种脚本”。这就像老师在批改一叠试卷,并在背面写下评语。

2. 三大挑战(任务)

论文为计算机设置了三个特定的游戏:

  • 游戏 1:脚本侦探。 计算机观察整个页面,然后必须猜出:“这是汉字、越南语、混合体,还是早期拉丁字母?”这就像看一份菜单,然后猜测它是法语、意大利语还是两者的结合。
  • 游戏 2:材质检查员。 计算机必须猜出这一页是如何制作的。是用毛笔手写的?是刻在木头上并盖印的?还是现代印刷的书籍?这有助于计算机了解如何处理页面的“纹理”。
  • 游戏 3:混淆识别器。 有些页面主体是用一种脚本写的,而边注则是用另一种脚本写的。计算机必须识别出页面是“混合型”还是“纯粹型”。

3. 参赛者(模型)

作者测试了不同类型的“学生”(AI 模型),以看看谁学得最好:

  • 经典派 (CNNs): 这些是传统的学生,擅长发现微小的细节(比如单个字母的形状),但有时会忽略全局。
  • 现代派 (Vision Transformers): 这些是能够同时观察整个页面的学生,理解文本列之间的相互关系。
  • “零样本”学习者 (CLIP): 这些是虽然没有专门学习过这个特定学科,但非常擅长根据常识进行推测的学生。它们试图仅通过阅读类似“带有汉字的页面”这样的描述来猜测脚本。

4. 结果与困境

论文报告说,现代模型(Vision Transformers)表现最好,准确率达到了约 90%。这是一个合格的分数,但并不完美。

它们在哪里失败了?
论文强调了让计算机感到困惑的特定“陷阱”:

  • 双胞胎陷阱: 汉字(Hán)和喃字(Nôm)看起来非常相似。这就像试图从一张模糊的照片中分辨出一对双胞胎兄弟和姐妹。计算机经常把它们搞混。
  • 噪声陷阱: 古书有污渍、虫蛀和褪色的墨迹。计算机有时会将咖啡渍误认为是字母的一部分。
  • 方向陷阱: 这些古书是纵向书写的(从上到下)。习惯于阅读横向英文文本的计算机有时会对布局感到困惑。
  • 声调陷阱: 越南语使用许多小符号(变音符号)来改变字母的发音。如果墨迹模糊,计算机就无法分辨出一个标记是声调符号还是仅仅是一个污点。

5. 为什么这很重要

作者并不是在承诺我们今天就能立即翻译所有的越南历史。相反,他们在说:“这是一个公平的测试,也是一个起跑线。”

在此之前,研究人员是在没有赛道或秒表的情况下尝试跑步。现在,有了 ViHistScriptBench,每个人都有了同样的 500 页内容和同样的规则。这使得科学家们可以公平地比较他们的工具,看清它们究竟在哪里失败,并以此构建更好的“学生”,从而帮助保护和开启越南的书写历史。

简而言之: 他们建立了一个练习测试,以帮助计算机学习如何阅读凌乱的古代越南书籍,向我们展示了计算机目前仍在哪些地方感到困惑,以便我们能更好地教导它们。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →