Tangut Word Segmentation under Extreme Resource Scarcity: Integrating Traditional Lexicons and Unlabeled Text
本文提出了针对极端资源匮乏条件下西夏语分词的首个系统性研究,通过引入一种整合了专家标注数据、传统词典和无标签文本的混合框架,实现了0.911的高F1值,并展示了超越有限监督词汇集的鲁棒泛化能力。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
语言常被视为一种声音的流转,但对于许多书写系统而言,它始于符号的流转。在大多数现代文字中,空格或标点符号告诉读者一个词在哪里结束,下一个词从哪里开始。然而,一些古老的文字并不使用这些视觉提示。相反,它们呈现出一条连续的字符线,让读者去自行判断意义单元的位置。这就是研究西夏文(Tangut)的学者们所面临的挑战——这种语言曾是历史上中国西夏王朝的官方文字,但已消亡数个世纪。现存的文献是通往失落历史与文化世界的珍贵窗口,但由于词与词之间没有分隔,阅读这些文献依然十分困难。由于缺乏自动识别这些词界的方法,计算机无法有效地搜索、翻译或分析这些历史文献。
几十年来,研究人员一直专注于简单地识别西夏手稿中的单个字符,即将纸上的墨迹图像转化为数字文本。但识别字符仅仅是第一步;理解这种语言需要知道哪些字符组合在一起构成一个词。这项任务异常困难,因为已经没有母语使用者可以咨询,而极少数能够阅读西夏文的专家必须依靠语境、重构的读音以及古代词典来推测词语的起始与结束。专家知识的匮避和大型数字图书馆的缺乏,使得这是一个极端的资源匮乏问题,在这种情况下,通常的现代人工智能工具往往会失效,因为它们需要大量的标注数据来进行学习。
现在,一支研究团队通过教计算机如何在极少的人类指导下进行西夏词汇切分,迈出了解决这一谜题的第一个系统性步骤。他们从一个经过专家精心挑选的小型集合开始,该集合包含2,750个文本片段,总计近32,000个词,这些片段均由专家手动划分。该数据集取自一部佛教经文和一部世俗百科全书,作为其训练的基础。然而,仅依靠这极少量的标注数据不足以构建一个稳健的系统。为了克服这一点,研究人员结合了三个不同的知识来源:专家标注的示例、一本传统的西夏词典,以及大量从未进行过词汇划分的未标注西夏文本。
研究人员设计了一个系统,将词典视为一种“提示”而非死板的规则手册。在许多情况下,单个字符可能是多个不同词典条目的组成部分,从而产生一个重叠的可能性网络。该系统并没有强迫计算机立即选择唯一的路径,而是保留了所有这些潜在的候选对象。随后,它使用一种“可靠性校准”方法来权衡这些提示。通过观察一个词典条目在文本中出现的频率,以及它与专家划定的边界的匹配程度,系统学会了对某些词典条目给予更高的信任度。这防止了计算机盲目遵循某个在特定语境下可能并不准确的词典条目。
为了进一步提高理解能力,该系统还从未标注的文本中学习,这些文本包含数十万个字符,但没有词汇划分。通过分析字符相邻出现的频率及其邻居的多样性,系统构建了一张语言的统计图谱。它了解到某些字符组合经常一起出现,表明它们构成一个单词,而另一些则表现得较为随机,暗示了它们之间存在边界。这种统计直觉与一种现代神经网络相结合——这是一种旨在识别模式的计算机程序,它在接触标注示例之前,已通过未标注文本进行了预训练,从而理解了字符的语境。
这种方法的成果非常显著。在对未见过的文本部分进行测试时,该系统达到了很高的准确度,正确识别词界的情况超过了91%。这一表现明显优于仅依赖少量标注数据或仅依赖词典的系统。研究发现,结合专家知识、词典提示以及来自未标注文本的统计模式是必不可少的;移除其中任何一个组成部分都会导致系统的性能下降。该系统在识别训练示例中未出现的词汇方面也表现出色,这是低资源语言面临的常见挑战,它利用统计模式和词典知识做出了合理的推测。
最重要的发现之一是,系统的泛化能力很大程度上取决于它所阅读的文本类型。虽然它在构成数据大部分的世俗百科全书上表现异常出色,但在宗教经文上的准确度略低。这表明系统仍在学习如何适应语言中不同的风格和词汇。研究人员还指出,虽然系统可以高精度地识别词界,但为这些词分配语法标签的任务仍是一个初步阶段,因为词类清单仍在由专家进行完善。
这项工作为西夏研究的未来奠定了至关重要的基础。通过成功地将传统语言学资源与现代机器学习技术相结合,研究人员创建了一个能够帮助学者更高效地处理和分析这些古文献的工具。该系统并非取代人类专家,而是提供了一个强大的辅助手段,可以处理重复性的切分任务,使研究人员能够专注于更深层的历史和语言学问题。随着团队不断扩大其标注数据并完善模型,他们希望最终能将这些方法应用于更广泛的文献,使失落的西夏语言更接近现代人的理解。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。