← 最新论文
💬 NLP

Naamah: A Large Scale Synthetic Sanskrit NER Corpus via DBpedia Seeding and LLM Generation

本文介绍了 Naamah,这是一个通过结合 DBpedia 实体提取与一个 240 亿参数混合推理模型生成的大规模合成梵语命名实体识别语料库,包含超过 10 万个句子,随后被用于评估多语言及印度特定 Transformer 架构。

原作者: Akhil Rajeev P, Annarao Kulkarni

发布于 2026-04-30
📖 1 分钟阅读☕ 轻松阅读

原作者: Akhil Rajeev P, Annarao Kulkarni

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你拥有一座庞大的古梵文图书馆。这些书籍充满了神祇、国王、城市和组织的名字。要教会计算机理解这些书籍,你需要向它展示成千上万个例子,在这些例子中,这些名字被高亮并标注(例如“这是一个人”、“这是一个地方”)。

问题在于:还没有人编写这些标注。 手动阅读并标注这些古籍,就像蒙着眼睛在干草堆里找针;这需要专家耗费数年时间,并耗资巨大。

这篇论文介绍了一种名为Naamah的解决方案(该名称源自梵文文学中的人物,尽管论文未明确解释其含义,但作为项目标题)。以下是他们如何构建它以及发现了什么,简单解释如下:

1. 配方:他们如何制作数据

作者没有雇佣人类来标注书籍,而是构建了一个“机器人厨师”来烹制数据。

  • 食材(DBpedia): 他们从一个名为 DBpedia 的大型数字百科全书开始。他们提取了一份真实名称列表——人物、地点和组织。为了确保机器人不会仅仅死记硬背著名名字,他们混入了用梵文脚本书写的现代外国名字(如"Giacomo Libera")。这迫使计算机学习梵文语法的规则,而不仅仅是识别著名面孔。
  • 厨师(AI 模型): 他们使用了一个非常智能的、拥有 240 亿参数的 AI 模型(一种“混合推理模型”),该模型专门针对理解印度语言进行了训练。
  • 烹饪过程: 他们没有强迫 AI 使用僵硬的、预先写好的句子模板(如“罗摩去了森林”),而是要求 AI 自然地将这些名字编织进句子中。这使得 AI 能够生成成千上万句独特的、语法正确的句子,其中名字以不同的语法形式出现(这在梵文中非常常见)。
  • 质量控制: 他们对输出结果进行了过滤,以捕捉明显的错误。结果如何?102,942 句“银标准”数据。“银”意味着它不完美(像“金”那样),但质量足以有效地训练计算机。

2. 实验:两名不同的学生

为了测试这个新数据集是否有效,他们训练了两台不同的计算机模型来寻找这些名字:

  1. 巨型多语言学生(XLM-RoBERTa): 这是一个庞大的模型,能讲多种语言。它就像一个读过一点点所有东西但并非梵文专家的学生。
  2. 紧凑专家(IndicBERTv2): 这是一个更小、更轻的模型,专门针对印度语言设计。它就像一个毕生都在研究该地区特定方言和文字的学生。

3. 结果:大小并非一切

当他们在新的数据集上测试这两名学生时,专家(IndicBERTv2)获胜了,尽管它要小得多。

  • 分数: 专家得分为0.96,而巨型多语言学生得分为0.95
  • 真正原因(“断裂”问题): 论文发现了一个有趣的原因,解释了为什么巨人输了。梵文单词通常像胶水一样粘在一起(这种特征称为连音,sandhi)。
    • 想象一下,“在俱卢之野”这个词是一个长长的、融合在一起的单词。
    • 专家看到了整个单词,并正确地说:“这是一个地方。”
    • 巨人试图将单词切碎,因为它的词典并非为梵文构建。它将第一部分视为“地方”,但将微小的结尾部分视为一个单独的、令人困惑的单词,它错误地猜测这是一个“组织”。

类比: 这就像试图阅读一个单词之间空格被擦除的句子。专家对语言足够了解,能够猜出单词在哪里断开。巨人习惯了英语的空格,感到困惑,并在错误的位置拆分单词,从而导致错误。

4. 结论

论文总结道,对于像梵文这样古老而复杂的语言:

  • 合成数据有效: 如果你小心操作,可以使用 AI 生成训练数据,从而节省数千小时的人工标注。
  • 合适的工具比最大的工具更重要: 一个理解特定文字和语法的较小模型(IndicBERTv2)的表现优于一个巨大的通用模型(XLM-RoBERTa),因为它没有错误地拆分单词。

简而言之,他们为梵文命名实体识别构建了一个庞大的、AI 生成的训练手册,并证明了一个专门的、较小的计算机大脑比一个巨大的、通用的大脑更擅长阅读这种古老语言。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →