From Traditional Taggers to LLMs: A Comparative Study of POS Tagging for Medieval Romance Languages
本文呈现了一项系统的实证研究,表明大型语言模型,特别是在经过微调或通过跨语言迁移学习加以利用时,在奥克语、加泰罗尼亚语和法语等资源匮乏的中世纪罗曼语族的词性标注任务中,显著优于传统方法。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图阅读一个由三种不同的中世纪语言写成的古籍图书馆:中世纪奥克语、中世纪加泰罗尼亚语和中世纪法语。这些不仅仅是现代语言的古老版本;它们更像是狂野、未驯服的表亲。拼写随页而变(有时“火”写作 fuoc,有时写作 foc),语法复杂,且几乎没有词典或教师可供参考以帮助你理解它们。
本文的目标是教导计算机如何为这些书中的每个单词标注其“词性”(如名词、动词或形容词)。这个过程被称为词性标注(POS tagging)。它是计算机真正理解故事、进行翻译或分析其历史之前必不可少的第一步。
研究人员提出了这样一个问题:现代“超级智能”人工智能(大型语言模型或 LLM)能否比我们一直使用的旧式传统工具更好地完成这项工作?
以下是他们实验的分解说明,通过简单的类比进行解释:
1. 参赛选手
该研究在两类“标注器”之间展开了一场竞赛:
- 旧卫队(传统标注器): 将它们想象成循规蹈矩的图书管理员。他们拥有一套基于现代语言的严格规则手册。他们试图通过观察单词的形态并将其与已知模式进行比较来猜测单词的词性。它们快速且廉价,但当拼写怪异或单词生僻时,它们很容易陷入困惑。
- 新挑战者(LLM): 它们就像是博闻强记的语言天才,几乎读过所有写过的东西。它们不仅遵循规则,还能理解语境。它们可以审视一个句子并“感觉”出某个单词可能是什么,即使拼写很怪异。
2. 训练方法(如何教导 AI)
研究人员并没有让 AI 仅仅靠猜测;他们尝试了不同的教导方式:
- 零样本(“冷读”): 他们给 AI 一个提示,说“你是一位专家。这里有一个单词,告诉我它的词性”,而没有向它展示任何示例。这就像要求一名游客在不给短语手册的情况下翻译菜单。
- 少样本(“小抄”): 他们先给 AI 一个极小的示例列表(例如,“这个词是名词,这个词是动词”)。这就像在游客开始之前递给他们几个关键短语。
- 微调(“学徒制”): 他们让 AI 专门针对中世纪文本进行训练。这就像雇佣那名游客作为实习生一个月,只研究这些特定的书籍。
- 跨语言迁移(“语言家族聚会”): 这是最有趣的部分。他们用混合语言训练 AI。例如,他们同时用加泰罗尼亚语和奥克语训练它,然后在奥克语上测试它。这就像教某人西班牙语和意大利语,然后观察他们是否能因为语言之间的关联性而更好地理解葡萄牙语。
3. 结果:谁赢了?
结果很明确,但也有一些有趣的转折:
- AI 获胜: 在几乎所有情况下,现代 AI(LLM)都击败了基于规则的旧工具。“博闻强记的语言天才”比“循规蹈矩的图书管理员”更能处理混乱、怪异的拼写。
- 训练至关重要: 当 AI 真正在数据上进行训练(微调)而不仅仅是猜测时,表现最佳。
- 混合语言的“金发姑娘”原则:
- 对于最小、最困难的数据集(中世纪奥克语): 当 AI 同时学习所有三种语言(三语)时,学习效果最好。这就像学生需要听到所有相关的方言,最终才能理解那个棘手的语言。
- 对于医学文本(中世纪法语): 当 AI 仅与加泰罗尼亚语配对(双语)时,表现最佳。添加第三种语言实际上使其表现略有下降。这就像学生学习法语;有时添加第三种语言(如西班牙语)会有所帮助,但有时专注于最亲近的亲属语言(意大利语/加泰罗尼亚语)对于特定、微小的任务更有效。
4. 获胜背后的“原因”
研究人员发现,AI 特别擅长推断具有意义和语境的单词,如形容词、副词和代词。旧工具在这些方面表现挣扎,因为它们依赖僵化的规则。然而,AI 可以审视整个句子并说:“啊,这个词修饰名词,所以它必须是形容词”,即使拼写很怪异。
5. 局限(“陷阱”)
该论文诚实地说明了它没有做到的事情:
- 成本: “博闻强记的语言天才”(大型 AI 模型)运行成本高昂,需要强大的计算机。旧工具则是免费且快速的。
- 数据规模: 数据集的大小差异很大(一个有 2,000 个单词,另一个有 59,000 个)。研究人员无法完美区分 AI 表现良好是因为语言本身,还是仅仅因为它有更多的数据可供学习。
- 特异性: 他们只测试了这三种语言。我们尚不知道这是否适用于其他与罗曼语族无关的古代语言。
结论
本文证明,对于阅读混乱的中世纪古籍,现代 AI 是一种强大的新工具。它不仅仅取代了旧方法,而且显著改进了它们,特别是当你通过混合相关语言来教导它时。然而,并没有一种“放之四海而皆准”的策略。有时你需要混合所有语言,有时你需要只专注于两种语言,这取决于你试图阅读的具体文本。
对于历史学家和数字人文学者而言,这意味着我们现在可以构建更好的工具,自动整理和理解数千年的文学作品,而这些作品以前因为过于混乱而无法被计算机处理。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。