Automatic Annotation of Ancient Greek Vowel Length
本文介绍了首个通用的、基于规则的古希腊语长短音标注器,该工具能够利用形态上下文自动标注双元字母中的元音长度,并证明其输出能有效训练字符级 Transformer 模型,使其在诗歌和散文上均达到高准确率,同时提升下游韵律任务的表现。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象你是一名侦探,正试图破解一个失落了两千年的代码。这个代码是古希腊语,这种语言曾赋予我们哲学、戏剧以及西方科学的基石。但这里有一个转折:书写这些文本的古代抄写员并没有使用完整的音标字母表——他们有三个特定字母(alpha, iota, ypsilon)的“短”版本和“长”版本,但在纸面上他们并不把它们写得不同。这就像如果英语有两种版本的“a”(一种像“cat”里的短音,一种像“father”里的长音),但我们却把它们都只写成“a”。为了理解诗歌、语法和含义,你必须弄清楚原本意图的是哪种“a”。这不仅仅是一场拼写比赛;在古希腊语中,弄错长度可能会让一个词从动词变成名词,或者把一个疑问句变成一个命令句。几十年来,试图阅读这些文本的计算机一直陷入困境,因为它们无法分辨其中的区别。不知道长度的计算机,就像一个试图演奏乐曲却不知道哪些音符该长拉、哪些该短促的音乐家。
这就是“古希腊语元音长度自动标注”故事的开端。作者 Albin Thörn Cleland 和 Eric Cullhed 正在解决一个被称为“加长号标注”(macronizing)的问题。你可以把加长号标注想象成在字母上方添加一些小小的音乐标记(比如一条长横线或一个小帽子),来告诉计算机:“拉长这个音”或“快速读过”。挑战是巨大的:有数百万种词形,而决定一个字母是长是短的规则取决于极其复杂的因素——词义、构词方式、方言、时代,甚至是诗歌中的节奏。这是一个“长尾问题”,意味着存在如此多的罕见且奇特的案例,以至于简单的规则列表无法涵盖所有情况。研究人员想知道:我们能否构建一个自动完成此项工作的计算机程序?如果我们做到了,它是否真的能帮助计算机更好地理解希腊语?
侦探的工具箱:规则与递归
团队首先构建了一个“基于规则的加长号标注器”。想象这是一个非常严谨、知识渊博的图书管理员,他背诵了数千本语法书和词典。这位图书管理员遵循一套特定的指令:“如果单词看起来像这样并且以那个结尾,那么元音必须是长的。”如果图书管理员不能百分之百确定,他们宁愿留白也不愿猜测。
他们向这位图书管理员输入了一个包含 4000 万个单词的庞大古希腊语文本库。这位图书管理员的表现令人惊讶地好,成功识别了大约 69% 的棘手字母。但这位图书管理员有一个弱点:他们太谨慎了。如果一个单词很罕见,或者不符合他们完美的规则手册,他们就会直接放弃并留白。他们无法像人类那样利用上下文线索来填补空白进行“猜测”。
学习如何猜测的学生
为了解决图书管理员的犹豫不决,作者尝试了一个聪明的办法。他们将图书管理员的工作——即那 69% 确定的单词——作为“教科书”,用来训练一名新的学生:一个被称为“字符级 Transformer”的小型人工智能。
把这个 AI 学生想象成一位才华横溢的学徒,观察着图书管理员的工作。学徒从图书管理员的正确答案中学习,同时也接受训练去观察字母本身,逐个观察,从而发现图书管理员错过的模式。这里的关键技巧是,学徒被告知要忽略那些图书管理员不确定的部分。这防止了学徒习得图书管理员的疑虑;相反,学徒学会了泛化,学会了观察单词的形态并说:“我敢打赌这个是长的”,即使图书管理员对此没有规则。
结果令人印象深刻。虽然严谨的图书管理员覆盖了约 70% 的字母,但 AI 学徒覆盖了近 99.7%。更重要的是,学徒并没有胡乱猜测;在处理最难的案例时,它的准确度比图书管理员更高。当在经过人工校验的金标准基准测试中进行测试时,该 AI 的准确率超过了 92%,证明它能够超越单纯遵循死板规则,学会掌握语言的“感觉”。
为什么这很重要:扫描节奏
研究人员并没有停留在仅仅标注字母上;他们想看看这种新技能是否真的有助于计算机执行其他任务。他们在“格律分析”(scansion)上进行了测试,即分析诗歌节奏的艺术。在古希腊诗歌中,节奏完全取决于一个音节是“重”的(长)还是“轻”的(短)。
他们拿出一个旨在阅读诗歌的计算机程序,并给了它两个相同文本的版本:一个带有新的元音长度标记,另一个则没有。结果如何?获得“加长号标注”文本的程序在识别正确节奏方面的表现提升了约 5.8%。这在计算机科学领域是一个显著的飞跃。这表明,教给计算机语言隐藏的音乐性,能让它更好地理解诗歌的结构。
细则说明
当然,这并不是解决一切问题的魔杖。作者非常明确地指出了局限性。他们的系统目前是针对“爱琴式”(Attic)希腊语(雅典的方言)进行调优的。如果你向它输入来自其他地区或稍晚时期的诗歌,它可能会在长度标注上出错,因为它是在将“爱琴式规则”应用于非爱琴式的单词。这就像是用纽约口音指南来教别人如何说南方口音一样;它可能对某些词有效,但会对另一些词出错。
此外,AI 学生是从图书管理员的教科书中学习的。如果图书管理员在规则上犯了错,学生也会习得这些错误。该系统的表现取决于其构建时所使用的规则和数据。然而,作者已经向所有人开放了他们的工具、数据和基准测试。这意味着其他研究人员现在可以接过这个“学徒”,用更好的教科书来训练它,并或许有一天能破解所有方言和时代的古希腊语代码,将一种沉默、模糊的剧本重新变为一种完全可听、富有节奏的语言。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。