← 最新论文
💻 computer science

Swa-bhasha Resource Hub: Romanized Sinhala to Sinhala Transliteration Systems and Data Resources

本文介绍了 Swa-bhasha 资源中心,这是一个公开访问的平台,提供 2020 年至 2025 年间开发的罗马化僧伽罗语到僧伽罗语转写的综合数据与算法集合,并附带对现有工具的对比分析,以推动僧伽罗语自然语言处理的发展。

原作者: Deshan Sumanathilaka, Sameera Perera, Sachithya Dharmasiri, Maneesha Athukorala, Anuja Dilrukshi Herath, Rukshan Dias, Pasindu Gamage, Ruvan Weerasinghe, Y. H. P. P. Priyadarshana

发布于 2026-04-28
📖 1 分钟阅读☕ 轻松阅读

原作者: Deshan Sumanathilaka, Sameera Perera, Sachithya Dharmasiri, Maneesha Athukorala, Anuja Dilrukshi Herath, Rukshan Dias, Pasindu Gamage, Ruvan Weerasinghe, Y. H. P. P. Priyadarshana

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,僧伽罗语是一座美丽而错综复杂的花园。几十年来,斯里兰卡的人们一直试图用一套不同的钥匙——英语键盘——进入这座花园。由于手头没有僧伽罗语键盘,他们开始用英文字母输入僧伽罗语的发音。他们称这种方式为“辛格利什”(罗马化僧伽罗语)。

将辛格利什视为一种秘密代码拼写错误的方言。它快速且方便,但杂乱无章。一个单词如"Adaraya",根据上下文的不同,可能意味着“爱”或“援助”。这就像你输入了"bat",它既可能指动物,也可能指运动器材,或者是一个动词,而如果没有阅读整个句子,计算机根本无法知道你的意图。

本文是斯瓦 - 巴沙(Swa-bhasha)团队的一份成绩单和工具箱,该团队历经数年,致力于搭建一座桥梁,帮助计算机理解这种杂乱的代码,并将其还原为正确、优美的僧伽罗语。

以下是他们构建的内容,简单解释如下:

1. 问题:“翻译丢失”游戏

团队发现,虽然计算机擅长将英语翻译成法语,但在处理“辛格利什”到僧伽罗语的翻译时却显得力不从心。

  • 混乱之处:人们的输入方式各不相同。有些人省略元音(例如将"kalana"写成"klna"),有些人使用英语拼写规则,还有些人在同一句话中混合使用英语和僧伽罗语词汇。
  • 歧义性:最大的难题在于,一个输入的单词可能具有多种含义。计算机需要像侦探一样,找出哪种含义符合故事背景。

2. 工具箱:他们是如何解决的

团队并非只构建了一个工具,而是建立了一个拥有不同机器的完整车间,每一代都比前一代更智能。

  • 规则书机器人(Swa Bhasha 1.0):

    • 工作原理:想象一个遵循严格说明书的机器人。如果它看到"k",就知道后面需要一个元音。它使用“模糊”搜索(类似于猜测的拼写检查器)在词典中寻找最接近的匹配项。
    • 结果:表现尚可,但当人们打破规则(例如省略元音)时,它就显得力不从心了。
  • 混合侦探(Swa Bhasha 2.0 与 N-gram 模型):

    • 工作原理:他们将规则书机器人与“统计侦探”相结合。这位侦探通过查看数百万个句子来学习模式。它使用“前缀树”(Trie,一种智能树状结构)来建议单词,就像手机的自动补全功能,但是针对僧伽罗语的。
    • 结果:在猜测正确单词方面有了很大改善,但在处理非常棘手的句子时仍会感到困惑。
  • 超级读者(BERT 与 Transformer):

    • 工作原理:这是团队的“超级读者”。它不再仅仅查看单个单词,而是像人类一样,一次性阅读整个句子并理解上下文。他们使用了一个名为 BERT 的强大人工智能模型(这就像是一个阅读了整个僧伽罗语互联网文本的大脑)。
    • 技巧:当人工智能看到一个令人困惑的单词时,它会在这个词上加上一个“掩码”,并问道:“基于这个词前后的单词,这里最适合填入什么词?”
    • 结果:这是冠军。它比任何先前的方法都更好地解决了歧义问题,在测试中实现了近乎完美的准确率。
  • 代码混合专家:

    • 工作原理:人们经常在一个句子中混合英语和僧伽罗语(例如,"I went to the kade [商店]")。团队构建了一个特殊模型,它就像一个精通双语的翻译,能够处理这种混合情况而不感到困惑。

3. 图书馆:他们收集的数据

没有书籍就无法教孩子阅读,没有数据也无法训练人工智能。团队意识到没有好的“教科书”来教授辛格利什,于是他们自己编写了教科书。

  • “斯瓦 - 巴沙”图书馆:他们从现实生活中(如 YouTube 评论和社交媒体)收集了超过700 万个单词和数千个句子。这就像收集了每一位斯里兰卡人写下的所有杂乱笔记,以此教导计算机人们实际上是如何输入的。
  • “歧义”测试:他们创建了一个特殊的测验,其中每个单词都有两个含义。他们用这个测验来测试他们的人工智能,看它能否根据故事背景选出正确的含义。
  • “代码混合”合集:他们收集了人们混合英语和僧伽罗语的例子,这是一种非常普遍的习惯,此前一直被研究人员忽视。

4. 结果:谁赢得了比赛?

团队将他们开发的工具与其他方法(如谷歌的工具或基于旧规则的系统的)进行了测试。

  • 旧方法:旧的基于规则的系统就像一位僵化的老师;当学生打破规则时,它们就会失败。
  • 新方法:新的“超级读者”(基于 BERT 的)模型就像一位智慧的导师。它们理解上下文,几乎每次都能给出正确答案。
  • 得分:在测试中,他们最好的模型获得了**91%**的分数(BLEU 分数),错误极少,而旧模型则犯了更多的错误。

5. 接下来是什么?

团队目前正在开发预测文本功能。想象一下,一个键盘不仅能翻译你输入的内容,还能猜测你接下来要输入的内容,即使你正在以一种杂乱、个性化的风格输入。他们使用了一种特殊的学习技术(元学习),以便键盘能够快速学习特定的输入习惯,而无需将你的私人数据存储在服务器上。

总结

斯瓦 - 巴沙团队在斯里兰卡人在英语键盘上杂乱、非正式的输入方式与正式、优美的僧伽罗语文字之间架起了一座桥梁。他们从简单的规则书开始,过渡到统计侦探,最终构建了一个理解上下文的“超级读者”人工智能。他们还建立了训练这些人工智能所需的海量数据图书馆。他们的工作证明,只要有合适的工具,即使是像僧伽罗语这样资源匮乏的语言,也能被计算机完美理解,即使人们是在匆忙中输入的。

重要提示:本文严格专注于文本翻译技术及其训练所用数据。它并未声称具有医疗应用、临床用途,或除已发布的科研工具和开源代码之外的特定未来产品。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →