← 最新论文
💻 computer science

AfriScience-MT: Towards Decolonizing Science in Africa through Text Translation

本文介绍了 AfriScience-MT,这是一个通过专家翻译和术语开发创建的涵盖六种非洲语言的科学文本平行语料库,用于评估机器翻译系统,并证明在将这些语言的科学内容翻译成目标语言时,闭源模型目前优于开源替代方案。

原作者: Idris Abdulmumin, Tajuddeen Gwadabe, Shamsuddeen Hassan Muhammad, David Ifeoluwa Adelani, Nomonde Khalo, Ibrahim Said Ahmad, Abiodun Modupe, Anina Mumm, Sibusiso Biyela, Michelle Rabie, Johanna Havema
发布于 2026-05-29
📖 1 分钟阅读☕ 轻松阅读

原作者: Idris Abdulmumin, Tajuddeen Gwadabe, Shamsuddeen Hassan Muhammad, David Ifeoluwa Adelani, Nomonde Khalo, Ibrahim Said Ahmad, Abiodun Modupe, Anina Mumm, Sibusiso Biyela, Michelle Rabie, Johanna Havemann, Marek Rei, Jade Abbott, Vukosi Marivate

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

核心理念:为非洲语言解锁科学图书馆

将全球科学知识想象成一座庞大、高科技的图书馆。目前,这座图书馆中的大多数书籍都是用“殖民语言”(如英语、法语和葡萄牙语)写成的。尽管非洲有数百万人讲豪萨语、约鲁巴语或祖鲁语,但他们却被拒之门外,因为他们无法阅读这些书籍。

本文介绍的AfriScience-MT项目,旨在为这座图书馆搭建一座桥梁。作者希望验证是否能够将复杂的科学论文翻译成六种主要的非洲语言,从而使当地社区最终能够用自己的语言获取这些知识。

问题:缺失的词汇

如果目标语言中没有“光合作用”或“病毒突变”等词汇,你就无法逐字翻译一本书。作者发现,非洲语言往往缺乏标准化的科学术语。这就像试图向一个只见过石锤的人描述智能手机一样;你必须发明新的方式来描述它。

解决方案:一本新的“词典”和一个翻译团队

为了解决这个问题,团队并没有仅仅依赖计算机进行翻译。他们建立了一个由人力驱动的流水线:

  1. 简化者:首先,专家科学传播者将 230 篇真实的科学论文改写为“通俗摘要”。这就像将一份冗长、50 页的法律合同转化为任何人都能理解的、友好的 3 页信件。
  2. 翻译者:专业翻译人员随后将这些摘要翻译成六种非洲语言(阿姆哈拉语、豪萨语、卢干达语、北索托语、约鲁巴语和祖鲁语)。
  3. 创造者:关键在于,当某种语言中不存在某个科学术语时,翻译人员和专家会合作创造新术语。他们为每种语言构建了一个双语术语表(一种专门的词典)。

最终成果是AfriScience-MT,这是一个庞大的平行语料库(一侧是英语,另一侧是非洲语言),涵盖了健康、农业和计算机科学等 11 个科学领域。

实验:谁是最佳翻译者?

作者利用这个新数据集测试了不同的“翻译者”。他们比较了:

  • 开源模型:任何人都可以下载和运行的免费 AI 模型(如 NLLB、Llama 和 Gemma)。
  • 闭源模型:大型科技公司提供的强大、付费的 AI 模型(如 GPT-5.4 和 Gemini-3.1-Flash-Lite)。

他们通过三种方式测试了这些模型:

  • 零样本(Zero-Shot):要求 AI 在不提供任何示例的情况下进行翻译。
  • 少样本(Few-Shot):先给 AI 一些示例让其学习,然后再进行翻译。
  • 微调(Fine-Tuned):选取一个较小的 AI 模型,专门针对这个新的非洲科学数据集进行训练。

结果:什么效果最好?

1. “专家”胜过“通才”
最大的惊喜是,一个经过微调的较小专用模型(NLLB-1.3B),在特定的非洲科学数据上表现几乎与庞大、昂贵、闭源的巨头模型(GPT-5.4 和 Gemini)一样好。

  • 类比:想象一位通晓万事但样样稀松的全科医生,与一位只研究过非洲医疗病例的专科医生。尽管专科医生规模较小,但他们比全科医生更了解当地方言和具体症状。

2. “大”模型依然获胜(但优势微弱)
最新、最昂贵的闭源模型(GPT-5.4 和 Gemini-3.1-Flash-Lite)确实赢得了比赛,但优势微乎其微。它们在理解整篇文档的连贯性方面略胜一筹。然而,在非洲数据上经过微调的开源模型紧随其后,实际上击败了旧有的昂贵模型。

3. “更多数据”并不总是更好
团队尝试混入一般新闻数据(如报纸头条),看看是否有助于 AI 更好地学习。结果并非如此。事实上,这让情况变得更糟。

  • 类比:如果你正在训练一位厨师烹饪一道特定的地方菜肴,给他一本随机国际食谱的烹饪书只会让他感到困惑。他需要专注于那道菜特有的食材和技巧。只有“领域内”的科学数据才是至关重要的。

4. 方向很重要
AI 从非洲语言翻译成英语始终比反过来翻译更容易。这可能是因为 AI 模型最初是在更多的英语数据上训练的,因此它们在英语中“思考”得更流畅。

结论

这篇论文证明,要将科学翻译成非洲语言,并不需要最大、最昂贵的超级计算机。如果你拥有高质量、专业化的数据(如他们创建的摘要和术语表),并在此基础上训练一个较小的开源模型,你就能获得媲美最强大的专有系统的结果。

这是“去殖民化”科学的一步:确保科学知识不仅仅被语言障碍所封锁,而是变得可获取、可理解,并由其旨在服务的社区所拥有。作者已将其数据集、术语表和模型向公众发布,以便他人能在此基础上继续推进这项工作。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →