← 最新论文
💬 NLP

moBERTo: A Modern Encoder for Portuguese via Continued Pretraining of ModernBERT

该论文介绍了 moBERTo,这是一个通过在 600 亿个 token 上继续预训练 ModernBERT 而构建的高性能葡萄牙语仅编码器模型,它在检索、分类和命名实体识别(NER)任务中取得了最先进的结果,同时证明了持续预训练在保持长上下文能力方面优于从头开始训练。

原作者: Thiago Laitz, Thales Sales Almeida, João Guilherme Alves Santos, Giovana Kerche Bonás

发布于 2026-06-23
📖 1 分钟阅读☕ 轻松阅读

原作者: Thiago Laitz, Thales Sales Almeida, João Guilherme Alves Santos, Giovana Kerche Bonás

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你拥有一位才华横溢、受过高等教育的图书管理员,他精通英语,读过 2 万亿本书。这位管理员速度极快,能记住长篇故事而不产生混乱,而且非常擅长寻找特定事实或按主题对书籍进行分类。然而,他完全不会说葡萄牙语。

这篇论文介绍了一个名为 moBERTo 的项目,该项目通过给这位讲英语的图书管理员进行“速成班”培训,使他能够有效地在巴西图书馆工作。

以下是他们是如何做的,以及他们的发现,用简单的语言解释如下:

1. 策略:“持续预训练”(不要从头开始)

与其重新雇佣一名新的图书管理员并从头开始教他所有知识(这会耗费大量时间且成本高昂),团队采取的方法是让这位现有的英语专家阅读了 600 亿个葡萄牙语单词(大约相当于 5 年份的阅读材料)。

  • 类比: 想想看,就像把一位精通法国料理的大厨交给一大叠葡萄牙语食谱去学习。他不会忘记如何烹饪;他只是学习如何将他的技能应用到新的食材上。
  • 结果: 这比从头开始训练一个新模型要好得多。这位“旧”图书管理员保留了他的超能力(比如记住长篇故事的能力),同时学会了新的语言。

2. 工具包:现代升级

他们起初使用的图书管理员并非普通的模型,而是使用了 ModernBERT。这是经典图书助理的“下一代”版本。

  • 旧图书管理员(如 BERTimbau): 一次只能阅读 512 个单词就会感到困惑。他们使用陈旧、笨拙的方法来记忆自己在句子中的位置。
  • moBERTo: 可以一次阅读多达 8,192 个单词 而不会迷失方向。它利用“闪电”般的速度和聪明的注意力机制,轻松处理长文档。

3. 实验:尝试不同的教学方法

研究人员尝试了几种不同的方式来教授这位图书管理员葡萄牙语,以观察哪种方法最有效:

  • 方法 A:“原始字典”(原始分词器/Original Tokenizer)
    他们使用原始的英语字典来教授图书管理员,只是在合适的地方替换为葡萄牙语单词。

    • 结果: 这在阅读长文档方面表现得惊人地好,因为图书管理员的“记忆地图”保持完整。
  • 方法 B:“新字典”(葡萄牙语分词器/Portuguese Tokenizer)
    他们给了图书管理员一本专门为葡萄牙语构建的新字典。

    • 结果: 这在识别句子中的名称等小任务上表现出色。然而,在阅读非常长的文本时,它会让图书管理员感到困惑,导致其迷失方向。
  • 方法 C:“混合桥梁”(子词匹配/Subword-Matching)
    这是获胜的策略。他们构建了一个新的葡萄牙语字典,但使用了一个特殊的“桥梁”将新单词连接到图书管理员原有的英语记忆中。

    • 结果: 这让他们兼得了两者的优点。图书管理员既能理解葡萄牙语的细微差别,又能保持其长文本记忆的超能力。

4. 结果:谁赢了?

团队在各种任务上测试了 moBERTo,例如寻找特定文档、对新闻文章进行分类以及识别文本中的名称。

  • 冠军: moBERTo-SWM-8k 模型(拥有“混合桥梁”和额外长篇故事训练的模型)是明显的赢家。
    • 它在寻找相关文档方面击败了之前的冠军(BERTimbau)。
    • 它在理解葡萄牙语文本含义方面表现最佳。
    • 它在识别句子中的姓名和地点方面非常出色。
  • 长篇故事的惊喜: 尽管图书管理员主要是在短篇故事(1,024 个单词)上接受的训练,但他仍然能比任何其他葡萄牙语模型更好地阅读和理解长达 8,000 词的巨型文档。这证明了“现代”架构是非常强大的。

5. 总结

论文得出结论,你不需要从头开始构建一个庞大且昂贵的模型就能获得出色的效果。通过采用一个现代、高效的英语模型,并使用大量的优质葡萄牙语数据对其进行“微调”,你可以得到一个满足以下条件的模型:

  1. 比起大型聊天机器人,运行起来更快、更便宜
  2. 比起旧的葡萄牙语模型,在寻找信息和理解文本方面更聪明
  3. 有能力阅读非常长的文档而不会迷失方向。

该团队已经分享了他们的“图书管理员”(模型权重)和“图书资料库”(训练数据),供任何人使用,希望能帮助全世界的葡萄牙语使用者构建更好的 AI 工具。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →