moBERTo: A Modern Encoder for Portuguese via Continued Pretraining of ModernBERT
该论文介绍了 moBERTo,这是一个通过在 600 亿个 token 上继续预训练 ModernBERT 而构建的高性能葡萄牙语仅编码器模型,它在检索、分类和命名实体识别(NER)任务中取得了最先进的结果,同时证明了持续预训练在保持长上下文能力方面优于从头开始训练。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你拥有一位才华横溢、受过高等教育的图书管理员,他精通英语,读过 2 万亿本书。这位管理员速度极快,能记住长篇故事而不产生混乱,而且非常擅长寻找特定事实或按主题对书籍进行分类。然而,他完全不会说葡萄牙语。
这篇论文介绍了一个名为 moBERTo 的项目,该项目通过给这位讲英语的图书管理员进行“速成班”培训,使他能够有效地在巴西图书馆工作。
以下是他们是如何做的,以及他们的发现,用简单的语言解释如下:
1. 策略:“持续预训练”(不要从头开始)
与其重新雇佣一名新的图书管理员并从头开始教他所有知识(这会耗费大量时间且成本高昂),团队采取的方法是让这位现有的英语专家阅读了 600 亿个葡萄牙语单词(大约相当于 5 年份的阅读材料)。
- 类比: 想想看,就像把一位精通法国料理的大厨交给一大叠葡萄牙语食谱去学习。他不会忘记如何烹饪;他只是学习如何将他的技能应用到新的食材上。
- 结果: 这比从头开始训练一个新模型要好得多。这位“旧”图书管理员保留了他的超能力(比如记住长篇故事的能力),同时学会了新的语言。
2. 工具包:现代升级
他们起初使用的图书管理员并非普通的模型,而是使用了 ModernBERT。这是经典图书助理的“下一代”版本。
- 旧图书管理员(如 BERTimbau): 一次只能阅读 512 个单词就会感到困惑。他们使用陈旧、笨拙的方法来记忆自己在句子中的位置。
- moBERTo: 可以一次阅读多达 8,192 个单词 而不会迷失方向。它利用“闪电”般的速度和聪明的注意力机制,轻松处理长文档。
3. 实验:尝试不同的教学方法
研究人员尝试了几种不同的方式来教授这位图书管理员葡萄牙语,以观察哪种方法最有效:
方法 A:“原始字典”(原始分词器/Original Tokenizer)
他们使用原始的英语字典来教授图书管理员,只是在合适的地方替换为葡萄牙语单词。- 结果: 这在阅读长文档方面表现得惊人地好,因为图书管理员的“记忆地图”保持完整。
方法 B:“新字典”(葡萄牙语分词器/Portuguese Tokenizer)
他们给了图书管理员一本专门为葡萄牙语构建的新字典。- 结果: 这在识别句子中的名称等小任务上表现出色。然而,在阅读非常长的文本时,它会让图书管理员感到困惑,导致其迷失方向。
方法 C:“混合桥梁”(子词匹配/Subword-Matching)
这是获胜的策略。他们构建了一个新的葡萄牙语字典,但使用了一个特殊的“桥梁”将新单词连接到图书管理员原有的英语记忆中。- 结果: 这让他们兼得了两者的优点。图书管理员既能理解葡萄牙语的细微差别,又能保持其长文本记忆的超能力。
4. 结果:谁赢了?
团队在各种任务上测试了 moBERTo,例如寻找特定文档、对新闻文章进行分类以及识别文本中的名称。
- 冠军: moBERTo-SWM-8k 模型(拥有“混合桥梁”和额外长篇故事训练的模型)是明显的赢家。
- 它在寻找相关文档方面击败了之前的冠军(BERTimbau)。
- 它在理解葡萄牙语文本含义方面表现最佳。
- 它在识别句子中的姓名和地点方面非常出色。
- 长篇故事的惊喜: 尽管图书管理员主要是在短篇故事(1,024 个单词)上接受的训练,但他仍然能比任何其他葡萄牙语模型更好地阅读和理解长达 8,000 词的巨型文档。这证明了“现代”架构是非常强大的。
5. 总结
论文得出结论,你不需要从头开始构建一个庞大且昂贵的模型就能获得出色的效果。通过采用一个现代、高效的英语模型,并使用大量的优质葡萄牙语数据对其进行“微调”,你可以得到一个满足以下条件的模型:
- 比起大型聊天机器人,运行起来更快、更便宜。
- 比起旧的葡萄牙语模型,在寻找信息和理解文本方面更聪明。
- 有能力阅读非常长的文档而不会迷失方向。
该团队已经分享了他们的“图书管理员”(模型权重)和“图书资料库”(训练数据),供任何人使用,希望能帮助全世界的葡萄牙语使用者构建更好的 AI 工具。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。