Should We Still Pretrain Encoders with Masked Language Modeling?
通过大量受控实验,本文证明:尽管掩码语言建模(MLM)通常能生成更优质的文本表示,但在固定计算预算下,采用先进行因果语言建模(CLM)再进行掩码语言建模(MLM)的两阶段预训练策略可实现最优性能,尤其是在利用现有预训练 CLM 模型时。
原始论文根据 CC0 1.0(http://creativecommons.org/publicdomain/zero/1.0/)发布到公有领域。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在教机器人如何理解人类语言。多年来,标准方法是玩“填空”游戏。你向机器人展示一个句子,其中隐藏了一些词语(被掩码),并让它根据缺失位置之前和之后的词语来猜测这些词是什么。这被称为掩码语言建模(MLM)。这就像 crossword 谜题,你可以从两个方向获得线索。
最近,一种新方法变得流行起来:教机器人像短信自动补全一样,一次一个词地预测句子中的下一个词。这被称为因果语言建模(CLM)。这就像读故事并猜测接下来会发生什么,但你不能提前窥视。
这篇论文提出的核心问题是:“我们是否还需要教机器人采用旧的‘填空’方式,还是新的‘预测下一个词’方式实际上更好?”
以下是研究人员发现的成果,通过简单的类比进行解释:
1. “专家”与“通才”
研究人员使用这两种方法训练了 38 个不同的机器人“大脑”(规模从小型到超大型不等)。
- MLM 机器人(专家): 当仅通过“填空”游戏进行训练时,这个机器人成为了理解句子完整语境的专家。它在回答复杂问题或分类文本情绪等任务上表现最佳。这就像一名侦探,可以从各个角度审视犯罪现场以破案。
- CLM 机器人(通才): 当仅通过“预测下一个词”游戏进行训练时,这个机器人在某些方面(如在文本中查找特定名称)表现得令人惊讶地出色,并且学习速度非常快。然而,它在需要深度双向理解句子的任务上表现较为吃力。
结论: “填空”(MLM)方法仍然是构建最佳文本全面理解能力的王者。仅靠“预测下一个词”(CLM)方法还不足以打造出最佳的“编码器”(将文本转化为意义的工具)。
2. “快速起步”优势
这里变得有趣起来。CLM 机器人在初期学习速度快得多。
- 类比: 想象两个为马拉松做准备的学生。
- 学生 A(MLM) 缓慢而稳定地学习,建立深厚的基础。他们起步慢,但后期变得非常强大。
- 学生 B(CLM) 立即开始奔跑,并迅速变得强壮。在最初的几英里,他们领先于学生 A。
- 发现: 如果你提前停止训练(因为时间或资金有限),CLM 机器人实际上非常有竞争力。它更具“数据效率”,意味着用更少的训练时间就能获得良好的结果。
3. “稳固的基础”
研究人员还发现,CLM 机器人更容易进行微调(针对特定任务进行调整)。
- 类比: 将 CLM 机器人想象成建在非常坚固、平坦的混凝土板上的房子。在上面建造特定的房间(例如针对特定任务的厨房)很容易,而不会导致房子摇晃。
- MLM 机器人虽然整体更强,但在尝试针对特定任务进行调整时,表现得稍微有些“不稳”。它需要更细致的调整才能获得完美结果。
4. 制胜策略:“两阶段”训练
这篇论文最大的发现是一种训练这些机器人的新配方,它优于仅使用单一方法。
- 配方: 首先使用“预测下一个词”方法(CLM)训练机器人,以获得快速、稳定的起步。然后,切换到“填空”方法(MLM)以加深其理解。
- 结果: 这种“两阶段”方法创造了所有机器人中最强大的。它将 CLM 起步的速度和稳定性与 MLM 收尾的深度理解相结合。
- 额外福利: 你甚至可以使用他人已经通过“预测下一个词”方法训练好的机器人(这非常普遍且获取成本低廉),只需对其进行“补充”训练,采用“填空”方法。这比从头开始训练机器人要便宜得多。
总结
论文得出结论,虽然旧的“填空”方法(MLM)对于获得最佳结果仍然至关重要,但我们不应忽视新的“预测下一个词”方法(CLM)。
最佳的前进路径是混合模式:
- 开始于快速、稳定的“预测下一个词”训练(或使用已经具备此能力的预训练模型)。
- 结束于深度的“填空”训练。
这一策略节省了资金和计算能力,同时产生了目前可用的最智能的文本理解工具。作者已发布所有代码和模型,以便其他人亲自尝试这种“两阶段”配方。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。