Revise, Don't Freeze: Sampler-Matched Training for Self-Correcting Masked Diffusion Language Models
本文介绍了 D3IM,一种能够实现掩码扩散语言模型中直接 Token 修订的无参数采样器,以及 SCOPE,一种用于减轻由此产生的保留偏差(preservation bias)的后训练方法,两者共同在推理和编程基准测试上实现了显著的性能提升。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
核心问题:“冻结的错误”
想象你正在和一个非常聪明但有点紧张的机器人助手一起写故事。每当机器人猜出一个词时,它就会把这个词写在纸上。
在这些机器人工作的标准方式中(被称为掩码扩散语言模型,Masked Diffusion Language Models),一旦机器人写下一个词并觉得已经足够“自信”了,它就会把这个词冻结在原处。它会在词上面贴上一层胶带。即使机器人后来意识到:“等等,这个词放在这个句子里并不通顺,”它也无法更改,因为胶带在那里。它只能填充那些尚未被写下的“空白”部分。
对于数学或编程这类棘手的任务,这是一个巨大的问题。如果机器人在早期写错了一个数字(比如把“2”写成了“5”),它就会陷入困境。它会试图围绕这个错误的数字构建剩余的答案,从而导致最终结果完全错误。
解决方案:两部分的改进
作者 Longxuan Yu 及其同事意识到,机器人其实具备改变主意的能力,只是游戏规则阻止了它这样做。他们提出了一个由两部分组成的解决方案来解决这个问题:一种新的游戏方式(D3IM)和一种专门针对机器人的训练练习(SCOPE)。
第一部分:新的游戏规则 (D3IM)
类比: 想象一场大家都在猜句子中下一个词的“烫手山芋”游戏。
- 旧规则: 一旦你喊出一个词,你就必须一直拿着它直到结束。如果你喊错了词,你就只能认栽。
- D3IM 规则(“白纸重来”): 在游戏的每一个步骤中,机器人都会观察句子中的每一个词,甚至是那些它已经喊出来的词。它会问自己:“我仍然认为这是最好的词吗?”
- 如果机器人依然很有信心,这个词就会保留。
- 如果机器人觉得:“实际上,这不对,”它会擦掉这个词(把它变回空白)或者立即用一个更好的词替换它。
- 它不需要请求许可或使用特殊工具;它只是根据当前的信心水平重新评估一切。
难点在于: 机器人玩这个游戏表现得很好,前提是它知道自己错了。但在最初的训练中,机器人从未被教导去承认自己的错误。它被训练去信任自己的第一次猜测,即使那个猜测是错误的。所以,当你让它玩这个新的“白纸重来”游戏时,它会不断冻结那些错误的词,因为它认为它们是正确的。
第二部分:专门的训练 (SCOPE)
类比: 这就像是一场“带有错误的排练”。
为了纠正机器人过度信任自身错误的坏习惯,作者创建了一种名为 SCOPE(基于预测误差的自我调节训练,Self-Conditioned On Prediction Errors)的训练方法。
- 它是如何运作的: 在训练期间,机器人被要求写一个句子,但随后它会被迫观察自己的作品,并假装自己犯了错。
- 机器人写下一个句子,然后训练员说:“好了,我要隐藏掉你的一些词。现在,请再次尝试猜出它们。”
- 转折点: 训练员会专门挑选那些机器人猜错、但却表现出极高置信度的词。机器人必须看着自己错误的答案,意识到自己错了,然后用正确的词替换它。
- 这教会了机器人一个至关重要的教训:“仅仅因为我说得很有信心,并不意味着我是对的。我需要愿意改变主意。”
结果:一个协作的团队
当你将新的游戏规则(D3IM)与专门的训练(SCOPE)结合在一起时,机器人就变成了一个具有自我修正能力的天才。
- 没有经过训练: 如果你只给机器人新的规则而不进行专门训练,它的表现反而会变差。它试图改变词汇,但却不断重复同样的错误,因为它并不信任自己发现错误的能力。
- 经过训练后: 机器人学会了识别自己的“冻结错误”。它现在可以观察到一个数学题中的错误数字,说:“不,这不对,”然后将其替换为正确的数字,而这一切都是在句子构建的过程中完成的。
现实世界的结果
论文在名为 LLaDA-8B(一种智能语言模型)的模型上测试了这些任务,涵盖了困难的任务:
- 数学 (GSM8K & MATH): 分数显著提升。例如,在一场高难度的数学测试中,准确率从 55.3% 跳升至 68.3%。
- 编程 (HumanEval & MBPP): 编写可用代码的能力大幅提升,在其中一项测试中从 14.0% 跃升至 29.3%。
核心启示
主要的发现是:拥有改变主意的能力是不够的;你必须经过训练,才知道何时该改变主意。
作者展示了通过教导模型识别其自信的错误(SCOPE),并赋予其能够立即替换这些错误的机制(D3IM),该模型处理复杂推理问题的能力比以前强得多。这不仅仅是让机器人变得更聪明,而是教会它不要对早期的错误如此固执。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。