LZ Penalty: An information-theoretic repetition penalty for autoregressive language models
本文引入了 LZ 惩罚(LZ penalty),这是一种基于 LZ77 码长的信息论重复惩罚机制,它能在不损害自回归语言模型推理能力的情况下,在贪婪解码过程中有效消除退化性重复,其性能优于现有的行业标准惩罚方法。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在人工智能领域,存在着一类被称为语言模型的强大计算机程序。这些系统通过训练来预测句子中的下一个词,从而使其能够通过生成长链条的推理过程来编写故事、回答问题,甚至解决复杂的数学问题。为了进行这些预测,模型依赖于一种统计过程,即从大量的可能性中选择最可能的下一个词。然而,一个持久的问题一直困扰着这些系统,特别是当它们被要求处理困难任务时:它们有时会陷入循环。模型不再推进新的想法,而是开始反复重复相同的单词或短语,导致其输出退化为无意义的内容。这种现象被称为退化重复(degenerate repetition),它一直是将这些模型用于需要输出一致且无误的可靠、确定性任务时的重大障碍。
多年来,工程师们一直试图通过应用简单的惩罚机制来修复这个问题,这些惩罚机制会对模型的选择施加影响,起到一种温柔的引导作用,通过降低模型近期使用过的词汇的出现概率来予以劝阻。一种方法是统计一个词出现了多少次并降低其概率;另一种方法则是简单地惩罚任何之前出现过的词。虽然这些方法在日常对话中表现良好,但在模型进行深度推理时往往会失效。这些推理模型在处理逻辑谜题时会生成非常长的文本序列,尽管使用了这些标准修复手段,它们仍频繁陷入重复循环。结果就是,系统可能以强劲的开端起步,但最终会崩溃成不断重复单词的结巴式循环,使得输出结果对于严肃的应用场景而言变得毫无价值。
来自 Salesforce AI 研究院的一个研究小组提出了一种全新的解决方案,其灵感源自一个完全不同的领域:数据压缩。他们的工作引入了一种名为 Lempel-Ziv 惩罚的方法,旨在停止这些重复循环,同时又不牺牲模型清晰思考的能力。其核心思想建立在预测句子中下一个词与压缩数据文件之间的一种基本联系之上。在计算领域,压缩算法通过寻找数据中的模式和重复项来使文件体积变小。如果一段词语序列频繁重复,压缩算法可以非常高效地描述它,仅使用更少的比特信息。研究人员意识到,如果他们能够衡量模型当前生成的文本流被压缩的难易程度,他们就可以利用这一信息来引导模型远离重复模式。
研究人员开发了一个系统,能够在模型生成文本时实时模拟一种特定的压缩算法,即 Lempel-Ziv 算法。该算法会回顾一个滑动窗口内的近期文本历史,寻找尽可能长的词序列匹配项。当模型考虑一个新词时,系统会计算该词会对压缩文件的总大小产生多大变化。如果这个新词创造了一个长且冗余的模式,使得压缩算法可以轻松编码,系统就会对该词施加惩罚,降低其被选中的概率。相反,如果该词引入了无法被轻易压缩的新颖且不可预测的信息,则惩罚较低或不存在。这种方法不同于以往的方法,因为它不仅仅是统计单个词出现的次数,而是观察重复序列的长度以及该序列在多远之前发生过。
为了测试这种新方法,研究人员将其应用于两个先进的推理模型,一个拥有 320 亿个参数,另一个拥有 140 亿个参数。他们将这种新惩罚机制的性能与目前行业标准的常用方法进行了对比。结果令人瞩目。当使用标准的频率或重复惩罚时,即使研究人员尝试调整设置以防止重复,模型仍会在大约 4% 的情况下陷入退化重复循环。相比之下,新的 Lempel-Ziv 惩罚将这些重复失败的发生率降至实际上为零。模型能够生成长且复杂的推理链而不会陷入停滞,且其在困难基准测试中的准确性保持不变。这表明,新方法成功地移除了导致循环的冗余,而没有干扰模型的真实推理能力。
研究人员还检查了运行这种新惩罚机制的计算成本。由于系统必须为每一个生成的单词模拟一次压缩步骤,因此需要额外的计算工作量。然而,他们发现这种开销非常小。对于大型模型而言,速度的下降不到 1%,这种差异微小到在实际应用中几乎难以察觉。这种高效性使得该方法具有实际应用价值,提供了一种在不要求显著增加计算能力的情况下,让推理模型变得更加可靠的方法。
团队指出,该方法的一个局限性在于它是专门为自然语言设计的。压缩算法依赖于一个假设,即语言具有某些统计特性,例如词语会随着时间的推移以可预测的方式重复出现。虽然该方法在处理文本时表现极佳,但研究人员提醒说,如果没有特定的调整,它在处理图像或音频等其他类型的数据时可能不会像这样有效。此外,该系统并非适用于所有可能的场景;例如,如果用户明确要求模型重复某个字母一百次,该惩罚可能会干扰这一特定指令。然而,对于绝大多数目标为连贯、非重复性推理的任务,这种新方法似乎是一个稳健的解决方案。
这些发现表明,我们对控制人工智能的思考方式正在发生转变。与其依赖于仅仅根据计数来禁止单词的粗放工具,这种方法利用信息论的数学原理来理解文本本身的结构。通过将文本生成视为一个压缩过程,研究人员创造了一个能够自然过滤掉重复噪声并保留思维信号的工具。这使得开源推理模型能够以一种此前难以实现的确定性水平运行,为在一致性至关重要的领域中实现更可靠的应用打开了大门。这项工作证明,通过从数据压缩的角度来看待问题,我们可以为长期阻碍语言模型进步的顽固故障找到优雅的解决方案。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。