Don't Repeat Yourself: Stopping Verbatim Loops at Sampling Time
该论文介绍了“不要重复你自己”(Don't Repeat Yourself, DRY),这是一种采样时逻辑调整技术,通过惩罚那些延续了早期上下文中精确后缀匹配的标记,有效地减少了大语言模型的逐字循环问题,从而在不降低性能或需要模型重训练的情况下,提高了词汇多样性和流畅度。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
大语言模型是那些重塑了我们写作、编程以及与机器对话方式的文本生成工具背后的引擎。这些系统通过预测句子中的下一个词来工作,一次一个词地进行,根据之前出现的所有内容构建响应。在大多数情况下,它们表现得异常流畅,能够将复杂的想法编织在一起并模仿人类的风格。然而,它们存在一个特定的、令人沮丧的缺陷,被称为“逐字循环”(verbatim looping)。当模型陷入困境时,它会开始一遍又一遍地重复一个短语或句子,有时会持续数百个单词,仿佛它忘记了自己刚刚说过一样。这是因为模型自身的输出强化了这种模式,从而创造了一个难以打破的反馈循环。虽然开发者长期以来一直试图通过简单地告诉模型不要使用它已经见过的词来修复这个问题,但这些生硬的工具往往会破坏文本的质量,破坏必要的格式,或使写作听起来像机器人一样。
一项新研究介绍了一种更聪明的方法来处理这个问题,这种方法被称为“不要重复你自己”(Don't Repeat Yourself),简称 DRY。DRY 并非因为模型使用了它之前用过的词而对其进行惩罚,而是观察句子本身的结构。它会观察模型是否即将完成一个已经在文中出现过的模式。如果模型仅仅是在重复一个属于正常结构的单词,比如对话中的说话者标签或列表中的项目符号,该方法就会保持原样。但如果模型开始延伸一段与之前部分完全匹配的词序列,该方法就会轻轻地引导模型选择另一条路径。这种区分至关重要,因为它允许模型保持其自然的节奏和格式,同时阻止导致其陷入困境的失控重复。
研究人员在各种计算机模型上测试了这一想法,从可以在个人笔记本电脑上运行的小型模型到拥有数十亿参数的庞大系统。他们使用不同类型的提示词进行了数千次生成,包括创意写作、长对话和结构化格式任务。结果非常明确:与完全不做任何处理相比,这种新方法将这些精确重复循环的发生率降低了近一半。更重要的是,它在没有损害写作质量的情况下实现了这一点。事实上,使用这种方法生成的文本比使用旧的、生硬的惩罚机制生成的文本更加多样化和丰富。当研究人员将新方法与目前行业中使用的标准工具进行比较时,旧工具要么无法阻止循环,要么在阻止循环时使文本听起来不自然并破坏了格式。
为了确保改进来自于新方法的特定逻辑而非仅仅是通过向系统添加随机噪声,团队进行了一项特殊的对照测试。他们在模型中应用了类似程度的干扰,但没有关于匹配模式的具体规则。这个对照组并没有停止循环,这证明了新方法的成功源于其识别并中断特定重复结构的能力。研究还观察了这种修复是否会损害模型解决难题或遵循复杂指令的能力。在衡量推理和知识能力的测试中,新方法的表现与未受控的模型一样出色,而旧方法则导致了明显的性能下降。这表明这种新方法可以安全地应用于实际应用中,而不会牺牲模型的智能。
这项工作的影力不仅限于实验室。该方法已被几种驱动本地 AI 应用的热门开源软件框架所采用,这意味着用户可以立即开始从中受益。通过专注于词序列而非仅仅是单个词本身,研究人员找到了一种方法,让这些强大的工具不会陷入循环,从而确保它们在处理旨在处理的长对话和复杂任务时,依然保持有用、流畅且可靠。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。