← 最新论文
💻 computer science

Beyond Tokens: A Survey on Decoding Methods for Large Language and Vision-Language Models

本综述系统地回顾了大型语言模型与视觉语言模型中新兴的解码方法,将其分为三种范式,以强调它们在推理过程中将模型输出与用户意图对齐的效率,同时概述了当前的挑战与未来的研究方向。

原作者: Haoran Wang, Xiongxiao Xu, Philip S. Yu, Kai Shu

发布于 2026-08-18
📖 1 分钟阅读☕ 轻松阅读

原作者: Haoran Wang, Xiongxiao Xu, Philip S. Yu, Kai Shu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象这样一个世界:计算机可以编写故事、解决复杂的谜题,并能以惊人的清晰度描述照片的内容。这就是现代大语言模型和视觉语言模型的现实——这些强大的系统是在海量人类知识的基础上训练而成的。然而,这些机器并不完美。它们有时会捏造事实,产生有害内容,或者陷入重复的循环,无法匹配提问者的意图。多年来,解决这些缺陷的主要方案是对整个机器进行重新训练,这是一个极其昂贵、缓慢且耗能的过程。另一种方法是精心设计向机器提出的问题,但这种方法非常脆弱;哪怕是一个微小的措辞变化都可能导致计算机失效。现在,研究人员正将注意力转向一个更高效的杠杆:计算机实际选择下一个词的那一瞬间。

由埃默里大学、伊利诺伊理工学院和伊利诺伊大学芝加哥分校的 Haoran Wang 及其同事撰写的一项新调查研究,绘制出了一个致力于研究生成过程中最后一步的快速发展的领域。研究人员将这些技术称为“解码方法”(decoding methods)。解码方法并不改变计算机的大脑,而是在机器决定下一句话的刹那间,充当一个精密的过滤器或引导器。该调查显示,该领域正在从简单的、僵化的规则转向三种强大的新策略:对比解码(contrastive decoding)、引导解码(guided decoding)和并行解码(parallel decoding)。这些方法允许计算机比较不同的可能性、遵循特定的安全或逻辑规则,甚至同时预测多个单词,而无需重新训练。

这三种策略中的第一种是对比解码,它的工作原理是让计算机同时观察其下一个词的两种不同路径。一条路径代表了计算机认为的最佳、最有帮助的答案,而另一条路径则代表了一个较差或不正确的版本。通过比较这两者,系统可以放大好的选择并抑制坏的选择。这种技术已被证明在阻止计算机“幻觉”(即自信地陈述不真实的事实)方面非常有效。例如,当视觉语言模型观察一张图片并进行描述时,对比方法可以帮助它忽略自身的内部偏见,严格遵循图像中实际可见的内容。这种方法也有助于保持计算机的安全,通过将安全的响应与不安全的响应进行对比,从而过滤掉有毒或有害的语言,同时保持原始模型完整无损。

第二种策略是引导解码,它引入了一套外部规则或一个实时观察生成过程的“教练”。引导解码不再仅仅根据计算机自身的训练来选择下一个词,而是使用一个独立的工具在每个潜在词被接受之前对其进行评分。这个教练可能是一个拦截危险短语的安全过滤器,一个确保数学证明遵循正确步骤的逻辑检查器,或者是一个将故事引向特定基调的创意总监。调查强调,这种方法对于编写代码或解决多步推理问题等复杂任务特别有用。通过不断根据一套标准检查工作,计算机可以产生更准确、更可靠的结果,从而在写作过程中有效地纠正自己的错误。

第三个重大转变是向并行解码迈进,它解决了速度问题。传统上,这些计算机一次生成一个词,这是一个缓慢的过程,随着模型规模的扩大,它成为了瓶颈。并行解码通过允许计算机同时起草多个词,然后快速验证哪些词是正确的,从而改变了游戏规则。这类似于作家在动笔写下每一个字母之前,先在脑海中构思出整个句子,而不是在每个单独的字母上苦苦挣扎。研究人员发现,这种“起草并验证”的方法可以显著加快这些模型生成文本的速度,使其在实时应用中更加实用。这种方法适用于各种类型的生成,从撰写文章到创建图像,并且在不牺牲输出质量的情况下实现这一点。

除了这三大支柱之外,该调查还详细介绍了如何应用这些方法来解决具体的现实世界问题。在安全领域,解码技术正被用于防止计算机被诱导泄露隐私信息或生成有害内容。在医学和科学领域,它们正帮助从复杂的文档和图像中提取准确的信息,降低危险错误的风险。研究人员还指出,这些方法不仅是为了让计算机变得更聪明或更快,更是为了让它变得更值得信赖。通过直接控制生成过程,开发者可以确保机器符合人类的价值观和预期,而无需承担重新训练的巨大成本。

尽管取得了这些进展,作者也指出该领域仍处于成熟阶段。许多这些技术依赖于精心挑选的示例或适用于特定任务的特定设置,而在其他任务中可能会失败。此外,还需要更好地理解这些方法为何有效,因为这些系统的内部运作有时感觉像是一个“黑箱”。此外,随着这些工具变得越来越强大,新的安全风险也随之而来,例如攻击者操纵解码过程以绕过安全措施的可能性。研究人员建议,未来的工作必须专注于使这些方法更加通用、更容易理解,并对这类威胁具有鲁棒性(稳健性)。

最终,这项调查描绘了一个处于转型中的领域。单纯追求扩大模型规模的时代,正逐渐让位于通过解码艺术使模型变得更聪明、受控程度更高的时代。通过优化这些机器选择单词的方式,研究人员正在解锁更高水平的可靠性、速度和安全性。这项工作表明,人工智能的未来可能不在于构建更大的大脑,而在于教导这些现有的系统如何更仔细地思考它们接下来要说的话。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →