Temperature Fragility and the Conditional Benefits of Truncation Sampling
本文表明,诸如 top-p 和 min-p 之类的截断采样技术主要仅在性能显著下降的高温度设置下才能提高大语言模型的准确性,而在部署系统中通常使用的较低默认温度下,它们相比于标准温度采样并无益处。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
大型语言模型是驱动那些已成为日常生活一部分的文本生成工具的引擎。当这些模型编写句子时,它们并非简单地回忆一个固定的答案;相反,它们通过权衡大量的可能性来预测下一个词(或称之为 token)。在每一步中,模型都会为其词汇表中的每个词分配一个概率,然后由计算机程序从中抽取一个词以延续文本。一种被称为“温度”(temperature)的设置控制着这种抽取的“狂野”程度。低温度使模型倾向于选择最显而易见、最可能的词,从而保持输出的安全与可预测性。高温度则扩大了抽取的范围,允许模型从长尾部分的低概率词汇中进行选择。这可以增加文本的创造力或多样性,但也存在将模型拉向其并不自信、即其猜测最不可靠的词汇的风险。
多年来,开发者一直使用一种名为“截断采样”(truncation sampling)的安全网来管理这种风险。这些方法(例如 top-p 或 min-p)就像是一个过滤器,在模型做出选择之前剔除掉概率最低的词。其核心思想是通过切掉列表的底部,让模型可以在更高的温度下运行而不至于迷失方向。此前的研究表明,这些过滤器提供了显著的准确率提升,但它们是在大多数现实世界系统从未使用的极高温度下进行的测试。这留下了一个认知空白:这些过滤器对于我们日常使用的模型是否真的有效,还是仅在温度被推向极端时才有用?
爱丁堡大学的一位研究人员致力于填补这一空白,通过对两个标准的推理任务测试了 13 个不同的开源模型。他们通过一个单一且受控的流水线运行这些模型,以确保每一项结果都源于解码方法本身,而非软件差异或问题本身的差异。他们在 0.7、1.0 和 1.3 的温度下测试了这些模型,这些温度涵盖了大多数部署系统运行的范围。研究人员发现,结果完全取决于所使用的特定模型。他们发现,有些模型是脆弱的,这意味着即使温度仅略高于默认值,它们的性能也会崩溃;而另一些模型则是鲁棒的,能够稳住阵脚。
研究显示,在测试的 13 个模型中,有 6 个模型在温度从 0.7 升至 1.3 时出现了准确率的大幅下降。在其中一项困难测试中,这些脆弱模型的准确率损失了 17 到 38 个百分点。研究人员将这种损失归因于一种特定的失败类型:模型不仅给出了错误的答案,甚至根本不再给出答案。文本并没有完成思考过程,而是会一直持续到触及长度硬限制,或者会消解成评分软件无法读取的乱码。另外 7 个测试的模型并未遭遇这种命运;它们在相同的温度范围内保持了准确率,损失最多不超过 10 个百分点,甚至完全没有损失。
这种区别彻底改变了截断过滤器(truncation filters)的价值。对于鲁棒的模型而言,过滤器并没有提供任何益处。在实践中使用的标准温度下,应用过滤器并不能比简单的温度采样提高准确率。研究人员对此进行了仔细测量,发现任何潜在的增益都微乎其微,几乎可以忽略不计。然而,对于脆弱的模型,过滤器则是救命稻草。当温度上升到 1.3 时,每种测试过的截断采样器都成功恢复了丢失的准确率,使模型的表现回到了接近原始水平的状态。过滤器通过防止模型游荡到导致崩溃的低概率词汇“长尾”中起到了作用。
研究人员还发现,模型发生崩溃的时间点并非固定不变;它可以通过模型在初始创建后的训练方式来改变。其中一个模型是某个脆弱基础模型的不同版本,它的准确率损失仅为父模型的一半,这表明训练过程在稳定性方面起着重要作用。此外,研究表明,这些脆弱模型最终仍会在更高温度下崩溃,但过滤器可以延迟这种失败,使模型在高达 2.0 的温度下仍能保持连贯。
研究结果表明,截断采样的报告收益是真实的,但具有条件性。这些工具并非普遍提升模型;它们主要用于挽救那些在较高温度下已经挣扎的模型。对于大多数保持稳定的测试模型而言,过滤器并没有优势。这意味着对于从事具有明确、可验证答案的任务的从业者来说,模型的选择比采样器的选择更为关键。如果一个模型在目标温度下是鲁棒的,添加过滤器不会改变任何结果。如果一个模型是脆弱的,过滤器可以挽回损失,但根源在于模型对温度的敏感性,而非采样方法本身的缺陷。该研究得出结论,在系统实际使用的温度下,模型选择决定了准确率,而截断采样器是对仅在部分模型身上出现的问题的补救措施。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。