Training-free LLM Verification via Recycling Few-shot Examples
该论文提出了 ReFeri,这是一个无需训练的框架,它通过结合前向置信度评分和后向重构惩罚来回收少样本示例以评估候选输出,从而提升大语言模型的准确性,在多种任务中实现了平均 8.2% 的相对增益。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
大语言模型是强大的工具,它们可以写故事、解数学题以及调试计算机代码。它们通过预测句子中的下一个词来工作,通过学习海量文本来模仿人类的推理能力。然而,由于这些模型是基于概率生成文本的,它们并不总是保持一致。如果你两次询问同一个问题,或者要求它同时生成多个答案,它每次给出的响应可能会有所不同。其中一些答案非常精彩,而另一些则包含细微的错误或逻辑漏洞。这种随机性使得在没有验证正确版本的方法时,很难信任模型的输出。传统上,研究人员试图通过让模型生成许多答案并挑选最常见的那个,或者训练一个专门的计算机程序来充当“裁判”来解决这个问题。但当任务是开放式的(例如写诗或生成复杂的代码)时,这些方法往往会失效,因为这类任务不存在可以用来计数的单一“正确”答案,或者这些方法需要昂贵的新训练,而这并不总是可行。
来自延世大学和韩国科学技术院(KAIST)的一个研究小组提出了一种无需额外训练或专门裁判的新方法来解决这个问题。他们将这种方法称为 ReFeri,意为“回收利用少样本示例来验证大语言模型输出”(Recycling Few-shot examples to verify LLM outputs)。其核心思想出奇地简单:研究人员决定不再仅仅将提供给模型的示例视为生成答案的起点,而是将这些相同的示例作为评估模型生成答案的“衡量标准”。当用户提出一个复杂问题时,通常会提供一些之前解决类似问题的例子。这些例子充当了指南,展示了期望的风格和逻辑。研究人员意识到,这些示例包含了关于一个好答案应该长什么样的隐藏信息,并且他们找到了一种利用这些信息来过滤掉糟糕答案的方法。
该过程通过对同一个问题的多个不同响应进行生成来运作。系统随后使用源自原始示例的两个相互竞争的信号对每个响应进行评分。第一个信号衡量响应对示例引导的遵循程度,本质上是在问:“这个答案看起来属于这个集合吗?”第二个信号则充当惩罚项,检查响应是否仅仅是在模仿示例的表面模式或特定特征,而不是在解决实际问题。如果一个响应在没有理解新问题的基础上过度模仿示例,它就会受到高额惩罚。最终得分是遵循引导与避免盲目模仿之间的平衡。通过从引导得分中减去惩罚项,系统选择了那个最好地利用示例作为逻辑基础、而非将其作为模板进行复制的答案。
在实验中,研究人员在七个不同的任务上测试了这种方法,涵盖了从解决困难数学题到回答复杂科学问题以及编写代码等多种任务,测试对象包括三种不同的主流大语言模型。他们发现 ReFler 一致地提高了模型的准确性。与仅仅从生成的选项中随机挑选一个答案相比,该方法平均提升了 8.2% 的性能。即使与现有的最强且无需训练的方法相比,ReFeri 仍能额外提高 2.6% 的准确率。研究人员特别感兴趣的是,当模型必须从大量选项中进行选择时,这种方法是否依然有效。他们测试了包含多达二十个候选答案的系统,并发现随着选项数量的增加,该方法表现得越来越好,而其他方法往往会随着选择数量的增加而性能下降。这表明,当有更多样化的选择时,该系统能更好地识别出最佳答案。
最重要的发现之一是,这种性能提升并不依赖于使用庞大的、功能强大的计算机来进行检查。研究人员展示了规模较小的、轻量级的模型可以像大型模型一样有效地执行验证工作。这至关重要,因为这意味着该方法是高效且具有成本效益的。它不需要通常用于训练新裁判或运行复杂验证系统的沉重计算资源。该方法的成功似乎源于其对少样本示例的巧妙利用,而非检查工作的计算机本身的原始算力。研究人员还在生成个性化新闻标题和编写代码等开放式任务上测试了该方法,在这些场景下,传统的投票法会失效,因为不存在可以计数的单一正确答案。在这些场景中,ReFeri 仍然优于其他方法,证明了其处理复杂、创造性任务的能力,在这些任务中,“正确”答案并非一个简单的事实,而是一个构建良好的解决方案。
研究人员还通过分析当他们故意使示例变差或改变答案顺序时会发生什么,来探索该方法为何如此有效。他们发现,即使示例并不完美,该系统依然保持稳健,并且不会轻易被答案的呈现顺序所迷惑。这种稳定性表明,该方法不仅仅是在记忆模式,而是真正理解了示例与新问题之间的关系。通过回收利用少样本示例进行验证,研究人员创造了一个工具,有助于大语言模型在无需重新训练或人类监督的情况下变得更加可靠。这种方法为优化现有模型提供了切实可行的方式,使它们在对准确性要求极高的现实应用场景中更加值得信赖。这项工作强调了我们提供给这些模型的示例不仅是启动任务的指令,也是检查其产出质量的宝贵资源。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。