← 最新论文
💬 NLP

The Missing Piece in Pre-trained Model Evaluation: Reward-Guided Decoding Unlocks Task-Oriented Behavior Without Parameter Updates

本文介绍了基于能量的解码(EBD),这是一种无需训练、由奖励引导的框架,能够引导冻结的预训练语言模型朝向任务导向的行为,并在无需参数更新或昂贵后训练的情况下显著提升其基准性能。

原作者: Shaobo Wang, Guo Chen, Ziyue Wang, Zhengyang Tang, Qingyang Liu, Xingzhang Ren, Dayiheng Liu, Linfeng Zhang

发布于 2026-05-28
📖 1 分钟阅读☕ 轻松阅读

原作者: Shaobo Wang, Guo Chen, Ziyue Wang, Zhengyang Tang, Qingyang Liu, Xingzhang Ren, Dayiheng Liu, Linfeng Zhang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是论文《预训练模型评估中的缺失一环:奖励引导解码在不更新参数的情况下解锁面向任务的行为》的通俗解释,辅以生动的类比。

核心难题:“礼貌的学生”与“应试者”

想象你有一位博览群书的天才学生,但他从未参加过考试。这位学生就是预训练大语言模型(LLM)

当你问这位学生一个问题,比如“解这道数学题”时,他不会立刻开始解题。相反,因为他的训练目标仅仅是“续写故事”,他可能会说:“这是一个关于数学题的故事:很久很久以前,有一个数字……"他只是在礼貌地延续对话,并没有真正执行任务。

这给老师们(研究人员)带来了问题。当他们试图给这些学生打分时,得到的分数很低。但这是否意味着学生真的笨呢?不。他们只是不知道如何在没有经过明确训练(微调)的情况下,从“聊天模式”切换到“考试模式”。

旧方案:吼叫或猜测

研究人员曾尝试两种主要方法来解决这个问题:

  1. 吼叫(似然度锐化):他们试图通过降低“温度”(让 AI 的随机性变小),让学生说话更大声或更自信。但这只是让学生更自信地重复错误的故事。
  2. 猜测与检查(Best-of-N):他们让学生写 100 个不同的答案,然后挑选最好的一个。这有时有效,但极其缓慢且昂贵,就像为了得到一篇好文章,让学生把同一篇作文写 100 遍。

新方案:EBD(“智能编辑”)

作者提出了一种新方法,称为基于能量的解码(Energy-Based Decoding, EBD)。你可以把 EBD 想象成一位站在学生身旁、在他写作时进行指导的智能编辑

以下是智能编辑的工作步骤:

  1. 初稿(初始化):学生快速写出一份初稿。编辑阅读后,根据它回答问题的质量给出评分。
  2. “剪切与粘贴”游戏(分块优化):编辑不要求学生重写整篇文章。相反,编辑随机挑选一段(一个“块”),将其剪下,要求学生只重写这一段
  3. 评分检查(奖励模型):编辑查看新段落。
    • 如果新段落更好(得分更高),编辑就保留它。
    • 如果新段落更差,编辑就把它扔掉,换回旧段落。
  4. 魔法技巧(抵消):这是巧妙之处。通常,检查重写是否“更好”需要确认它是否仍符合学生的自然语调。但作者发现了一个数学技巧:因为学生是用自己的自然语调重写段落的,所以“语调检查”相互抵消了。编辑只需要检查:“这个新部分对任务来说是否更好?”

为何这很重要

  • 无需手术(无需参数更新):你不需要对学生的大脑进行手术(重新训练模型)。你只需要一位智能编辑(一个小型的独立奖励模型)来引导他们。
  • 快速高效:与“猜测与检查”方法需要写 100 篇作文不同,EBD 只重写小块内容几次。这就像在 Word 中编辑文档,而不是从头重写整本书。
  • 更公平的评分:论文表明,当你使用这位智能编辑时,“预训练”学生的表现几乎与“后训练”(经过考试训练的)学生一样好。这意味着我们之前低估了这些模型的原始智能;他们只是需要一个正确的提示来切换模式。

结果大白话

研究人员在五种不同的 AI 模型(如 Llama、Mistral 和 Qwen)上测试了该方法,涵盖了六种不同类型的测试(数学、编程、写作和逻辑)。

  • 数学与逻辑:模型从答对很少的问题变成了答对更多的问题。例如,在一场数学测试中,一个模型的分数从 8.8 跃升至 44.5。
  • 速度:它比之前的“猜测”方法快得多。在某些情况下,它比旧方法尝试获取正确答案的速度快 18 倍
  • 鲁棒性:即使“智能编辑”(奖励模型)很小很简单,它也能发挥作用。你不需要一个庞大昂贵的编辑来获得好结果。

结论

这篇论文认为,我们目前测试 AI 的方式存在缺陷,因为它假设 AI 知道如何参加考试。作者表明,通过一种巧妙且轻量级的编辑过程(EBD),我们可以在不改变模型“大脑”的情况下,解锁原始 AI 模型隐藏的“应试”能力。这就像意识到学生一直都很聪明;他们只是需要一位监考员告诉他们:“好了,停止聊天,开始解题。”

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →