← 最新论文
🤖 machine learning

LLM REgression with a Latent Iterative State Head

本文提出了 RELISH,一种轻量级架构,通过迭代优化潜在状态并利用交叉注意力机制直接从冻结的大语言模型表示中预测标量值,在保持极低参数开销的同时显著超越了现有的各类大语言模型回归基线。

原作者: Yiheng Su, Matthew Lease

发布于 2026-04-02
📖 1 分钟阅读☕ 轻松阅读

原作者: Yiheng Su, Matthew Lease

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一种名为 RELISH 的新方法,旨在让大型语言模型(LLM)更好地完成“回归”任务。

为了让你轻松理解,我们可以把“回归任务”想象成给电影打分评估翻译质量。你需要模型输出一个具体的数字(比如 8.5 分),而不是写一段评论。

1. 核心问题:为什么现在的 AI 不擅长“打分”?

想象一下,你让一个只会写文章的作家(现在的 LLM)去给电影打分。

  • 传统方法(自回归解码): 作家试图像写小说一样,一个字一个字地“拼”出数字。比如他想写"8.5",他得先想"8",再想".",再想"5"。
    • 缺点: 这就像让作家用摩斯密码发数字,既慢又容易出错。而且,如果他想写"8.4",但模型觉得"8.5"的概率稍微高一点点,它就可能写错。它关注的是“字对不对”,而不是“分准不准”。
  • 现有改进方法(回归感知推理): 作家写了很多个版本(比如写了 16 次"8.5",10 次"8.4"),然后你帮他算个平均分。
    • 缺点: 这太费时间了!就像为了买一杯咖啡,你要让咖啡师做 16 杯然后让你选,效率太低。
  • 现有预测头方法(直接读取): 你直接问作家:“你心里觉得是多少分?直接告诉我。”作家把心里的想法(隐藏状态)直接通过一个简单的公式转成数字。
    • 缺点: 这个公式太简单了(就像只用平均值),容易把重要的细节“平均”掉,导致打分不准。

2. RELISH 是什么?(带“迭代状态头”的回归)

RELISH 就像给这位作家配备了一位超级精明的“评分助理”

  • 它不写数字: 它不强迫作家一个字一个字地拼数字。
  • 它不瞎猜: 它不要求作家写 16 遍再算平均。
  • 它的做法(迭代精炼):
    1. 初始想法: 助理手里拿着一个“初始评分草稿”(潜状态)。
    2. 反复核对(迭代): 助理拿着这个草稿,去仔细检查作家脑子里的每一个记忆片段(Token 表示)。
      • 第一轮: “哎,这里有个词暗示分数应该高一点。” -> 修改草稿。
      • 第二轮: “等等,那个转折词又暗示要低一点。” -> 再次修改草稿。
      • 第三轮: “好,现在细节都看清楚了,最终分数是 8.5。”
    3. 输出结果: 最后,助理把这个经过反复推敲的“最终草稿”直接变成一个数字。

比喻:
如果把 LLM 的隐藏层比作一锅炖好的汤(充满了丰富的信息),

  • 旧方法是直接用勺子舀一勺(平均池化),可能舀不到最鲜美的部分。
  • RELISH 则是派一个智能机器人(潜状态),拿着勺子在汤里反复搅拌、品尝、调整(迭代交叉注意力),直到把最精华的味道提取出来,最后倒进杯子里给你。

3. RELISH 厉害在哪里?

  • 更准(Performance): 在五个不同的数据集(比如给句子相似度打分、给机器翻译质量打分)上,RELISH 比所有以前的方法都准。它不仅能猜对大概,还能精准地捕捉到细微的差别。
  • 更省(Efficiency):
    • 以前的方法如果要微调,可能需要调整模型里几千万甚至上亿个参数(就像要把整个厨房的装修都重做一遍)。
    • RELISH 只需要调整300 多万个参数(相当于只换了几个调料瓶和一把新勺子)。
    • 关键点: 无论你的大模型是 80 亿参数还是 320 亿参数,RELISH 需要调整的参数数量几乎不变。这就像不管你的厨房多大,那个“智能机器人”的大小是固定的,非常划算。

4. 总结

RELISH 就像是一个轻量级、高智商的“评分专家”

它不需要让大模型重新学习怎么说话(不用生成文本),也不需要让它做很多遍重复劳动(不用多次采样)。它只是在大模型内部,通过一种**“反复推敲、层层提炼”**的机制,把模型脑子里原本就有的、关于“分数”的模糊直觉,精准地提取出来,变成一个准确的数字。

一句话总结:
以前让 AI 打分,要么像让它写文章一样累,要么像让它猜谜一样不准;现在有了 RELISH,就像给它配了一个会反复思考的“精算师”,既快又准,还特别省资源。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →