这篇论文介绍了一种名为 RELISH 的新方法,旨在让大型语言模型(LLM)更好地完成“回归”任务。
为了让你轻松理解,我们可以把“回归任务”想象成给电影打分或评估翻译质量。你需要模型输出一个具体的数字(比如 8.5 分),而不是写一段评论。
1. 核心问题:为什么现在的 AI 不擅长“打分”?
想象一下,你让一个只会写文章的作家(现在的 LLM)去给电影打分。
- 传统方法(自回归解码): 作家试图像写小说一样,一个字一个字地“拼”出数字。比如他想写"8.5",他得先想"8",再想".",再想"5"。
- 缺点: 这就像让作家用摩斯密码发数字,既慢又容易出错。而且,如果他想写"8.4",但模型觉得"8.5"的概率稍微高一点点,它就可能写错。它关注的是“字对不对”,而不是“分准不准”。
- 现有改进方法(回归感知推理): 作家写了很多个版本(比如写了 16 次"8.5",10 次"8.4"),然后你帮他算个平均分。
- 缺点: 这太费时间了!就像为了买一杯咖啡,你要让咖啡师做 16 杯然后让你选,效率太低。
- 现有预测头方法(直接读取): 你直接问作家:“你心里觉得是多少分?直接告诉我。”作家把心里的想法(隐藏状态)直接通过一个简单的公式转成数字。
- 缺点: 这个公式太简单了(就像只用平均值),容易把重要的细节“平均”掉,导致打分不准。
2. RELISH 是什么?(带“迭代状态头”的回归)
RELISH 就像给这位作家配备了一位超级精明的“评分助理”。
- 它不写数字: 它不强迫作家一个字一个字地拼数字。
- 它不瞎猜: 它不要求作家写 16 遍再算平均。
- 它的做法(迭代精炼):
- 初始想法: 助理手里拿着一个“初始评分草稿”(潜状态)。
- 反复核对(迭代): 助理拿着这个草稿,去仔细检查作家脑子里的每一个记忆片段(Token 表示)。
- 第一轮: “哎,这里有个词暗示分数应该高一点。” -> 修改草稿。
- 第二轮: “等等,那个转折词又暗示要低一点。” -> 再次修改草稿。
- 第三轮: “好,现在细节都看清楚了,最终分数是 8.5。”
- 输出结果: 最后,助理把这个经过反复推敲的“最终草稿”直接变成一个数字。
比喻:
如果把 LLM 的隐藏层比作一锅炖好的汤(充满了丰富的信息),
- 旧方法是直接用勺子舀一勺(平均池化),可能舀不到最鲜美的部分。
- RELISH 则是派一个智能机器人(潜状态),拿着勺子在汤里反复搅拌、品尝、调整(迭代交叉注意力),直到把最精华的味道提取出来,最后倒进杯子里给你。
3. RELISH 厉害在哪里?
- 更准(Performance): 在五个不同的数据集(比如给句子相似度打分、给机器翻译质量打分)上,RELISH 比所有以前的方法都准。它不仅能猜对大概,还能精准地捕捉到细微的差别。
- 更省(Efficiency):
- 以前的方法如果要微调,可能需要调整模型里几千万甚至上亿个参数(就像要把整个厨房的装修都重做一遍)。
- RELISH 只需要调整300 多万个参数(相当于只换了几个调料瓶和一把新勺子)。
- 关键点: 无论你的大模型是 80 亿参数还是 320 亿参数,RELISH 需要调整的参数数量几乎不变。这就像不管你的厨房多大,那个“智能机器人”的大小是固定的,非常划算。
4. 总结
RELISH 就像是一个轻量级、高智商的“评分专家”。
它不需要让大模型重新学习怎么说话(不用生成文本),也不需要让它做很多遍重复劳动(不用多次采样)。它只是在大模型内部,通过一种**“反复推敲、层层提炼”**的机制,把模型脑子里原本就有的、关于“分数”的模糊直觉,精准地提取出来,变成一个准确的数字。
一句话总结:
以前让 AI 打分,要么像让它写文章一样累,要么像让它猜谜一样不准;现在有了 RELISH,就像给它配了一个会反复思考的“精算师”,既快又准,还特别省资源。
1. 研究背景与问题定义 (Problem)
背景:
在大语言模型(LLM)时代,大多数 NLP 任务被统一为“文本到文本”(Text-to-Text)范式。然而,回归任务(预测连续标量值,如评分、相似度分数)与生成式任务存在本质差异。
核心问题:
现有的 LLM 回归方法主要分为三类,但各自存在明显缺陷:
- 自回归解码 (Autoregressive Decoding, ARD): 将数值作为文本生成(如生成 "3.5")。
- 缺陷: 基于 Token 概率而非数值邻近性优化。例如,预测 0.9 和 0.1 在交叉熵损失下被视为离散错误,但在回归任务中 0.9 更接近真实值 1.0。此外,生成过程引入了不必要的噪声。
- 回归感知推理 (Regression-Aware Inference, RAIL): 通过贝叶斯最优决策规则(如计算后验均值)从生成分布中提取数值。
- 缺陷: 需要采样多个输出或枚举候选值,导致推理成本高昂(多采样)。且后验分布仍定义在文本化数字上,未能完全解决数值空间的匹配问题。
- 预测头 (Predictive Heads): 直接利用 LLM 的隐藏状态(Hidden States)通过线性层或 MLP 回归数值,跳过文本生成。
- 缺陷: 现有方法通常使用简单的静态池化(如 Mean Pooling)或索引特定 Token(如 [CLS])。这种静态聚合方式可能丢失细粒度的回归相关信息,导致性能不如回归感知推理方法。
研究目标:
能否设计一种方法,既能保持预测头方法的高效性(单次推理、无需采样),又能达到甚至超越回归感知推理方法的预测性能,同时避免自回归解码的数值不匹配问题?
2. 方法论:RELISH (Methodology)
作者提出了 RELISH (REgression with a Latent Iterative State Head),一种新颖、轻量级且表达力强的预测头架构。
核心机制:
RELISH 不将数值解码为文本,也不简单聚合隐藏状态,而是通过迭代优化机制直接从冻结的 LLM 表示中预测标量值。
具体架构步骤:
- 输入投影: 将冻结 LLM 的 Token 级隐藏状态 H(x) 投影到头部维度 dh,得到 X(x)。
- 潜在状态初始化: 学习一个初始的潜在任务状态 r(0)。
- 迭代细化 (Iterative Refinement):
- 这是 RELISH 的核心。它维护一个潜在状态,并通过 L 次迭代进行更新。
- 在每一步 i,利用 Cross-Attention 机制,将当前的潜在状态 r(i−1) 作为 Query,Token 级表示 X(x) 作为 Key 和 Value。
- 公式:r(i)=Refine(r(i−1),H(x))。
- 该过程包含 Transformer 风格的残差块(LayerNorm + MHA + FFN),允许模型动态地、迭代地从 Token 序列中提取与回归任务相关的信息。
- 线性回归头: 将最终细化后的状态 r(L) 通过一个线性层映射为标量预测值 y^。
训练设置:
- 冻结骨干: LLM 骨干参数完全冻结。
- 可训练参数: 仅训练投影矩阵 W、初始状态 r(0)、细化模块(Attention 和 FFN)以及线性回归头。
- 损失函数: 使用 Huber Loss 对标准化后的目标值进行优化,以平衡对异常值的鲁棒性和对大误差的惩罚。
3. 主要贡献 (Key Contributions)
- 新颖的架构设计: 提出了 RELISH,用“迭代潜在状态细化”替代了传统的“静态池化”或“文本生成”,专门针对 LLM 回归任务设计。
- 全面的实证对比: 在 5 个数据集、4 种 LLM 骨干(8B-32B 规模)以及两种训练模式(冻结骨干和 LoRA 微调)下,系统性地对比了自回归解码、回归感知推理和预测头三大类方法。
- 性能与效率的双重突破:
- 性能: RELISH 在所有设置下均优于现有最先进基线(SOTA)。
- 效率: 相比 LoRA 等微调方法,RELISH 的可训练参数量极少,且不随 LLM 骨干规模线性增长,解决了大模型微调的开销瓶颈。
4. 实验结果 (Results)
实验设置:
- 数据集: 语义文本相似度 (STS-B, SICK-R) 和 机器翻译质量评估 (WMT 2020, 含英中、俄英、僧伽罗 - 英)。
- 基线模型: 自回归解码 (Zero/Many-shot)、RAIL/RAFT (回归感知)、线性回归/MLP (传统预测头)。
- 指标: 皮尔逊相关系数 (Pearson r)、斯皮尔曼等级相关系数 (Spearman ρ)、范围归一化均方根误差 (NRMSE)。
关键发现:
- 性能领先:
- 相对于第二好的方法 (RAFT),RELISH 在宏观平均上提升了 Pearson 6.7%,Spearman 7.2%,并降低了 19.9% 的 NRMSE。
- 在大多数数据集和骨干模型组合中,RELISH 均取得了最高分。特别是在机器翻译质量评估(WMT)任务上,由于需要捕捉细粒度的局部错误,RELISH 的迭代注意力机制优势尤为明显。
- 参数效率极高:
- 参数量: RELISH 仅需 3.4M - 3.7M 可训练参数。
- 占比: 仅占骨干模型参数的 0.01% - 0.04%。
- 对比 LoRA: LoRA 的可训练参数随模型规模显著增加(8B 模型约 0.26%,32B 模型约 0.42%)。RELISH 的参数量几乎不随骨干模型变大而增加(主要取决于隐藏层维度 d 而非总参数量 N),在大规模模型上优势巨大。
- 消融实验:
- 损失函数: 使用 Huber Loss 比 MSE 略有提升,但主要增益来自架构本身。
- 迭代深度 (L): L=1 (单次注意力池化) 已优于静态池化,但 L≥2 的迭代更新能显著提升性能。对于更大参数的模型(如 Gemma 3 27B),更深的迭代层数(L=5)仍能带来收益。
5. 意义与影响 (Significance)
- 重新定义 LLM 回归范式: 证明了在冻结 LLM 骨干上,通过设计更强大的特征提取头(Head),可以比微调骨干(如 LoRA)或复杂的采样推理(如 RAIL)更有效地解决回归任务。
- 解决“表达差距”与“聚合瓶颈”:
- 避免了自回归解码中的“表达差距”(Verbalization Gap),即模型内部知道数值但无法准确生成对应字符串的问题。
- 解决了传统预测头的“聚合瓶颈”(Summarization Bottleneck),通过迭代注意力机制动态提取细粒度信号,而非静态平均。
- 可扩展性与实用性:
- 由于参数量极小且不随模型规模爆炸式增长,RELISH 非常适合部署在超大参数量的 LLM 上,进行高效的回归任务(如奖励建模 Reward Modeling、LLM-as-a-Judge 评分、置信度估计等)。
- 为资源受限场景下的 LLM 应用提供了新的轻量化解决方案。
总结:
RELISH 通过引入迭代潜在状态细化机制,成功地在保持 LLM 回归任务高效推理(单次前向传播)的同时,实现了超越现有所有主流方法的预测精度。它证明了对于回归任务,架构设计的优化(如何提取信息)比单纯增加可训练参数(如何微调骨干)更为关键。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。