← 最新论文
💬 NLP

Not All Layers Need Tuning: Selective Layer Restoration Recovers Diversity

本文提出了选择性层恢复(Selective Layer Restoration, SLR),这是一种无需训练的方法,通过将特定层选择性地恢复到其预训练权重,从而在缓解模式崩溃的同时,保持各种任务和模型族中的输出质量,以此恢复经过后训练的大型语言模型的生成多样性。

原作者: Bowen Zhang, Meiyi Wang, Harold Soh

发布于 2026-02-09
📖 1 分钟阅读☕ 轻松阅读

原作者: Bowen Zhang, Meiyi Wang, Harold Soh

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是使用简单语言和日常类比对该论文进行的解释。

问题所在:“过度负责”的机器人

想象你有一个才华横溢、富有创造力的机器人(大语言模型),它是在整个互联网的数据上训练出来的。在你给它任何特定指令之前,它是狂野且充满想象力的,可以讲一百万种不同的笑话或写一百万个不同的故事。它拥有多样性

然后,你对它进行了“后训练”(post-trained)。你教它变得乐于助人、彬彬有礼并完美地遵循指令。它变成了一个优秀的助手。但副作用是:它变得乏味了。

这种现象被称为模式崩塌(Mode Collapse)。你可以把它想象成一位音乐家,在被要求只能为企业活动演奏“稳妥”的歌曲后,忘记了如何演奏爵士、摇滚或蓝调。无论你问什么,这个机器人总是给出完全相同的“安全”答案。

  • 问: “列出一个化学元素。”
  • 旧机器人: “氢、氦、锂、碳……”(具有多样性)
  • 新机器人: “碳。碳。碳。”(乏味的重复)

论文指出,这种“乏味”的行为并不是发生在机器人的整个大脑中,而是卡在了特定的位置。

解决方案:“选择性层恢复”(SLR)

研究人员发现,机器人的大脑是由许多层组成的(就像摩天大楼的楼层)。有些楼层处理基础语法,有些处理事实,还有些处理复杂的推理。

他们假设这种“乏味”的行为局限在特定的楼层。因此,他们没有尝试重新训练整个机器人(这既昂贵又缓慢),而是尝试了一个聪明的技巧:选择性层恢复(Selective Layer Restoration, SLR)

类比:混合房屋
想象经过后训练的机器人是一座经过翻修、变得非常安全整洁,但失去了“灵魂”的房子。而预训练的机器人则是那座原始的、狂野且富有艺术感的房子。

研究人员并没有拆掉这座房子。相反,他们进入了这座翻修后的房子,并根据蓝图,将特定的房间替换回了原始的、狂野的版本。

  • 他们保留了“厨房”和“客厅”(让它能很好遵循指令的部分)。
  • 他们将“阁楼”和“地下室”(让它变得重复的部分)换回了原始的、具有多样性的版本。

结果是一个混合房屋:它仍然能完美地遵循指令(高质量),但现在它又能再次讲述狂野、多样化的故事了。而且最棒的是?这不需要额外的建设成本,走过这座房子也不会变慢(没有额外的推理成本)。

他们是如何找到要更换哪些房间的?(CRC 任务)

你不能仅仅靠猜测来决定更换哪些楼层。如果你换错了,房子可能会坍塌(机器人会变得无法理解)。

为了弄清楚这一点,研究人员创建了一个简单的测试游戏,叫做 CRC(约束随机字符)

  • 游戏规则: 他们问机器人:“生成一个 0 到 5 之间的随机数字。”
  • 目标: 机器人需要选出一个数字(质量:它必须是 0-5 之间的数字)并且每次都要选出不同的数字(多样性:不要每次都说“3”)。

通过测试这个简单的游戏,他们可以精确地看到机器人的大脑中哪些“楼层”(层)导致了重复。他们找到了一个“甜点区(sweet spot)”——即一个特定的层范围,通过将这些层换回原始版本,可以让机器人恢复多样性,同时又不破坏其遵循规则的能力。

结果

他们在三个困难任务上测试了这个“混合房屋”:

  1. 创意写作: 写诗、故事和笑话。
  2. 开放式问题: 询问诸如“列出一个国家公园”之类有许多正确答案的问题。
  3. 推理: 解决需要尝试不同路径的数学问题。

发生了什么?

  • 多样性激增: 机器人开始给出许多不同、独特的答案,而不是重复同一个答案。
  • 质量保持高水平: 它并没有停止遵循指令。它仍然乐于助人且准确。
  • 效果普适: 他们在三种不同类型的机器人(Llama、Qwen 和 Gemma)上进行了测试,它对所有机器人都有效。

为什么这很重要

通常,要解决一个乏味的机器人,你必须:

  1. 调整设置(比如调高“随机性”旋钮),但这有时会让机器人说出胡言乱语。
  2. 重写指令(提示词),这很繁琐且并不总是奏效。
  3. 重新训练整个机器人,这需要数月时间且耗资巨大。

这篇论文提供了第三种方法:一种简单的、免费的一次性修复方案。 你只需将机器人大脑中的几个特定“楼层”换回原始的、富有创造力的版本,你就能获得两全其美:一个既是得力助手又有趣且多样化的机器人。

总结

  • 问题: 训练 AI 变得乐于助人会让它变得重复且乏味。
  • 修复方法: 将 AI 的特定层换回其原始的、预训练的状态。
  • 结果: AI 重新变得多样化且富有创造力,同时保持乐于助人和准确。
  • 成本: 零额外的训练时间,零额外的运行成本。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →