← 最新论文
🤖 machine learning

LARA: Lightweight Adapters in the Residual Stream for Composable Adaptation and Alignment

LARA 是一种轻量级适配方法,它将低秩修正直接注入到冻结模型的残差流中,从而实现高效的参数匹配性能、通过缩放因子实现的平滑推理时控制,以及在单台设备上同时托管多种不同行为的能力。

原作者: Pascal Ekin, Hyosun Choi, Wei Jie

发布于 2026-08-03
📖 1 分钟阅读☕ 轻松阅读

原作者: Pascal Ekin, Hyosun Choi, Wei Jie

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你拥有一个超级聪明的机器人,它读过了互联网上几乎所有的内容。它是个天才,但也有一点点固执:一旦它学会了它的知识,你就很难在不破坏它大脑或需要海量内存来存储一个全新版本的情况下,教它新的技巧。这就是**大语言模型(LLMs)的世界。为了让这些机器人能够胜任特定的工作——比如编写 Python 代码或提供医疗建议——科学家们通常会使用一种叫做微调(fine-tuning)**的技术。把这想象成给机器人一本新的教科书。过去主流的方法叫做 LoRA,它就像是拆开机器人的大脑,重写它内部说明书的几页内容,然后把它粘回去。这种方法效果很好,但很笨重。如果你想让机器人既是一个程序员,又是一个医生,还是一个诗人,你就必须随身携带三个不同且沉重的脑部版本,这对于像手机这样的小型设备来说是不可能的。

于是有了 LARA(轻量级加性残差适配),这是由皇家霍洛威学院和西伦敦大学的研究人员提出的一种新思路。LARA 不去重写机器人的内部说明书,而是将机器人的大脑视为一个固定、不可改变的基础。它在机器人开口说话之前,在其思维流中添加了一个极其微小的、可拆卸的“便签”。这个便签非常小巧且轻量,以至于你可以让一整个“人格库”(一个负责编程,一个负责数学,一个负责友善)同时存在于同一个机器人身上。机器人可以实现词与词之间的即时人格切换,而无需重新加载整个大脑。这篇论文表明,这种“记笔记”的方法与笨重的“重写”方法一样有效,但它拥有一个超能力:你可以调节新行为的“音量”大小,并且可以将许多种行为压缩进极小的空间,从而使在你的设备上运行一个多才多艺的 AI 成为可能。

问题所在:沉重的脑部

想象你有一个巨大的、冻结着的天才雕像。它很完美,但无法改变。如果你想让它开始说法语,你不能只是对着它低语;你必须在石块上凿出新的肌肉。这就是大多数 AI 适配方式的做法:它们试图去凿刻雕像。流行的 LoRA 方法就像是在雕像的肌肉上覆盖了一层薄薄的粘土。它有效,但如果你想让雕像说法语、西班牙语和德语,你就需要三个不同的雕像,或者需要不断更换三层不同的粘土。这既缓慢又占用大量空间。

解决方案:便利贴

LARA 背后的研究人员提出了一个不同的问题:“如果我们根本不去碰雕像会怎样呢?”他们决定不再进行凿刻或添加粘土,而是在雕像伸手拿东西时,在它的手上贴上一张小小的、神奇的便利贴。

在 AI 的世界里,这个“手”被称为残差流(residual stream)。它是信息流经模型各层的方式,就像一条承载着机器人思想的河流。LARA 不会改变河床(冻结的权重);它只是将一个微小的、低秩的“海绵”浸入河流,挤出一点点“修正值”,然后将其加回到水中。

  • 海绵: 这是一个只有约 239 万个可训练参数的微型模块。
  • 河流: 主模型(一个 15 亿参数的模型)保持完全冻结且不受触碰。

因为主模型从未被改动,所以“基础版”机器人始终在那里,随时待命。海绵只是在思想流经时,为它们增添一点风味。

魔法技巧

论文发现了关于这种方法的三个酷炫之处:

1. 它和笨重的方法一样好
研究人员在代码编写任务和“偏好”任务(教机器人变得更有帮助且不那么粗鲁)上测试了 LARA。他们使用完全相同的可训练参数量,将 LARA 与笨重的粘土方法(LoRA)进行了对比。结果是:LARA 媲美 LoRA。尽管它从未触碰过原始大脑,但它学习编写代码和遵循偏好的效果同样出色。这就像那张便签的效果竟然和重写说明书一样有效。

هایت2. 音量旋钮
这是 LARA 最有趣的地方。因为“修正”仅仅是一种加性便签,所以你可以在机器人说话的瞬间转动一个叫做 γ\gamma (gamma) 的旋钮。

  • 如果你设置 γ=0\gamma = 0,机器人会忽略便签,表现得和冻结的基础模型完全一样。
  • 如果你设置 γ=1\gamma = 1,它会充分利用便签。
  • 如果你设置 γ=0.5\gamma = 0.5,它就是一半一半。

论文显示,你只需通过转动这个旋钮,就可以在“乏味的基座”和“专家程序员”之间平滑切换。一旦用 LoRA 把粘土糊上去,你就无法做到这一点,因为那是永久性的改变。有了 LARA,你可以通过调节音量来说:“嘿,机器人,做个 70% 的程序员和 30% 的诗人。”

3. 人格图书馆
这是最重要的一点。因为基础是冻结的且便签非常小,所以你可以让 七种不同的行为 同时生活在 同一个 15 亿参数的模型上。

  • 研究人员将六种微调行为(代码、通用聊天、数学、医疗、第二套代码集和摘要生成)以及一种“偏好”行为放在了同一个冻结模型上。
  • 这七种行为的总额外权重仅为 33 MB
  • 如果使用旧方法,你需要七个完整的模型副本,这将占用 21.6 GB

想象一下,将七种不同的人格塞进一个 MP3 文件的大小里。模型使用一个微小的“路由器”(交通警察)来观察机器人即将说的每个词,并决定为那个特定的词借用哪种人格。如果句子是关于数学的,它就抓取数学便签;如果关于编程,它就抓取代码便签。如果句子具有歧义,它甚至可以融合它们。

局限性(以及未来)

论文谨慎地指出,这目前还不是解决所有问题的灵丹妙药。

  • “代码”测试: 证明 LARA 与 LoRA 同样有效的测试主要是在一个代码数据集上完成的。作者认为它在其他领域也可能同样有效,但尚未在所有可能的课题上进行全面测试。
  • “放大”限制: 如果你把音量旋钮 (γ\gamma) 转得太高(比如设为 3),机器人会开始结巴并出错,尤其是当你堆叠了许多便签时。单个便签是稳定的,但如果堆叠了六个便签并调高音量,河流就会发生洪水。
  • 路由器的困惑: 当两种行为非常相似时(例如两套不同的代码数据集),交通警察有时会感到困惑并平分选票。然而,论文发现即使在困惑时,机器人仍然表现良好,因为两个便签都在试图协助处理代码。

这为什么重要

论文表明,我们可能不需要为每项新技能都构建庞大、独立的脑部。相反,我们可以拥有一个坚实、冻结的大脑,并配备一个装满微小、可切换便签的背包。这对于在手机或笔记本电脑等内存受限的设备上运行 AI 至关重要。它预示着这样一个未来:你的手机拥有一个单一的 AI 模型,它可以瞬间从你的数学导师切换到你的编程助手,再切换到你的创意写作伙伴,而无需下载新应用或等待大规模更新。研究人员称之为“可组合适配”,但你完全可以把它理解为给你的机器人准备了一衣橱微小且神奇的便利贴。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →