The Appeal and Reality of Recycling LoRAs with Adaptive Merging
本文研究了自适应合并来自 Hugging Face Hub 的用户贡献 LoRA 的可行性,结果表明,尽管此类方法优于基座模型,但其收益主要归功于正则化效应而非跨任务迁移,因为它们相比于训练一个新的 LoRA 优势有限,并且即使使用随机初始化的参数也表现相似。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你拥有一个巨大的、超级聪明的机器人大脑(我们称之为“基础模型”),它对万事万物都略知一二,但并不精通任何特定领域。现在,想象成千上万的人为这个机器人制造了许多微小的、专门化的“技能芯片”,叫做 LoRA。有的芯片让它擅长数学,有的让它擅长写诗,还有的让它理解医学术语。这些芯片在互联网上到处漂浮,任何人都可以免费获取。
核心问题是研究人员提出的:如果我们从互联网上随机抓取一把这些芯片并把它们粘合在一起,我们会得到一个比从头开始教基础机器人一项新技能更强大的超级机器人吗?
这就是“回收利用”LoRA 的故事。研究人员从 Hugging Face Hub(一个巨大的 AI 模型库)中收集了近 1,000 个这类用户制作的芯片,并尝试使用高级的“自适应合并”技术将它们融合在一起。他们想看看是否可以通过混合搭配这些预制的技能来解决新问题,而无需从头开始训练一个新的芯片。
大惊喜:所谓的“神奇胶水”可能只是个幻觉
转折点来了:这种高级的合并技术其实并没有大家期望的那样奏效。
当研究人员尝试通过合并这些回收的芯片来解决一项新任务时,他们发现,这种混合带来的“魔力”在很大程度上是一种错觉。
- 现实检查: 如果你有一个小规模的数据集(大约 100 个样本)来教机器人一项新任务,那么直接针对该特定数据训练一个全新的 LoRA 几乎总是更好的选择。
- “随机性”冲击: 更奇怪的是,当他们把这个新鲜训练出的 LoRA 加入到混合物中时,加入哪些其他的芯片竟然变得无关紧要了!他们可以抓取来自互联网的 30 个芯片,或者抓取 30 个仅仅充满了随机数字(就像电视机上的雪花噪声)的芯片,结果几乎是一样的。
论文指出,性能的提升并不是来自于这些回收芯片内部的“知识”。相反,合并它们的过程似乎起到了安全网或正则化器的作用。这就像是在尝试平衡一叠盘子;增加更多的随机盘子可能反而有助于稳定整个堆叠,并不是因为这些盘子有用,而是因为平衡它们的过程迫使系统变得更加谨慎。
为什么过去的实验说它有效?
你可能会问:“但以前不是有论文说合并 LoRA 非常神奇吗?”
作者怀疑那些过去的研究有点“过于完美”了。它们通常使用的是“内部定制”芯片——即在受控实验室环境下由他们自己制作的芯片,在那里他们完全清楚哪些芯片是相关的。这就像是用在同一家商店购买的食材来测试食谱,并且预先知道哪些食材能完美搭配。
但在现实世界(即“野外”)中,芯片是杂乱无章的。它们是由不同的人、用不同的数据、为了不同的目标制作的。研究人员发现,只有当芯片与任务高度相关时,正向迁移(即一个技能帮助另一个技能)才会发生。如果你用一个“数学芯片”和一个“诗歌芯片”去解决“历史测验”,它并不会提供帮助。事实上,论文表明,如果你从池子中移除那些最相关的芯片,性能会像坠落一样暴跌,最终变得不比使用随机噪声更好。
结论
那么,对于一个好奇的青少年来说,结论是什么呢?
- 不要期待免费的午餐: 你不能只是从互联网上抓取一堆随机的 AI 技能,把它们混合在一起,然后期待奇迹发生。
- 训练依然是王者: 如果你有一项特定的工作要做,针对自己的数据进行一次新鲜的、小规模的训练(LoRA)通常是最好且最可靠的方法。
- “回收利用”很复杂: 虽然合并有时可以超越基础模型,但它很少能超越简单的、新鲜的训练过程。而且,如果你决定进行合并,选择使用哪些芯片其实并没有你想象中那么重要——尤其是当你已经在混合物中拥有了那个正确的芯片时。
作者总结道,虽然回收 AI 模型的主意很令人兴奋,但现实情况要复杂得多。我们所希望的“正向迁移”是真实的,但在公共 AI 模型这个混乱、未经整理的世界里,它是稀有且脆弱的。这表明我们需要更好的方法来从这一堆数字垃圾中找到真正的“瑰宝”,或者也许我们需要重新思考构建这些模型的方式。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。