← 最新论文
🤖 machine learning

Recoverable but Not Stationary:Local Linear Structures in Weights and Activations

本文表明,尽管神经网络权重和激活中的线性结构并非全局、静态的任务方向,但它们展现出强烈的局部低秩几何特性,这种特性演化迅速却又具有足够的持久性,从而能够通过 LoRA、随机搜索和激活转向等方法实现有效的控制。

原作者: Irina Piontkovskaia, Sergey Nikolenko

发布于 2026-06-10
📖 1 分钟阅读☕ 轻松阅读

原作者: Irina Piontkovskaia, Sergey Nikolenko

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你拥有一座巨大的、极其复杂的图书馆(一个训练好的 AI 模型),它知道如何讲笑话、解数学题以及写诗。长期以来,研究人员一直认为,如果你想教这个图书馆一个新技巧或者纠正一个坏习惯,你只需要找到图书馆里的一条特定的走廊并沿着它走下去。他们认为这条走廊是一条永久的、固定的道路,无论你何时造访,它都会通向同一个目的地。

这篇论文说:“并不完全是这样。”

以下是作者通过简单的类比所发现的实际情况:

1. “移动目标”问题

旧观点认为,每一项任务(比如“写一个笑话”)都存在于一张静态地图上。如果你想找回遗忘的技能,你只需要找到那张特定的地图,然后沿着直线走即可。

作者发现,这张地图并不是静态的,它是漂移的

  • 类比: 想象你正试图走向朋友家。你开始走路,但你所在的街道实际上是一个正在横向移动的传送带。如果你根据出发时房子所在的位置尝试走直线,你就会错过它。
  • 发现: 修复被遗忘任务的“方向”不是一条固定的线。它是一个短促的、移动的路径。恢复一项技能的最佳方式是跟随恢复旅程本身的最初几步,而不是根据模型昨天的状态去猜测一个静态方向。

2. “大海捞针”的迷思

曾有一种理论认为,在巨大的 AI(拥有数十亿个参数)中寻找有用的变化,就像在规模如山的大海里寻找一根针。你会认为随机猜测永远不会奏效。

作者说:随机猜测实际上效果出奇地好,但前提是你必须遵守特定的规则。

  • 类比: 想象你正在对着一面巨大的墙投掷飞镖。你想击中一个微小的、隐形的靶心。
    • 如果你只投掷一枚飞镖,你很可能会错过。
    • 但如果你投掷 1,000 枚飞镖,并保留其中离中心最近的那一枚,你几乎肯定能击中靶心。
    • 关键在于: 你必须温柔地投掷。如果你投掷得太用力(变化太大),你会撞到墙面的曲率并向错误的方向弹开。如果你投掷得太轻,它们就无法移动。在力量的“金发姑娘区”(适中区间)内,随机猜测每次都能找到正确的路径。
  • 发现: 你不需要知道地图。如果你进行微小的、随机的变化并挑选最好的那一个,你就可以在不从头开始重新训练模型的情况下改进模型。

3. “影子”的联系

这篇论文还将两个通常看起来无关的东西联系了起来:改变大脑(权重)和改变思想(激活)。

  • 类比: 想象 AI 的“大脑”是一台带有齿轮(权重)的机器。当你调整一个齿轮时,它会在墙上投射出一个“影子”(激活)。
  • 发现: 作者发现,如果你通过微调齿轮来解决问题,它在墙上投射出的影子几乎与研究人员通常需要手动设计的“转向向量”一模一样。
  • 结果: 你可以通过微调齿轮来修理机器,而这种微调会自动创造出一个用于控制思想的“方向盘”。你不需要单独制造方向盘;齿轮的微调会为你自动生成它。

4. 这对“编辑”AI 意味着什么

这篇论文挑战了 AI 行为被固定在某个固定位置的观点。

  • 旧观点: “任务 A 住在 1 号房间。任务 B 住在 2 号房间。它们是分离的。”
  • 新观点: “任务 A 和任务 B 就像一场舞蹈。随着音乐的播放,舞步也在变化。要修复一个错误,你不需要回到歌曲的开头;你要跟随接下来的几步节奏。”

总结“规则”

论文最后为任何想要微调 AI 的人总结了三个主要结论:

  1. 不要寻找固定的地图: 修复问题的方向会随着你的修复过程而移动。请跟随即时的路径,而不是静态的计划。
  2. 随机搜索是有效的(只要你足够小心): 你可以通过尝试随机的小幅微调来找到好的变化,只要保持微调足够小,处于数学原理起作用的“线性”区域内即可。
  3. 齿轮与影子相匹配: 如果你修复了内部的齿轮,外部的思想自然会与修复后的状态保持一致。

这篇论文并未声称:

  • 它并未声称这是对标准训练(梯度下降)的完美替代。
  • 它并未声称这在每一个单一任务或每一个模型规模上都能完美运作(它在较小的模型或特定的“适配器”上表现最好)。
  • 它并没有提供一种从头开始训练模型的新方法,而是一种在模型训练完成后对其进行理解和微调的方法。

简而言之:AI 的行为不是固定的地标,而是流动的潮流。要航行其中,你需要跟随潮流,而不是依赖地图。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →