← 最新论文
🤖 machine learning

Annotation Entropy Predicts Per-Example Learning Dynamics in LoRA Fine-Tuning

该研究发现,在 LoRA 微调过程中,标注熵(即标注者分歧度)较高的样本会出现“遗忘”现象(训练损失不降反升),且这种标注熵与样本损失曲线下的面积(AULC)之间存在显著的正相关关系,这一规律在多种模型和实验中均得到验证。

原作者: Brady Steele

发布于 2026-04-21
📖 1 分钟阅读☕ 轻松阅读

原作者: Brady Steele

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文发现了一个关于人工智能(AI)如何学习的有趣现象,特别是当我们在大型语言模型上使用一种叫 LoRA 的“轻量级”微调技术时。

为了让你轻松理解,我们可以把训练 AI 模型想象成教一个学生(AI)做一套复杂的逻辑题(自然语言推理任务)

1. 核心发现:AI 也会“越学越糊涂”

通常我们认为,学生做题时,简单的题先学会,难的题后学会。如果一道题很难,学生可能会做错题,但随着老师(训练过程)不断讲解,他最终应该能学会,或者至少不再犯错。

但这篇论文发现,在使用 LoRA 这种特定的学习方法时,对于那些人类专家自己都争论不休的“争议题”,AI 竟然出现了**“越学越错”**的现象。

  • 正常情况(全量微调): 就像请了一位全能的大教授来教学生。无论题目多难,教授都能把学生教好,学生的错误率会一直下降,直到学会为止。
  • LoRA 的情况(轻量级微调): 就像请了一位**“戴着镣铐”的助教**。这位助教能力有限(受限于 LoRA 的低秩约束),他只能教学生掌握那些大家意见一致、没有争议的“标准答案”
    • 对于**“干净题”**(大家意见一致):助教教得很好,学生很快学会了。
    • 对于**“争议题”(人类专家都吵得不可开交):助教为了把时间花在“标准答案”上,不仅没教会这些题,反而把学生原本可能懂的一点皮毛给“忘”了,甚至越教越错**。论文把这种现象称为**“遗忘式学习” (Un-learning)**。

2. 什么是“标注熵”?(如何识别争议题)

论文里用了一个叫**“标注熵” (Annotation Entropy)** 的指标来衡量题目有多“争议”。

  • 比喻: 想象每道题都有 100 个老师来打分。
    • 低熵(干净题): 100 个老师里有 99 个都选 A。大家意见高度统一,这道题很清晰。
    • 高熵(争议题): 100 个老师里,30 人选 A,30 人选 B,40 人选 C。大家吵成一团,谁也说服不了谁。这道题本身就模棱两可。

论文发现,“标注熵”越高(争议越大),AI 在 LoRA 模式下学起来就越痛苦,甚至最后越学越错。

3. 为什么会出现这种情况?(戴镣铐的舞者)

这就好比让一个**只会跳简单舞步的舞者(LoRA)**去表演。

  • 全量微调(Full Fine-Tuning): 舞者可以自由发挥全身肌肉,既能跳简单的舞步,也能为了配合复杂的音乐(争议题)去调整动作,虽然难,但能跳好。
  • LoRA 微调: 舞者被绑住了大部分关节,只能动几个关键部位(低秩空间)。
    • 为了跳好那些大家都认可的“标准舞步”(干净题),他必须把有限的精力全部集中在这里。
    • 一旦遇到“争议题”,因为他的关节被锁死了,无法做出复杂的调整。更糟糕的是,为了维持那些“标准舞步”的稳定性,他被迫放弃了对“争议题”的尝试,甚至把原本稍微能做的动作也忘了。
    • 结果: 他的动作(损失函数)在那些争议题上反而变差了。

4. 关键结论

  1. LoRA 有副作用: 虽然 LoRA 很省资源、很流行,但它有一个隐藏缺陷:它会自动“抛弃”那些人类自己都搞不清楚的模糊数据。 如果你训练的数据里有很多这种模糊数据,用 LoRA 可能会导致模型在这些数据上表现更差。
  2. 大模型更明显: 论文发现,这种“越学越错”的现象在解码器模型(如 Qwen 系列,类似现在的聊天机器人)中比在编码器模型中更明显。
  3. 不是校准问题: 有人可能会猜,是不是因为 AI 太自信了(校准问题)导致出错?论文证明不是。即使是全量微调(更自信),也不会出现这种“越学越错”,只有 LoRA 会。这说明是**“能力受限”**导致的,而不是“太自信”。

5. 这对我们意味着什么?

  • 选对工具: 如果你的任务涉及很多模糊、有争议的内容(比如医疗诊断、法律判决、情感分析),不要盲目使用低秩的 LoRA,可能需要更大的模型容量或全量微调。
  • 监控学习过程: 在训练 AI 时,不能只看最终分数。要像老师观察学生一样,盯着那些“争议题”的学习曲线。如果发现 AI 在这些题上越学越错,就要警惕是不是模型“戴了镣铐”(参数太少)。
  • 未来的方向: 我们需要开发更聪明的训练策略,让 AI 在面对“人类都没答案”的问题时,不是强行遗忘,而是学会保持“我不知道”的谦逊,或者找到更好的处理方式。

一句话总结:
这篇论文告诉我们,给 AI 穿上一件“紧身衣”(LoRA)虽然省布料(算力),但会让它在面对那些人类专家都吵不出结果的难题时,不仅学不会,反而会把原本会的东西给忘掉

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →