想象一下,你正在教导一名年轻学徒(学生)去模仿一位大厨(教师)的烹饪风格。通常,你希望学徒只学习你给予他们的特定食谱。但在这篇论文中,研究人员发现了一个隐蔽的问题:即使你告诉学徒忽略主要食谱,仅使用“虚拟”食材(如空碗)进行练习,学徒仍会意外地习得大厨那些秘密且 unwanted 的习惯。
在人工智能领域,这被称为潜隐学习。学徒会习得一种“特质”(例如握刀的具体方式),尽管你从未明确教授过该特质。
以下是该论文的研究发现,通过简单的故事和类比进行拆解:
1. 无形的推力(梯度对齐)
将学习过程想象成一名试图登上山顶的徒步者。
- 目标:徒步者想要登上“蒸馏山”的顶端(学习虚拟食谱)。
- 秘密:有一股温柔而无形的风,将他们吹向“特质谷”(习得不想要的习惯)。
研究人员发现,尽管这股风非常微弱,但它几乎在整个过程中都朝着与徒步者步伐相同的方向吹拂。这就像在一条略微倾斜向陷阱的跑步机上行走。因为风推动的方向与步伐方向一致,徒步者在整个旅程中会一步步地慢慢漂向陷阱。
2. “停止漂移”实验
为了证明这股无形的风确实是导致漂移的原因,研究人员尝试了一种新技巧。他们竖起了一堵墙,这堵墙仅阻挡了吹向陷阱的风,同时让徒步者继续向目标前进。
- 结果:徒步者完美地登上了目标山顶,但从未掉入陷阱。
- 启示:这证明了“风”(学习步骤的对齐)是学徒习得坏习惯的唯一原因。如果你阻挡了那股特定的推力,坏习惯就会消失,即使其余的训练过程看起来完全一样。
3. 无效的“软刹车”
有一种流行的方法称为临界训练(将其想象为“软刹车”或“安全网”)。其理念是每当学徒开始漂移得太远时,就轻轻将他们推回原本的状态,希望能阻止坏习惯的形成。
- 发生的情况:软刹车确实在最初阶段减缓了漂移。它让无形的风在短时间内感觉变弱了。
- 陷阱:刹车并没有真正停止风;它只是让风变得柔和了一些。一旦刹车被释放(随着训练结束),学徒最终还是漂向了陷阱。
- 启示:温柔的推动或暂时的减速是不够的。如果风正将你推向错误的方向,你需要完全阻挡那个特定的方向,而不仅仅是减速。
核心结论
该论文总结道,当人工智能进行学习时,就像一艘被洋流推动的船。
- 如果洋流(学习步骤)甚至只是略微指向危险的暗礁(不想要的特质),船只最终都会撞上它。
- 如果洋流持续将你推向那里,试图仅仅“减速”或“温和转向”以避开暗礁是行不通的。
- 要真正阻止人工智能习得坏习惯,你必须物理性地移除指向暗礁的那部分推力。
简而言之:你不能仅仅指望温和的修正能解决问题。如果学习过程本身正在秘密地将人工智能推向不良行为,你就必须彻底切断那部分特定的推力,才能阻止它。
以下是论文《持续梯度对齐介导多步设置下的亚阈值学习:来自 MNIST 辅助 Logit 蒸馏实验的证据》的详细技术总结。
1. 问题陈述
本文探讨了知识蒸馏(KD)中亚阈值学习(subliminal learning)现象。
- 背景:在 KD 中,学生模型被训练以模仿教师模型。近期研究(Cloud 等人,2025)表明,如果学生模型的初始化接近教师模型,即使蒸馏过程明确仅针对“无类别”logits(辅助输出)且训练数据中不包含该特征的示例,学生模型仍可能无意中习得“特征”(例如未对齐的行为或特定的分类能力)。
- 研究空白:现有理论通过蒸馏目标与特征目标之间的梯度对齐来解释这一现象,但该理论依赖于单步梯度下降假设。目前尚不清楚这种对齐是否在参数随时间演变的现实多步训练设置中持续存在,并因果性地驱动特征习得。
- 缓解挑战:近期的一种缓解策略临界训练(Liminal Training)(Yanagisawa 等人,2025)声称通过使用退火 KL 正则化器来抑制大语言模型(LLM)中的特征习得。尚不清楚该方法是否在一阶梯度效应占主导的设置中有效,或者它是否仅仅推迟了该问题。
2. 方法论
作者使用MNIST MLP 辅助 Logit 蒸馏设置进行了实证实验(复现 Cloud 等人,2025 的工作)。
实验设置:
- 模型:一个具有 10 个类别 logits 和 3 个“无类别”(辅助)logits 的多层感知机(MLP)。
- 初始化:教师模型和学生模型共享完全相同的初始化。
- 教师模型:仅使用 10 个类别 logits(交叉熵)在 MNIST 上进行训练。
- 学生模型:仅针对 3 个无类别 logits 最小化 KL 散度进行训练。
- 目标:观察学生模型是否在训练过程中从未见过类别标签的情况下,获得分类数字的能力(即“特征”)。
调查内容:
- 梯度对齐监测:作者跟踪了特征梯度(∇θLtrait)与蒸馏梯度(∇θLdistill)之间的内积(对齐度),跨越 100 个训练种子。
- 因果干预(梯度投影):为了测试因果关系,他们修改了蒸馏更新规则。每当两个梯度正面对齐时,他们将蒸馏梯度投影到特征梯度的法平面上,从而有效地移除更新中的特征对齐分量:
g~distill={gdistill−∥gtrait∥2⟨gdistill,gtrait⟩gtraitgdistillif ⟨gdistill,gtrait⟩>0otherwise
- 缓解评估(临界训练):他们应用了临界训练,该方法添加了一个 KL 正则化器,使学生的辅助 logits 保持接近基础模型的分布,且正则化强度随时间退火至零。
3. 主要贡献
- 持续对齐的实证验证:证明了特征目标与蒸馏目标之间的正梯度对齐在多步训练过程中持续存在,尽管程度较弱。
- 因果证明:通过展示移除梯度中的特征对齐分量完全阻止了特征习得且未阻碍蒸馏过程,证明了这种对齐是亚阈值学习的主要驱动因素。
- 当前缓解措施的局限性:表明临界训练未能在此机制下抑制特征习得,这表明当一阶效应占主导时,仅仅减弱早期的对齐是不够的。
4. 结果
A. 梯度对齐持续存在
- 观察:在 100 个种子中,**78.1%**的训练步骤中呈现正对齐。
- 幅度:平均余弦相似度较低(0.0075±0.0017),表明梯度近乎正交,但存在轻微且一致的正向偏差。
- 相关性:特征习得(通过数字分类准确率衡量)在对齐度最高的训练早期阶段最快。
- 性能:学生模型达到了平均最终测试准确率55.28%(显著高于 10% 的随机水平),证实了亚阈值学习的发生。
B. 对齐的因果作用(梯度投影)
- 干预:当从蒸馏梯度中移除特征对齐分量时:
- 特征习得:崩溃至接近随机水平(10.14% 准确率,而对照组为 55.28%)。
- 蒸馏质量:未受影响。KL 散度(蒸馏损失)曲线与对照组在视觉上完全相同。
- 结论:这证实了轻微的正向对齐是特征习得的因果机制,且一阶效应在此设置中占主导地位。
C. 临界训练的失效
- 机制:临界训练成功地在第一个 epoch 期间降低了梯度对齐。
- 结果:尽管早期对齐度降低,但它未能抑制特征习得。
- 使用临界训练的最终准确率:48.97%(对照组为 55.28%)。
- 特征习得仅仅被推迟了。随着 KL 正则化强度衰减至零,对齐和特征习得重新开始,导致最终状态与未缓解的对照组相似。
5. 意义与启示
- 机制澄清:本文确立了多步设置下的亚阈值学习是由持续的、微弱的正梯度对齐驱动的,而非一次性初始化效应。
- 对缓解策略的批判:结果挑战了“软”缓解策略(如临界训练)在一阶梯度效应占主导的机制中的有效性。仅仅在训练早期减慢或减弱对齐是不够的;必须显式移除特征对齐分量以防止传递。
- 安全启示:如果学生模型通过此机制从教师模型继承未对齐性,蒸馏数据集上的标准安全过滤器可能无效。本文表明,稳健的缓解需要在梯度空间进行主动干预(例如投影),而不仅仅是正则化。
- 未来研究:作者指出,虽然梯度投影是有效的,但它需要知道“真实”特征梯度,而这在现实场景中往往不可用。开发无需显式真实标签即可识别并移除这些分量的方法,仍然是一个关键的未解难题。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。