想象你拥有一位博学多才、阅书无数的图书管理员(即大型语言模型,或 LLM)。这位管理员几乎读过世界上所有的书,但当你提出一个具体而棘手的问题时,他们有时即使答错了,也会以 100% 的自信进行猜测。这被称为过度自信,非常危险,因为用户可能会仅仅因为管理员听起来很确定,就相信一个错误的答案。
本文介绍了一种名为UQ4CT的新方法来解决这一问题。它相当于教导这位管理员:只有当他们确实确定时,才说“我很确定”;而当他们在猜测时,则说“我不确定”。
以下是其工作原理,通过简单的类比进行分解:
1. 问题:“一刀切”式的微调
通常,当我们希望一位管理员专精于一个新领域(例如气候科学)时,我们会对其进行“微调”。
- 旧方法:想象给管理员一副全新的眼镜(称为LoRA),帮助他们更好地看清新领域。但如果管理员缺乏足够的练习书籍(数据),他们戴上这副眼镜后可能会变得过于自信,即使这副眼镜其实有些模糊。他们无法区分“我知道这个”和“我在猜测”。
- 问题所在:现有方法试图在管理员戴上眼镜之后检查其自信程度。但本文认为,我们需要在管理员学习过程中就修正这副眼镜。
2. 解决方案:“专家小组”(混合专家模型)
UQ4CT 不是只给管理员一副眼镜,而是给他们一个由8 位不同专家组成的“小组”(即“混合专家模型”或 MoE)。
- 设置:想象一个房间里有 8 位不同的专家。当你提出一个问题时,“路由器”(像一位聪明的接待员)会审视你的问题,并决定哪两位专家最适合回答。
- 神奇之处:由于有多位专家,系统可以观察专家们是意见一致还是存在分歧。如果路由器选出的两位专家给出了截然不同的答案,系统就知道存在不确定性;如果路由器选出的两位专家完全一致,系统就知道存在确定性。
3. “校准损失”:讲真话的教练
本文最大的创新在于一位特殊的“教练”,它在学习过程中训练路由器。
- 教练的规则:教练会观察专家们。
- 如果专家们选择了正确的答案,教练会告诉路由器:“干得好!对这个选择要非常自信。”
- 如果专家们选择了错误的答案,教练会告诉路由器:“你太自以为是了!你应该不那么自信,或者应该选择不同的专家。”
- 结果:随着时间的推移,路由器学会将其“自信程度”与实际“真实程度”相匹配。它不再在只是猜测时假装自己是专家。
4. 为什么这比其他方法更好
- 不降低速度:其他一些方法试图让管理员把同一个问题问 10 次,看看他们是否会得到不同的答案(就像向朋友咨询建议 10 次一样)。这既缓慢又昂贵。UQ4CT 只需单次通过即可完成工作,因为“专家小组”直接构建在系统内部。
- 更好的泛化能力:本文在常识性问题以及气候科学等特定领域的问题上测试了该方法。即使当管理员被问及他们未曾见过的主题(即“分布偏移”)时,UQ4CT 依然保持冷静。它不会在新奇、怪异的问题上变得过度自信,而是正确地表明自己不确定。
核心结论
本文声称,通过采用这种“专家小组”方法,并在学习阶段训练系统使其自信度与事实真相对齐,他们将“期望校准误差”(衡量自信度错误程度的指标)降低了超过 25%。
关键在于,他们没有让管理员回答问题时变慢或降低准确性。管理员仍然能给出正确答案,但现在他们更擅长知道自己何时是正确的,何时只是在猜测。
简而言之:UQ4CT 将一种自信但常出错的 AI,转变为一种谦逊但准确的 AI,使其能够知晓自身知识的局限。
技术摘要:面向大语言模型校准微调的功能级不确定性量化
问题陈述
准确的不确定性量化(UQ)对于大语言模型(LLMs)在医疗和科学推理等安全关键领域的可靠部署至关重要。然而,经过微调的 LLM 在适应数据有限的任务时,经常表现出过度自信,未能反映其输出的真实可信度。现有的针对参数高效微调(PEFT)的不确定性量化方法(例如基于低秩适应 LoRA 的方法)大多是事后的。它们通过在训练后分析参数空间(例如通过集成或贝叶斯近似)或扰动提示来估计不确定性。这些方法往往未能解决过度自信的根本原因:模型在适应过程中无法捕捉由微调引起的不确定性以及泛化差距。此外,依赖多次前向传播或大量采样的方法会引入显著的计算开销,限制了可扩展性。
方法论:UQ4CT
作者提出了面向校准微调的功能级不确定性量化(UQ4CT),这是一个将焦点从参数空间转向功能空间不确定性的框架。UQ4CT 不在训练后分析学习到的参数,而是在微调过程中,针对由提示依赖的 LoRA 专家混合所诱导的功能空间进行不确定性校准。
该方法论包含三个核心组件:
基于 MixLoRA 的层次化功能分解:
为了避免跨层建模所有可能的专家组合带来的组合爆炸,UQ4CT 采用层次化分解。它利用专家混合(MoE)架构,在每一层,一个稀疏路由器根据输入隐藏状态动态选择一组 LoRA 专家。这构建了一个灵活的功能空间,其中模型的输出是依赖于输入的多样化基函数(LoRA 专家)的加权和。该功能空间被表示为层间混合的递归组合,允许模型自适应地组合计算路径。
功能级置信度(FLC)估计:
模型通过分析专家选择的一致性来量化不确定性。具体而言,功能级置信度(FLC)源自路由器在每一层选择的 top-k 个专家的路由权重。路由权重的高度集中(即路由器对选择特定专家很有信心)对应于高功能置信度,而分散的权重则表明更高的不确定性。这提供了一种原则性的、内部的模型确定性信号,无需多次采样传播。
校准损失(Lcal):
核心创新是一种新颖的校准损失,它在训练期间将功能级置信度与预测正确性对齐。该损失定义为:
Lcal=(1{MixLoRA(x)=y∗}−FLC(x))2
其中 1{⋅} 是预测正确的指示函数。该目标迫使 FLC 逼近模型预测正确的概率。通过最小化该损失以及标准的交叉熵和负载平衡损失,模型学会仅在可能正确时赋予高置信度,在不正确时赋予更高的不确定性。这鼓励路由器在不确定性高时探索替代的专家混合,从而改善泛化能力。
主要贡献
- 功能级视角: 本文引入了从参数空间到功能空间不确定性量化的转变,明确校准模型在微调期间可实现的对输入 - 输出映射的置信度。
- 感知校准的微调: 提出了一种新的校准损失,动态地将提示依赖的 LoRA 混合权重与预测正确性对齐,在降低过度自信的同时不损害准确性。
- 高效架构: 该方法利用层次化 MixLoRA 架构,以最小的计算开销捕捉多样化的功能关系,在推理过程中仅需一次前向传播。
- 理论保证: 作者证明了优化数据分布上的校准风险会产生最优的 FLC,该 FLC 对应于预测正确性的真实概率。
实验结果
作者在 Llama-3.1-8B 和 Mistral-7B 模型上,针对四个多项选择基准(ARC-E、ARC-C、OBQA、ClimateQA)和两个开放式生成问答任务(TruthfulQA、TriviaQA)评估了 UQ4CT。
- 分布内性能: 与强基线(包括 LoRA、MC Dropout、深度集成和贝叶斯 LoRA)相比,UQ4CT 将基准测试上的期望校准误差(ECE)降低了**25%**以上,同时保持了具有竞争力或更优越的准确性。值得注意的是,UQ4CT 仅通过一次前向传播就取得了这些结果,而像 BLoB(N=10)这样的方法需要十次传播,却仍产生更高的 ECE。
- 分布偏移: 在分布偏移下(在 CS、工程、法律和医学领域的 MMLU 子任务上测试),UQ4CT 保持了卓越的校准能力和具有竞争力的准确性,显示出相比基线对分布外输入具有更强的鲁棒性。
- 生成任务: 在开放式生成中,UQ4CT 在 TruthfulQA 和 TriviaQA 上实现了最低的 ECE,表明功能空间校准视角可延伸至分类风格设置之外。
- 效率: 内存分析表明,UQ4CT 的峰值 GPU 内存使用量仅比标准 LoRA 高约 7.5%,使其在大规模部署中具有计算可行性。
意义与主张
本文主张 UQ4CT 解决了当前微调实践中的一个根本性局限:在适应过程中缺乏不确定性意识。通过将不确定性校准直接整合到基于功能级信号的微调目标中,该方法确保模型的置信度能更好地反映其实际的预测可靠性。作者将这项工作定位为迈向可信微调 LLM 的基础性步骤,特别是在数据稀缺的环境中,过度自信会带来重大风险。他们谦逊地指出,虽然该方法通过使用基于 F1 的代理扩展到了开放式生成,但扩展到长篇幅推理或多步生成仍是未来工作的方向。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。