← 最新论文
🤖 machine learning

Beyond Post-Hoc Temperature Scaling: Bilevel Optimization for LLM Calibration

本文提出了一种实用的双层优化框架,通过在训练过程中最大化预测熵来校准大语言模型,有效地克服了传统事后温度缩放(post-hoc temperature scaling)的领域局限性,并提升了分布外泛化能力。

原作者: Ruochen Jin, Zhanliang Wang, Zongyu Dai, Jiancong Xiao, Bojian Hou

发布于 2026-08-10
📖 1 分钟阅读☕ 轻松阅读

原作者: Ruochen Jin, Zhanliang Wang, Zongyu Dai, Jiancong Xiao, Bojian Hou

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正在教一位才华横溢的学生,他读遍了图书馆里的每一本书。这位学生是一个大语言模型(LLM),一种可以写故事、解数学题并像人类一样聊天的人工智能。但有一个问题:这个学生对自己知识的判断力非常糟糕。他们往往过度自信。如果他们不知道答案,可能会说:“我有99%的把握是对的!”但实际上他们是错的。在现实世界中,这是很危险的。如果一个医疗AI在诊断时有99%的把握却错了,人们可能会受到伤害。

为了解决这个问题,科学家们尝试了一种叫做“温度缩放”(Temperature Scaling)的小技巧。把AI的信心想象成立体声机的音量旋钮。如果音乐太响且失真(过于自信),你就把旋钮调小,让声音变得柔和且更真实。这在只听一首歌(一个特定数据集)时效果很好。但问题在于,“音量旋钮”的设置适合摇滚乐,但不一定适合爵士乐。如果你尝试用同样的设置来回答不同类型的问题,AI要么依然太吵,要么变得太安静。旧的方法就像是试图用一个单一的旋钮去调频整个城市的广播;这根本行不通。

这就是发表在 COLM 2026 会议论文中的一项新研究所提出的聪明新思路。研究人员不再仅仅是在学生学习结束后才去转动旋钮,而是决定改变学生最初学习的方式。他们创建了一种特殊的训练方法,叫做 CALM(通过双层优化实现大模型的校准)。

以下是 CALM 的工作原理,我们用一个简单的类比:想象一位教练在训练运动员。

  • 旧方法(事后缩放/Post-Hoc Scaling): 运动员跑完比赛,累了,然后教练说:“好吧,下次跑慢一点。”教练是在事后尝试调整速度。但如果地形改变了(不同的数据集),旧的建议就不再适用了。
  • CALM 方法(双层优化/Bilevel Optimization): 教练建立了一个两层结构的训练营。
    • 第一层(运动员): 运动员练习跑步,以变得更快、更聪明(这是模型学习如何回答问题)。
    • 第二层(教练): 在运动员跑步的同时,教练实时观察并调整训练规则。教练的目标不仅是让运动员跑得快,还要确保运动员清楚自己到底跑得有多快。如果运动员开始吹嘘(“我是最快的!”),教练会轻轻地引导他们变得谦逊且务实。

研究人员发现,通过这种“两层”系统训练模型,AI学会了自然地保持自信,但不会“过度”自信。他们在四种流行的AI模型(如 Llama-3.1、Vicuna、OLMo 和 Mistral)以及两类测试(多选题和开放式创意写作)上进行了测试。

结果非常令人鼓舞。当AI接受从未见过的测试(即“分布外”测试,就像是为学过摇滚乐的学生播放爵士乐)时,CALM 的表现比旧的“音量旋钮”方法好得多。旧方法往往会让AI在面对新话题时更加困惑或更加过度自信。然而,CALM 却能将AI的信心控制在合理范围内。例如,在名为 Mistral-7B 的模型上,旧方法留下的校准误差为 0.335(非常过度自信),而 CALM 将其降至 0.0822(准确得多)。

至关重要的是,研究人员展示了这种方法并不会让AI变“笨”。模型仍然能正确回答问题,只是不再对自己的确定程度撒谎。该论文表明,这种方法是一个强有力的进步,特别是对于那些需要处理意外问题,且不需要人类每次都手动调整设置的场景。这是一种教导AI无论讨论什么话题,都能保持谦逊、诚实和可靠的方法。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →