Calibrated Preference Learning: The Case of Label Ranking
本文正式建立了概率标签排序中校准概念的层级结构,证明了现有模型往往缺乏这种校准性,并表明校准是衡量奖励模型除标准准确率之外的一个独立且有价值的质量指标。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下你是一名天气预报员。如果你说有 70% 的降水概率,并且在所有你做出这种预测的日子里,恰好有 70% 的日子确实下了雨,那么你就是经过校准的(calibrated)。你的信心与现实相符。如果实际只下了 30% 的雨,那么你就过度自信且不可靠。
这篇论文是关于如何将这种“让信心匹配现实”的思想,应用于一种特定类型的 AI 问题,即标签排序(Label Ranking)。
问题所在:排序 vs. 猜测
通常,AI 模型擅长简单的选择:“这是猫还是狗?”或者“会下雨吗?”但在标签排序中,AI 必须对一整组事物进行排序。
- 例子: 想象你有五部电影。AI 不仅仅是选出最好的那一部;它必须预测出整个列表的顺序:电影 A 是第 1 名,电影 B 是第 2 名,电影 C 是第 3 名,依此类推。
论文指出,虽然我们知道如何检查一个 AI 是否擅长猜测单个赢家,但我们尚未找到如何检查它是否擅长以正确的置信度预测整个列表。
“天真”的错误
解决这个问题的一种方法是将每一个可能的列表视为一个独立的类别。如果你有 5 部电影,就有 120 种可能的顺序(5 x 4 x 3 x 2 x 1)。你可以把这当作一个拥有 120 个不同盒子的游戏。
- 缺陷: 这就像试图通过数清沙滩上每一粒沙子来检查你拥有的沙量是否正确。对于大型列表来说,这在计算上是不可能的。
- 缺失的部分: 它还忽略了结构。如果 AI 很有信心认为电影 A 比 电影 B 更好,那么即使它把列表中的其余部分排错了,这也应该算作一种贡献。这种“天真”的方法错失了这些更小、更有用的线索。
解决方案:一种层级化的“校准”
作者提出了一个具有不同检查层级的框架,就像在地图上缩放一样:
- 全秩校准(Full-Rank Calibration,整个地图): AI 预测每一种可能顺序的概率。如果它说顺序 X 的概率是 10%,那么顺序 X 应该在 10% 的情况下发生。这是最难达到的标准。
- 子排序校准(Sub-Ranking Calibration,放大观察): 我们只关注小的区块。例如,“AI 是否有信心认为 电影 A 比 电影 B 更好?”论文表明,擅长处理整个地图并不自动意味着你在缩放后的区块上也表现良好,反之亦然。
- Top-K 校准(Top-K Calibration,头条新闻): 通常,我们只关心前 3 名或前 5 名。例如,“AI 是否有信心认为 电影 A 在前 3 名之内?”这是另一种不同的检查方式,它也无法由前两者自动保证。
重大发现: 作者从数学上证明了这些是相互独立的。你可以拥有一个在预测前 3 名电影方面非常完美,但在预测完整列表方面表现糟糕的 AI。你可以拥有一个在处理特定配对时很困惑,但在处理完整列表时表现出色的 AI。它们是不同的技能。
现实世界测试:“电影”与“政治”考试
研究人员在真实数据上测试了流行的 AI 模型(如 Plackett-Luce 和 Mallows),例如:
- 电影: 对 15 部不同的影片进行排序。
- 政治: 根据用户偏好对 6 个政党进行排序。
结果显示:
- 大多数这些流行的模型校准效果很差。它们往往要么过度自信,要么缺乏信心。
- 一个模型可能在预测前 2 名电影方面表现出色,但在预测列表剩余部分时却完全错误。
- 他们还测试了用于 RLHF(基于人类反馈的强化学习)的模型,这是用于训练像你现在正在对话的这类大语言模型(LLM)以使其变得有用且安全的技术。他们发现,即使在这里,校准也是一种区别于仅仅获得“正确”答案的独立质量。一个模型可以很准确,但其置信度水平仍然是“脱节”的。
为什么这很重要
把校准看作是 AI 的诚实度计。
- 如果 AI 说:“我 99% 确定这是最好的电影,”但它实际上只有 50% 的时间是对的,那么它在欺骗你(或者说,它很困惑)。
- 如果 AI 说:“我只有 50% 的把握,”但它正确率高达 99%,那么它就显得过于谦逊了。
论文的结论是,我们需要新的工具来专门衡量这种针对排序任务的“诚实度”。我们不能仅仅使用那些为简单的“是/否”问题设计的旧工具。通过理解这些不同层级的校准(完整列表 vs. 前几项 vs. 配对),我们可以构建出不仅能得到正确答案,而且还能以真正符合现实的方式告诉我们它们有多确定的 AI 系统。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。