← 最新论文
💻 computer science

A Lightweight Calibration-Selection Policy After a Probe Fit for Selective Classification on OpenML Tabular Tasks

本文提出并评估了一种用于 OpenML 表格任务上选择性分类的轻量级、基于探测的策略,该策略在原始预测、温度缩放和狄利克雷校准之间进行动态选择,证明了这种条件选择相比于通用校准或不进行校准,能够提高概率准确性和弃权质量。

原作者: Haolun Tang, Jingyi Zhan, Yan Feng, Zhipeng Chen

发布于 2026-09-09
📖 1 分钟阅读☕ 轻松阅读

原作者: Haolun Tang, Jingyi Zhan, Yan Feng, Zhipeng Chen

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在机器学习的世界里,计算机通常通过寻找数据中的模式来学习如何做出预测。一旦模型学会了如何猜出正确答案,它通常会分配一个数字来代表它对该猜测的把握程度。长期以来,研究人员一直假设提高这些置信度数字的准确性总是一件好事。他们将一种被称为“校准”(calibration)的过程视为一个标准的最后步骤,就像是为镜头抛光以使图像更清晰一样。人们希望,如果计算机的置信度数字能与现实更紧密地匹配,系统就会变得更聪明,知道何时开口说话,何时保持沉默。这种保持沉默的能力,被称为“弃权”(abstention),在涉及高风险的情况中至关重要——在这些情况下,给出一个错误的猜测比不给出任何猜测后果更严重。例如,如果一个医疗诊断工具不确定,与其自信地给出一个错误的诊断,不如承认不确定性并请求人类的帮助。

然而,一项新的研究表明,这种标准的抛光步骤并不总是会有帮助,在以“何时保持沉默”为目标时,有时甚至可能适得其反。来自上海电子科技大学的研究人员调查了这种自动抛光过程对于处理涉及表格数据的特定类型计算机任务是否真正有益。他们研究了一组包含十五个不同现实问题的集合,范围从识别手写数字到分类土壤类型。他们测试了应用一种数学修正方法来调整计算机置信度分数,是否真的能提高系统决定何时弃权的能力。他们的发现是一个令人惊讶的脱节:虽然这种修正确实使置信度数字在平均意义上更加准确,但它往往以一种破坏数字排序的方式扰乱了这些数字,从而损害了系统决定何时退出的能力。简而言之,提高数字的精确度并不自动意味着让“说话或保持沉默”的决策变得更好。

为了理解为什么这很重要,请想象一位天气预报员,他非常擅长预测降雨,但有时会搞错事件的先后顺序。如果他说周一降雨概率为90%,周二降雨概率为95%,但计算机的内部排序却暗示周二的可能性低于周一,那么一个依赖于该排序来决定何时发布预警的系统就可能会失效。研究人员通过对预训练的计算机模型进行测试,并在这些十五个数据集上进行了研究。他们将模型的原始、未经抛光的置信度分数与经过两种不同数学方法调整后的版本进行了比较。其中一种方法只是拉伸或压缩置信度标尺,而另一种方法则应用了一种旨在处理多种可能结果的更复杂的转换。他们衡量了两点:一是最终的数字与事实的匹配程度,二是系统执行“预测还是弃权”这一任务的表现。

结果显示,这两个目标之间存在明显的张力。平均而言,调整后的模型确实产生了更好的概率数字,这意味着置信度分数更接近正确答案的实际频率。然而,这种准确性的提升是以牺牲某些性能为代价的。在近一半的情况下,这种调整实际上使系统在决定何时弃权方面变得更差了。研究人员发现,数学上的变化虽然修正了数字,但有时会打乱预测的顺序,从而误导了用于决定何时停止的规则。一个原本擅长识别哪些样本较难的模型,可能会因为重新排序而使得原本困难的样本看起来变容易了,从而导致系统做出它本应避免的自信错误。这一发现挑战了“校准是适用于每个模型的通用修复手段”这一观点。

与其盲目应用这些修复方法,作者提出了一种更聪明、更轻量化的方法。他们开发了一个简单的决策工具,充当“守门员”。在模型投入使用之前,该工具会通过检查一小部分数据的特定信号,来决定这种调整是否值得保留。它会观察调整是如何改变置信度分数的,以及这些变化看起来是有助于还是损害了预测的排序。如果信号表明这种调整能提高系统正确弃权的能力,该工具就会保留这一修正;如果信号表明这会导致混乱,该工具则会丢弃修正,并坚持使用原始的、未经调整的模型。这种策略使得系统能够在有益时保留校准的优势,同时在无益时规避陷阱。

研究人员在同样的十五个数据集上测试了这个“守门员”,发现它表现良好。该工具大约有56%的时间能成功识别出何时应该应用调整。当它做出选择时,系统在整体性能上看到了小幅但具有实际意义的提升,与始终应用修正的方法相比,它显著减少了做出错误决策的次数。研究人员还对比了不同类型的守门员,将一个简单的线性模型与一个更复杂的树状结构进行了对比。他们发现,简单的线性模型实际上是更好的选择,在不同的任务中表现得更为稳定。这表明,一个简单的检查通常就足以做出正确的判断,而不需要一个复杂的系统来完成这项工作。

这些发现为任何构建需要知道何时保持沉默的系统的人提供了实用的教训。这项研究并不是说调整置信度分数是不好的;相反,它表明决定是否调整不应该是自动化的。拥有准确的数字与在何时说话方面做出正确决策之间的关系并不是一条直线。有时,使数字更精确反而会掩盖系统识别何时停止所需的关键信号。通过使用轻量级的检查来决定是否保留调整,开发者可以避免使系统变得不再可靠的风险。这种方法将校准视为一个有条件的工具,仅在证据表明它确实有帮助时才使用,而不是将其视为一个强制性的最后步骤。

研究人员谨慎地指出,他们的结论是基于特定的数据集和两种特定的调整方法。他们并没有测试每一种可能的数据类型或每一种可能的置信度调整方式。他们的结果针对的是所研究的包括识别字母和土壤分类在内的十五个数据集。他们还注意到,虽然在弃权能力方面的改进在统计学上是显著的,但在绝对数值上却很微小。这意味着,虽然该方法有效,但它并不是解决所有问题的“灵丹妙药”。其价值在于避免伤害,而非实现巨大的收益。这项研究提醒我们,在复杂系统中,通往更好性能的路径往往在于知道何时停止以及何时继续,而不是仅仅单方面地用力推进。

最终,这项工作将讨论的重心从“是否要校准”转向了“何时要校准”。它表明,最好的做法是在一小部分样本上进行拟合,检查结果,然后决定是否保留。这种“拟合并检查”的方法比假设调整总是好或总是坏要更可靠。通过将决策视为一种有条件的选择而非固定规则,研究人员为在出错成本高昂的情况下使机器学习系统更加稳健提供了一种方法。研究证实,虽然可以教会计算机变得更准确,但这种准确性并不总是能转化为更好的判断力,而在设计过程中加入一点人类式的谨慎,往往大有裨益。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →