Estimating Uncertainty in Classifier Performance with Applications to Large Language Models and Nested Data
本文评估了在社会科学文本分类典型条件下(如小样本量和嵌套数据)的分类器性能指标置信区间方法,证明了标准方法往往会产生不准确的覆盖率,并推荐了如 Agresti-Coull、Wilson 和层级自助法等更优的替代方案,以提高机器学习应用中的透明度和验证性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你是一位刚刚发明了一款“完美巧克力蛋糕”新食谱的大厨。你想向世界宣告它有多好。你不能只说:“它有90%的美味度。”你需要证明它。于是,你邀请了20个人来品尝。其中18个人说:“是的,这太棒了!”
在计算机科学和大型语言模型(LLM)的世界里,这正是研究人员所做的事情。他们训练计算机阅读文本并将其分类(例如“愤怒”、“快乐”或“垃圾邮件”)。为了证明他们的计算机很聪明,他们会展示一组已经被人类评分过的文本样本,并计算出一个分数,比如“召回率”(Recall,即计算机找到了多少个“愤怒”的文本?)。
问题:“置信度”的“猜谜游戏”
本文指出,研究人员目前正在玩一场危险的“猜谜游戏”。他们报告他们的得分(例如“90%的准确率!”),但很少报告他们对这个数字有多大的把握。
把它想象成天气预报。如果气象学家说:“有90%的降水概率,”那是很有用的。但如果他们只说“会下雨”,而没有告诉你是基于卫星图像还是一个猜测,你就无法信任他们。
在这篇论文中,作者 Kylie Anglin 指出,当研究人员使用小规模人群来测试他们的计算机,或者当“降雨”(即他们寻找的特定文本)非常稀有时,标准的计算“我们有多确定”的方法(称为置信区间)往往是失效的。它们就像一把会不可预测地缩短或拉长的尺子。
“坏掉的尺子”(旧方法)
论文测试了几种衡量这种确定性的方法。它发现目前最常用的两种方法就像是用橡胶做的尺子:
- Wald 区间: 这是“教科书式”的方法。如果你有一个庞大的群体且结果平庸,它运行得很好。但如果你只有一小群人或者得分非常高(比如95%),这把尺子就会过度收缩。它会告诉你:“我们有95%的把握确定得分在94%到96%之间,”但实际上,真实的分数可能在80%到100%之间的任何地方。它提供了一种虚假的精确感。
- 基础自助法(Basic Bootstrap): 这是一种通过在计算机上模拟实验数千次来观察结果的方法。论文发现,标准版本的自助法也是“摇摆不定”的,并且经常低估风险,尤其是在样本量较小时。
“更好的尺子”(新建议)
论文建议将那些橡胶尺子换成不容易拉伸的更坚固的尺子。
- 针对独立文本(“单人”测试): 如果每段文本都来自不同的人且完全独特,作者建议使用 Agresti-Coull 方法。你可以把它想象成在你的计算中加入一点“安全垫”。它简单、易于计算,并且能防止你的尺子缩得太厉害。
- 针对复杂的指标(如 F1 分数): 有些分数是不同指标的复杂组合(比如 F1 分数)。你不能使用简单的公式来处理这些。作者提出了一种被称为 伪计数正则化(Pseudo-Count Regularization) 的新技巧。想象你在烤蛋糕,但你担心食材不够。你在开始混合之前,加入了一些“幽灵食材”(一个虚拟的鸡蛋和一杯虚拟的面粉)。这稳定了配方,使得即使你只有少量真实的食材,最终结果也不会崩溃。这种方法让计算机模拟变得更加可靠。
“回声室”问题(嵌套数据)
这里是事情变得棘手的地方。在现实生活中,人们不仅仅写一句话;他们会写很多。一位治疗师可能会写30份笔记;一名学生可能会写20篇论文。这些文本是“嵌套”在人身上的。它们不是独立的;它们共享相同的声音、风格和怪癖。
论文解释说,如果你把一个人的30份笔记视为30个不同人的30份笔记,你就是在作弊。你在欺骗自己,让你以为拥有的数据比实际拥有的更多。这就像是请一位朋友品尝你的蛋糕30次,然后把这算作30个不同的意见。你并没有得到30个意见,你只是得到了一个意见被重复了30次。
当你忽略这种“回声室”效应时:
- 你的置信区间会变得过窄。你以为你有95%的把握,但实际上你可能只有65%的把握。
- 解决方法: 论文提出了两种主要的修复方法:
- 调整数学公式: 使用一个公式来缩小你的“有效样本量”,以考虑到文本之间的相关性。这就像是说:“我们有30份笔记,但因为它们都来自同一个人,所以它们只算作10个独立的意见。”
- 层次自助法(Hierarchical Bootstrap): 与其在计算机模拟中仅仅随机打乱单个笔记,不如先打乱“人”,然后再打乱属于每个人的笔记。这尊重了笔记属于特定个人的事实。
核心结论
这篇论文的核心信息是对诚实报告的呼吁。
- 不要只报告分数。 如果你说你的计算机准确率是90%,你也必须同时说:“我们有95%的把握确定真实的数值在X和Y之间。”
- 使用正确的工具。 对于小规模或高性能的数据集,不要使用旧的橡胶尺子(Wald 或基础 Bootstrap)。请使用更坚固的尺子(Agresti-Coull 或新的伪计数方法)。
- 警惕集群现象。 如果你的数据来自同一群人在不同时间多次写作,你需要调整你的数学计算,以避免过度自信。
通过使用这些更好的方法,研究人员可以停止假装自己比实际知道得更多。这有助于他们意识到何时需要收集更多数据(更多的人、更多的文本),从而获得真正可靠的结果,而不是仅仅寄希望于他们的小样本量足以支撑结论。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。