想象一下,你正在试图弄清楚一个难题的真正答案,比如“这颗牙齿是否有龋齿?”或者“这句话在逻辑上是否能由前一句话推导出来?”你自己并不知道答案,所以你请了一群人来投票。
在过去,处理这种问题的标准方法是多数投票法(Majority Voting):如果 10 个人中有 6 个人说“是”,那么答案就是“是”。但本文指出,这就像是请满屋子的人来猜一个南瓜有多重:有些人是专家,有些人是在随机瞎猜,还有一些人则在故意误导你。如果你只是简单地取平均值,得到的结果会是混乱且带有偏差的。
本文介绍了一种更聪明、更具数学逻辑的方法来倾听群众的声音,称为层次贝叶斯众包(Hierarchical Bayesian Crowdsourcing)。以下是其工作原理,通过简单的概念进行拆解:
1. 问题所在:并非所有投票者都是平等的
作者指出,在现实生活中,投票者(或“评分者”)是非常复杂的:
- 专家: 总是能答对。
- 困惑者: 答对的概率只有一半。
- 赌徒: 随机乱猜。
- 杠精(Troll): 知道正确答案,但故意投出相反的票(即“对抗性评分者”)。
旧模型(如著名的 Dawid-Skene 模型)试图通过询问:“当答案为‘是’时,这个人说‘是’的准确率是多少?”以及“当答案为‘否’时,他们说‘否’的准确率是多少?”来解决问题。但这些模型将每一个项目(比如每一颗牙齿或每一句话)都视为同样容易判断的。它们忽略了一个事实:有些项目本身就是很难的。
2. 解决方案:三层过滤器
作者构建了一个新模型,它像一个精密的过滤器,为每一个被评分的项目都设置了三个特定的调节旋钮:
- 难度(高山): 有些项目本身就很难判断(像是一座陡峭的高山)。即使是专家也可能感到吃力。模型会学习哪些项目是“陡峭的高山”,哪些是“平坦的小丘”。
- 辨别度(放大镜): 有些项目能清晰地将专家与新手区分开来。如果一个项目的“辨别度”高,专家们会达成一致,而新手们则会各执一词;如果辨别度低,所有人都会感到困惑。
- 可猜性(幸运硬币): 有时,即使面对一个无法判断的项目,人们也可能靠运气猜中正确答案。模型考虑了这种“幸运硬币”因素,因此不会将一次幸运的猜测误认为是真正的技能。
3. 捕捉“杠精”
本文的一个主要创新在于如何处理对抗性评分者(即那些故意投出相反票数的“杠精”):
- 旧方法: 数学计算经常会产生混淆,误以为一个“杠精”其实是一个看法不同的专家。这造成了“双峰问题”(即在数学上看起来有两个同样正确的可能答案)。
- 新方法: 作者增加了一条规则:“我们假设没有人是故意在耍我们。”他们在数学上约束了模型,使得一个评分者的表现不会比“随机猜测”还要差。如果某人的投票表现得像是在随机乱猜,模型会将他们视为“垃圾信息”型投票者,而不是“负向”专家。这使得最终答案更加稳定和可靠。
4. “概率性”的秘诀
通常,当我们利用众包数据来训练计算机(如神经网络)时,我们会强迫计算机选择一个单一的“金标准”答案(例如,“是,有龋齿”)。
- 本文的洞察: 这丢弃了有价值的信息。
- 更好的方法: 模型不再强迫给出“是”或“否”,而是告诉计算机:“有 70% 的概率存在龋齿,但我们不能 100% 确定。”
- 类比: 想象你在训练一名学生。
- 旧方法: 你告诉学生:“答案是 A。”如果学生当时不确定,他们就直接死记硬背下了“A”。
- 新方法: 你告诉学生:“根据群众反馈,有 70% 的概率是 A,但要小心,证据并不充分。”
- 结果: 本文展示了使用这些“不确定的概率”进行训练,会让计算机变得比使用强制性的硬标签更聪明。
5. 是否奏效?(实测)
作者在两个现实世界的数据集上测试了他们的模型:
- 牙科 X 光片: 5 名牙医对数千张图像进行龋齿判定。
- 语言任务: 近 200 名互联网工作者对句子对的逻辑含义进行评分。
测试结果:
- 他们的新模型(包含了难度、辨别度和可猜性)在预测真实答案方面表现最佳。
- 旧的“多数投票法”和较旧的“Dawid-Skene”模型未能捕捉到数据的真实情况。它们认为存在比实际更多的“中庸”投票。
- 新模型正确识别出某些项目确实难以判断,且某些评分者是不可靠的,从而描绘出了一个更清晰的真相图景。
总结
可以将这篇论文看作是从一个简单的计票器向一位侦探的升级。侦达不仅仅是在数人头,还在观察谁在投票,问题有多难,以及有人是在靠运气猜还是在故意捣乱。通过这样做,他们可以更准确地重建真实的“金标准”答案,从而帮助训练出更强大的 AI 系统。
技术摘要:结合项目难度的层次贝叶斯众包模型
问题陈述
在应用统计学和机器学习领域,训练数据往往依赖于具有噪声、偏差以及在标注者与项目之间存在不一致性的众包评分。虽然广泛使用的 Dawid 和 Skene (1979) 模型可以调整标注者的敏感度和特异性,但它无法捕捉评分数据的分布特性,例如项目难度、区分度和猜测性的连续变化。此外,现有模型往往难以处理由对抗性标注者(即那些系统性地倾向于给出错误而非正确答案的标注者)引起的识别性问题,并且未能充分建模标注者与项目的异质性。诸如多数投票之类的启发式方法忽略了不确定性,导致估计偏差并降低下游任务的性能。
方法论
作者提出了一种用于二元众包评分的通用层次贝贝叶斯测量误差模型。该框架通过整合标注者特定的敏感度和特异性,以及项目层面的参数(难度、区分度和猜测度),对项目反应理论(IRT)进行了扩展。
生成模型: 模型假设每个项目 i 具有潜在类别 zi∈{0,1},其流行率为 π。评分根据 zi 条件性生成。每个标注者 j 的特征由对数几率尺度上的敏感度 (αjsens) 和特异度 (αjspec) 表征。每个项目 i 由难度 (βi)、区分度 (δi>0) 和猜测度 (λi∈(0,1)) 参数化。正确评分的概率遵循一个经过敏感度和特异度泛化的三参数 Logistic 模型 (IRT-3PL):
P(yn=1∣zi=1)=λi+(1−λi)logit−1(δi(αjsens−βi))
P(yn=1∣zi=0)=1−[λi+(1−λi)logit−1(δi(αjspec−βi))]
识别性与对抗性标注者: 为了解决评分模型中常见的双峰后验问题(即标注者的准确性与其反向行为难以区分),作者引入了一个约束条件来排除对抗性标注者。对抗性标注者被定义为敏感度小于 1 减去特异度的标注者(即 αjsens<−αjspec)。模型通过将敏感度重新参数化为 αjsens=−αjspec+log(1+exp(ηj)),确保了 αjsens>−αjspec,同时保留了在“垃圾信息”边界附近的灵活性。
层次先验: 为了对标注者的异质性进行建模,在 (ηj,αjspec) 上设置了一个层次二元正态先验。模型采用了非中心化重参数化,以解耦潜在变量与其尺度,从而缓解 Neal's funnel 问题并确保稳定的收敛。
概率化训练: 文中提倡直接使用潜在类别的后验概率来训练下游分类器(例如通过对数几率回归),而不是将评分坍缩为硬标签。这保留了不确定性并避免了偏差。
模型简化: 该框架允许进行正交简化(例如固定 λi=0、δi=1 或统一敏感度与特异度),从而恢复标准的 IRT 变体(1PL, 2PL, 3PL)以及 Dawid-Skene 模型作为特例。
核心贡献
- 提出的模型: 一种用于二元众包评分的层次贝叶斯测量误差模型,它结合了项目层面的难度、区分度和猜测度,以及标注者的敏感度和特异度。
- 识别性约束: 一种通过排除对抗性标注者来解决双峰问题的重参数化策略,在不牺牲“垃圾信息”边界附近灵活性的情况下提高了模型的识别性。
- 开源实现: 该模型在 Stan 中实现,支持在 R、Python 和 Julia 中使用,并公开了代码。
结果
该模型使用两个数据集进行了验证:牙科 X 线龋齿评分(5 名牙医,约 4000 个项目)和自然语言推理评分(Mechanical Turkers,约 3000 个句子对)。评估采用了后验预测检查 (PPC) 和留一交叉验证 (LOO)。
- 预测准确性: 在两个数据集中,IRT-2PL + sens/spec 模型实现了最佳的预测性能(最高的 elpdloo)。包含敏感度和特异度的模型在性能上始终优于标准 IRT 模型和 Dawid-Skene 模型。
- 拟合优度: 后验预测检查表明,缺乏敏感度和特异度的模型(标准 IRT)以及 Dawid-Skesk 模型无法充分捕捉评分的分布。具体而言,Dawid-Skene 模型相对于观测数据夸大了“中等程度”正向投票的数量。
- 离散度: IRT-2PL + sens/spec 模型能够紧密匹配数据中每个项目的正向投票离散度,而 Dawid-Skene 模型低估了离散度,且完整的 IRT-3PL + sens/spec 模型表现出的变异性并未得到数据的充分支持。
- 训练影响: 合成实验表明,与使用基于多数投票或最大概率类别的硬标签相比,使用后验概率(特别是通过对数几率回归)进行训练的分类器显著降低了参数估计误差。
意义与主张
本文主张,在层次贝叶斯框架内显式建模标注者的敏感度和特异度,对于提高相对于经典 IRT 模型和 Dawid-Skesk 方法的拟合度和预测性能至关重要。通过捕捉项目层面的变化(难度、区分度)和结构化的标注者行为,所提出的模型能够产生更准确、更校准的预测。作者得出结论,目前大多数利用人类反馈的机器学习训练工作并未实现其潜力最大化,可以通过应用这些结构化的概率众包模型(特别是利用概率化训练数据而非坍缩后的金标准)来加以改进。这项工作还强调了识别并排除对抗性标注者的重要性,以确保在典型的众包场景下的模型识别性。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。