← 最新论文
🤖 machine learning

Whose Gold? Annotator-Pool Disagreement Is Large at the Item Level, and Hidden by Small Leaderboards

本文揭示了专家与众包标注者在项目层面的显著分歧被较小的排行榜规模所掩盖,从而产生了一种模型排名稳定的假象,而这种假象在模型数量增加时无法得到泛化。

原作者: Anik Jha

发布于 2026-08-18
📖 1 分钟阅读☕ 轻松阅读

原作者: Anik Jha

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在构建更智能人工智能的竞赛中,研究人员依赖于一个简单而强大的理念:要了解一台机器是否正在变得更好,你必须要求人类来评判其工作。这个被称为“偏好基准”(preference benchmark)的过程,涉及向人类展示两个不同的 AI 回答,并询问哪一个更好。这些人类投票的收集过程成为了“金标准”,即一个用于衡量所有新模型的可靠参考点。多年来,该领域一直基于一个默认为真的假设:雇佣哪些人来进行评判并不重要。普遍观点认为,虽然个体可能会犯随机错误,但作为一个整体,人类是一个可靠的工具,能够衡量出关于什么是好答案的单一且稳定的真理。如果这个假设成立,那么评判者的具体身份就只是一个微小的细节,就像用来记录分数的笔的品牌一样。

但一项新的调查表明,这个细节实际上是方程中最重要的部分。研究人员通过使用两组完全不同的人群两次运行同一套 AI 对比实验,旨在测试选择人类评判者是否真的重要。其中一组由普通的众包人员组成,即那些被成千上ś地雇佣从事在线任务的人。另一组则由经过筛选的领域专家组成,即在该领域拥有专业知识的个人。研究人员提取了一个包含数千次 AI 对比的大规模数据集,并要求这两组人都对胜者进行投票。他们发现,这两组人类之间的意见并不像该领域所假设的那样一致。在近四分之一的项目中,两组人选择了不同的多数获胜者。在几乎十分之一的情况下,众包人员和专家选择了相反的获胜者,将一组眼中的失败者宣布为另一组眼中的冠军。

尽管在单个项目层面存在如此巨大的分歧,但最终结果看起来却具有欺骗性的稳定性。当研究人员使用这些冲突的投票来对研究中的六个 AI 模型进行排名时,无论由哪组人类进行评判,最终的排行榜都是完全相同的。模型的顺序没有发生任何变化。这呈现出一个令人困惑的画面:评判者们在喊着不同的答案,但计分板却保持沉默。研究人员意识到,这种稳定性并不是系统稳健的迹象,而是由于对比的模型数量较少而导致的幸运巧合。因为模型之间的性能差距很大,所以由更换评判者引起的投票微调不足以推动一个模型超越另一个模型。

为了测试这种稳定性的脆弱程度,研究人员进行了模拟实验,以观察如果排行榜规模更大(即包含现实世界竞赛中常见的数十个模型)时会发生什么。结果非常鲜明。虽然六个模型的排行榜保持不变,但如果排行榜有十个模型,模型被取代的情况将达到 86%。当模型增加到二十个时,排名重洗的可能性接近 100%。研究得出结论,目前领域内报告小型排行榜的做法之所以安全,仅仅是因为模型数量稀少且性能差异显著。如果该领域发布一个更大、更真实的竞技场,人类评判者的选择会立即打乱排名。“金标准”并非固定不变的真理;它是一个移动的目标,其位置取决于谁被雇佣来拿着测量尺。

这项调查并未止步于人类评判者。研究人员还检查了日益被用于自动化这些排名的 AI 评判者如何处理人类群体之间的分歧。他们测试了三种不同的 AI 评判者(包括来自不同公司的模型),以观察它们更倾向于与哪组人类达成一致。每一位 AI 评判者都显著地更多地与众包人员保持一致,而非专家。这表明 AI 评判者已经学会了模仿大众的偏好,很可能是因为用于训练它们的数据也来自类似的众包人员。研究人员发现,AI 评判者与人类的一致性不仅是其智能水平的衡量,也是对其训练数据收集年份所做的招聘决策的反映。

研究还发现,这些 AI 评判者的提示词(prompting)方式对它们决策的影响,比选择人类评判者本身的影响还要大。当研究人员改变回答呈现的顺序时,AI 评判者会逆转其决策,在近一半的项目中(具体而言,其中一个模型为 44.6%)。此外,当研究人员仅改变输出格式(要求使用 JSON 对象而非纯标记/token)而保持其他一切不变时,同一个评判者在项目上的自我一致性仅为 47.2%,显示出单向的系统性偏移。这种对呈现顺序和格式的敏感性,是比专家与众包人员之间差异更大的误差来源。研究人员认为,整个领域需要改变报告这些结果的方式。仅仅说明一个模型与人类的一致性百分比是不完整的,如果不明确指出使用了哪些人类。当前排名的安全性是一种由小样本量创造的幻觉,而未来排名的可靠性完全取决于承认:选择标注者并非一个微小的细节,而是一个塑造结果的基础变量。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →