Improving Reproducibility in Evaluation through Multi-Level Annotator Modeling
本文通过引入一种多级自举方法来解决生成式人工智能评估中的可复现性危机,该方法利用带有持久性评分者标识的大规模数据集来建模评分者方差,并确定达到统计显著性所需的物品数量与每个物品响应数量之间的最佳平衡。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在判断哪一款新的人工智能聊天机器人更“安全”且更有帮助。你请一群人给它们打分。但问题在于:如果你只让三个人对十段不同的对话进行评分,你可能会得到一个幸运(或不幸)的结果,而这并不能反映真实情况。这就是论文中所讨论的“可重复性危机”——科学界正努力获得一致的结果,因为我们测量得不够仔细。
这篇论文的作者认为,我们将每个人的意见都视为来自一个与其他所有人毫无关联的独立个体,这是一个巨大的错误。事实上,同一个人经常会对多个项目进行评分,并且他们带着自己独特的“风格”或偏见。
以下是他们研究发现的简要说明,使用了简单的类比:
1. “口味测试”问题
想象你正在为两种新口味的冰淇淋(模型 A 和模型 B)举办一场大规模的口味测试。
- 旧方法(大多数人做的): 你请 100 个不同的人每人品尝一勺。你假设每个人的意见都是独立的。
- 现实情况: 在许多研究中,你实际上只请了 5 个人,每人品尝 20 勺。
- 问题所在: 如果“鲍勃”碰巧讨厌巧克力,无论品牌如何,他都会给每一勺巧克力冰淇淋打低分。如果你将鲍勃的 20 个意见视为 20 个独立的数据点,你就会欺骗自己,认为自己拥有了大量的证据。实际上,你只是听了鲍勃的声音 20 次。
该论文表明,当你忽略是同一些人正在对多个项目进行评分这一事实时,你会获得虚假的置信度。你以为在两个人工智能模型之间找到了明确的赢家,而实际上,你只是没有询问足够多的不同的人来获得真实的平均值。
2. “多层次”解决方案
作者提出了一种看待数据的新方法,称为多层次自助法(Multi-Level Bootstrapping)。
- 类比: 想象你不仅仅是在统计票数,而是一名侦探,你意识到“鲍勃”是一个总是打低分的脾气暴躁的人。在计算最终得分时,你需要考虑到鲍勃的暴躁脾气。
- 他们是如何做的: 他们使用了真实世界的数据集,其中确切知道谁评分了什么(例如,一个由 123 人对 350 段对话进行评分的数据集)。他们利用计算机模拟对数据进行“重采样”,实际上是在问:“如果我们问了不同的人会怎样?如果我们再次问同样的人会怎样?”
3. 重大发现:更多的人,而不仅仅是更多的项目
这篇论文回答了一个关键问题:我们应该让更少的人评分更多项目,还是让更多的人评分更少项目?
- 发现: 让更多的人(评分者)评分更少的项目,比让少数人评分所有项目要好得多。
- 隐喻: 想象一下试图猜测一座城市的平均身高。
- 策略 A: 让 1 个人测量 1,000 座不同的建筑物。(这很糟糕;如果那个人视力不好或使用损坏的卷尺,你整个城市的数据都是错的)。
- 策略 B: 让 1,000 个不同的人每人测量 1 座建筑物。(这更好;即使一个人犯了错误,1,000 个人的平均值也会是准确的)。
该论文发现,为了获得统计上可靠的结果(即“显著”的发现),你通常需要显著增加人数(K),有时每个项目需要多达 100 人,而不仅仅是向列表中添加更多项目。
4. “批次”效应
研究人员还考察了数据是如何以“批次”(组)的形式收集的。
- 类比: 想象一个教室,老师一次性给全班分发试卷。学生们可能会互相交谈并相互影响,或者他们可能同时感到疲惫。
- 发现: 当人们分组(批次)对项目进行评分时,他们的意见会变得更加相关。该论文表明,如果你忽略这些“批次”,你就会低估实际所需的数据量。你可能认为需要 500 个评分才能确定,但由于“批次”效应,你实际上可能需要 2,500 个。
5. 底线
该论文得出结论,目前每个项目仅使用 3 到 5 名评分者的标准通常不足以让人信任结果,特别是在试图证明一个人工智能模型比另一个更安全时。
- 建议: 如果你想了解人工智能是否真正安全或更好,你就必须停止将人类评分者视为可互换的硬币。你需要承认每个人都有独特的“声音”。为了得到真实的答案,你需要雇佣更多的人来发表他们的意见,即使这意味着花费更多的钱。
简而言之: 不要只让同样的几个人去评判一千件事。要让一千个不同的人去评判几件事。这是停止用虚假统计数据欺骗自己的唯一途径。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。