The Authenticity Gap in Human Evaluation
本文认为,标准的自然语言生成(NLG)人工评估协议往往由于错误的假设和李克特量表(Likert scale)的局限性,无法捕捉到真实的偏好,并据此提出了一种新的“系统级概率评估”(SPA)方法,该方法在传统方法失效的情况下成功恢复了模型排名。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在计算机语言的世界里,当机器被教导去编写故事、回答问题并进行对话时,存在着一个持久的问题:我们如何知道机器是否真的做得很好?多年来,标准的方法一直是雇佣人类来阅读计算机生成的文本并给出评分,就像才艺表演中的评委一样。这些人类评分被视为终极真理,是衡量所有新计算机程序的“金标准”。其逻辑似乎很简单:如果一个计算机写出的故事得到了人们的高分,那么它就是一个优秀的作家。但这种方法依赖于一个隐藏的假设——即当一个人对一段文本给出数字时,这个数字能完美地捕捉到他们的真实感受。它假设“好”的分数与“极好”的分数之间的距离对每个人都是一样的,并且通过平均这些分数,我们就能准确地得知哪台计算机更好。
斯坦福大学的一个研究小组决定更深入地审视这一过程,不仅是为了看评委们是否尽职,更是为了探讨评分系统本身是否存在缺陷。他们通过经济学家理解人类选择的方式来切入这个问题,将计算机生成文本的能力视为一种某种程度上的“博弈”。当计算机写作时,它产生的不是单一、固定的结果,而是一个可能的结果范围,其中既有精彩绝伦的,也有糟糕透顶的。研究人员发现,要求人类对这些结果进行评分的标准方式往往无法捕捉到人们真正的偏好。事实上,他们发现,仅仅通过平均这些评分,有时甚至会扭转结果,使较差的计算机看起来比更好的还要好,或者掩盖了人类能够分辨出机器与真人之间差异的事实。
为了解决这个问题,研究人员提出了一种全新的征求意见的方式。他们不再要求一个人对单个故事进行一到五分的评分,而是让他们将两台计算机进行对比,并估计其中一台在整体上优于另一台的概率。他们称这种方法为“系统级概率评估”(system-level probabilistic assessment),这种方法将人类评委视为一名估算可能性的专家,而非一个计算器。当他们使用这种新方法与旧方法针对一个强大的语言模型的不同版本进行测试时,结果令人震惊。这种沿用多年的行业标准方法未能检测出模型之间明显的差异——它无法识别出规模更大、更先进的计算机优于较小的计算机,甚至暗示某台计算机显著优于人类作家,这一发现与之前的研究相矛盾。
然而,新方法正如研究人员所期望的那样奏效了。当人们使用基于概率的方法时,他们能够一致地识别出计算机模型的正确排序,承认规模更大、更复杂的系统能创作出更好的故事。他们还正确地识别出,虽然最小的计算机显然不如人类,但最大的计算机与人类作家已无异。这种成功并非源于拥有更多的人员或数据;研究人员在两种测试中使用了相同的九十名志愿者。区别完全在于提问的方式。标准方法要求人们在固定量表上进行评分,这迫使人们做出其大脑结构无法一致完成的判断。它假设三分与四分之间的差距对每个人而言都是一致的,而这一假设在现实中几乎不成立。
研究人员表明,这种缺陷不仅仅是一个微小的技术错误,更是对人类偏好运作方式的一种根本性误解。当人们被要求在量表上对文本进行评分时,他们往往是在猜测点与点之间的距离,而这些猜测因人而异,差异巨大。一个人可能认为四分仅比三分稍好,而另一个人可能认为它好了一倍。当你平均这些冲突的观点时,得到的结果是一个模糊的信号,掩盖了真相。新方法通过让人们退后一步,从大局出发,绕过了这种混乱。他们不再评判单个句子,而是评判整个系统,估算如果看到许多示例,他们会多频繁地偏好其中一台计算机。这种方法承认人类无法看到计算机可能产生的所有输出,但他们仍然可以根据样本形成可靠的判断,从而感知哪个系统更为优越。
这项发现的影响远不止于测试写故事的计算机。它挑战了整个人工智能领域评估自身进步的方式。多年来,研究人员开发出新模型并声称它们更优秀,仅仅是因为它们从人类评委那里获得了更高的平均分。如果这些分数在数学上并不忠实于人类的偏好,那么其中的许多主张可能都是错误的。该研究表明,该领域需要从简单的评分量表转向尊重人类判断复杂性的方法。通过让人们估算概率而非分配数字,我们可以获得关于这些机器实际能力的更清晰、更诚实的图景。
在实验中,研究人员使用了一组特定的故事提示词,并要求志愿者比较不同版本的语言模型,范围从基础的小型版本到庞大的先进版本。他们还加入了由真人编写的故事作为基准。结果非常明确:新方法找回了所有预期的偏好,正确地将计算机按从差到好的顺序进行了排序,并准确地将人类作家置于其中。而旧方法尽管使用了相同的志愿者和相同的故事,却只找回了五项预期偏好中的两项。它未能识别出中型计算机之间的差异,并且最令人惊讶的是,它得出结论认为人类作家显著逊色于最大的那台计算机。这一错误凸显了当前评估实践中的一个危险盲点:错误的协议可能导致研究人员误以为他们的机器已经超越了人类的能力。
研究人员还在图像生成领域测试了这种新方法,要求人们判断哪台计算机生成的图片更好。结果再次证明了该方法的有效性,显示出它在不同类型的创意任务中均表现出色。他们发现,随着人们看到的示例增加,他们对自身偏好的确定性也随之增加,但即使只有少量示例,基于概率的方法也能检测出正确的获胜者。这表明该方法具有鲁棒性和高效性,能够在不需要海量数据的情况下提供可靠答案。它尊重人类注意力的极限,同时捕捉到了人类偏好的本质。
最终,这项工作关乎如何使我们的工具与现实保持一致。评估人工智能的标准协议建立在与人类思维或感受不符的假设之上。通过将焦点从任意的数字转向诚实的概率估算,研究人员为更准确、更可靠的评估提供了一条路径。这提醒我们,在构建更好机器的过程中,我们必须首先确保衡量它们的方法是可靠的。目标不仅是了解哪台计算机获胜,更要理解这种胜利对于人类与计算机交互的未来究竟意味着什么。随着这些系统越来越多地融入我们的生活,确保评估的准确性不仅仅是一个学术练习;它是确保我们所构建的技术真正服务于使用它的人们的必要条件。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。