Scoring Rules! Statistical and Strategic Alignment for Text Evaluation Metrics
本文认为,基于参考文本的文本评估指标必须既与人类评分具有统计相关性,又在策略上具备对抗操纵的鲁棒性,据此提出了一种统一的基于互信息的框架,该框架在保持与人类判断具有竞争性相关性的同时,实现了卓越的抗操纵性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下你是一位正在批改一叠论文的老师。你想知道哪位学生真正理解了课程内容,而哪位只是背诵了那些听起来完美的辞藻来糊弄你。几十年来,计算机一直试图为我们承担这项工作,充当人工智能生成的海量文本的自动化评分员。这些被称为“评估指标”的计算机评分员,通常通过将学生的答案与人类编写的“金标准”答案进行对比来工作。如果词汇匹配得很好,计算机就会给出高分。这在检查计算机是否总体上做得不错时非常有效,有点像检查学生的文章是否包含了正确数量的拼写单词。但问题在于:如果你告诉一个学生,“我只根据你使用了多少个拼写单词来给你评分”,他们可能会停止描写故事本身,而只是在文章中塞进大量看起来很漂亮、但毫无意义的随机词汇。这就是“针对指标进行优化”的问题。我们正在看的这篇论文提出了一个至关重要的问题:我们如何构建一个不仅能与人类教师达成一致,而且能拒绝被试图通过优化来“作弊”的学生所欺骗的计算机评分员?
这篇题为《评分规则!文本评估指标的统计与策略对齐》(Scoring Rules! Statistical and Strategic Alignment for Text Evaluation Metrics)的论文深入探讨了这一困境。作者们是一支来自大学和科技公司的研究团队,他们认为评判这些计算机评分员的旧方法已经失效了。传统上,我们只检查计算机的分数是否与人类分数“相关”(即它们是否通常在判断哪篇论文更好这一点上达成一致)。作者们表示,这还不够。他们提出了一种新的、更严格的标准,称为“策略对齐”。一个优秀的评分员不应仅仅与人类达成一致;它应该具有“策略鲁棒性”,这意味着它不应该给那些经过巧妙修改、使其看起来很好但实际并未变得更好的文章打高分。
为了测试这一点,研究人员设置了一系列“陷阱测试”。首先,他们尝试通过删除重要事实或缩短篇幅并减少信息量来“降级”文章。一个好的评分员应该给这些缩减后的文章打低分。其次,他们尝试通过添加废话、改变语气使其听起来过度自信,或在不增加任何新事实的情况下进行改写来“操纵”文章。一个好的评分员不应该给这些被戏弄过的文章打高分。他们测试了许多不同类型的计算机评分员,包括流行的“LLM-as-a-Judge”方法(即让一个超级聪明的 AI 充当老师)以及一种基于名为“互信息”(Mutual Information,用于衡量两个文本之间实际共享了多少共同信息)这一数学概念的新型指标家族。
结果令人惊讶,甚至带有一点情节反转。“LLM-as-a-Judge”方法目前非常流行,且在与人类教师达成一致方面得分很高,但结果证明它在防御优化方面表现糟糕。当研究人员试图欺骗它时,这个 AI 评审员经常中招,给那些华而不实的废话文章打高分。相比之下,作者利用特定框架设计的这种新型“互信息”指标则更难被愚弄。它们不仅与人类意见一致,而且实际上惩罚了那些被削减和被误导的文章。
团队发现,秘诀不在于使用更聪明的 AI,而在于改变 AI 查看文本的方式。他们发现,将文章分解成微小的、原子的“陈述”(例如单个事实或主张),并检查这些特定的陈述是否得到答案的支持,效果会更好。他们构建的一个特定的新指标——使用基于这些陈述级块的“全变分”(Total Variation)度量——成为了冠军。它成功抵御了研究人员抛出的每一个操纵陷阱(30 次测试中 0 次失败!),同时仍与人类观点保持同步。
简而言之,这篇论文表明,如果我们希望 AI 写得更好,我们就不能再使用那些容易被“形式大于内容”所欺骗的评分工具。作者展示了通过使用一种更侧重于数学方法(关注文本之间实际共享的信息,而非仅仅是表面相似性)的方法,我们可以构建出既对人类公平、又能免疫策略优化陷阱的评估工具。这提醒我们,在人工智能的世界里,变得“聪明”不仅仅是获得高分;更在于构建那些无法被轻易操纵的系统。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。