← 最新论文
🤖 machine learning

Mitigating Rubric Interference in LLM Judges via On-Policy Self-Distillation

本文将“评分标准干扰”识别为多标准大语言模型评估中的一致性问题,并提出了自我锚定评分标准对齐(SARA),这是一种利用单标准判断作为稳定锚点,在无需外部监督的情况下,显著提高跨数据集和跨模型家族评估一致性的在策略自我蒸馏方法。

原作者: Dingyao Yu, Tong Zhang, Yutao Mou, Yunxiao Zhang, Wei Ye, Shikun Zhang

发布于 2026-08-18
📖 1 分钟阅读☕ 轻松阅读

原作者: Dingyao Yu, Tong Zhang, Yutao Mou, Yunxiao Zhang, Wei Ye, Shikun Zhang

原始论文根据 CC0 1.0(http://creativecommons.org/publicdomain/zero/1.0/)发布到公有领域。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在现代人工智能领域,大型语言模型已从简单的文本生成器演变为复杂的评估者。它们越来越多地被赋予为其他机器评分的任务,充当自动化裁判,处理从医疗建议到科学推理的各类工作。为了使这些判断公平且详尽,研究人员不再使用单一的总分,而是采用被称为“量表”(rubrics)的检查清单,将一个回答分解为特定的、可验证的项目,如安全性、准确性或完整性。其目标是让模型独立检查清单上的每一项,确保即使一个回答在准确性上并不完美,它依然是安全的;或者即使在安全性上并非完美,它依然是准确的。这种方法提供了一种单一数字无法提供的诊断性清晰度,使开发者能够准确看到系统的成功与失败之处。

然而,一项新研究揭示了这些自动化裁判在同时面对多个清单项目时,其运作方式存在一个细微但显著的缺陷。虽然模型在孤立评估单个项目时表现出色,但当被要求在单次处理中同时评估多个项目时,其判断力就会发生变化。研究人员发现,清单中其他项目的存在会干扰对任何单个项目的评估。仅仅因为在列表中增加了一个关于准确性的问题,或者仅仅因为问题的顺序发生了改变,对安全性的判定就可能发生偏移。研究人员将这种现象称为“量表干扰”(rubric interference),这意味着同一个回答可能会根据所询问的其他问题的上下文而获得不同的评分,从而削弱了自动化评估系统的可靠性。

为了解决这一问题,来自北京大学和腾讯的研究团队开发出一种方法,训练模型去忽略这些干扰因素。他们发现,虽然模型在共同判断多个项目时会感到吃力,但在单独判断每个项目时,其表现却非常稳定且一致。研究人员利用这种稳定性作为引导。他们创建了一个训练过程:模型生成一份包含所有项目的完整评估报告,然后将其针对每个项目的推理过程,与一个在孤立状态下评估该相同项目的“教师版”自身进行对比。通过将模型的联合推理与自身稳定的孤立判断进行对齐,他们教会了模型专注于每个项目的特定标准,而不受其他项目存在的影响。这种技术被称为“自我锚定量表对齐”(self-anchored rubric alignment),它使模型能够生成一份统一的报告,其一致性如同它分别检查每个选项时一样。

该方法的成果在涵盖医疗对话、通用指令遵循和科学问题的三个不同数据集上进行了测试,并使用了多种不同的模型家族。结果显示,一致性有了显著提升。例如,在一个涉及科学问题的数据集上,经过训练后,模型在同时检查项目与单独检查项目时给出完全相同判定的样本百分比几乎翻了三倍。模型对清单项数量的敏感度降低了;在未经训练的模型随着列表变长而改变主意时,经过训练的模型保持了稳定的标准。它们对问题的顺序也变得更加鲁棒,不再仅仅因为清单顺序的调整就改变判定。

至关重要的是,研究人员确认这种一致性的提高并未以牺牲准确性为代价。经过训练的模型不仅在达成一致方面变得机械化,它们在判断一个回答是否真正有用或正确方面,依然保持着与原始模型相当的水准。事实上,通过消除干扰带来的困惑,这些模型的表现有时甚至优于原始模型所对照的外部标准。研究还表明,这种习得的技能具有通用性。在一个类型的数据集上接受训练的模型,可以在无需进一步训练的情况下,将这种新能力应用于完全不同的数据集,这表明它学习到的是一种分离推理的基本方式,而非仅仅记住了特定答案。

这种改进背后的机制通过模型的内部注意力模式得到了追踪。当未经训练的模型评估多个项目时,其注意力会从一个项目“泄漏”到另一个项目,导致对一个点的分析受到另一个点推理的影响。经过训练后,这种泄漏显著减少了。模型学会了几乎只将注意力集中在当前正在分析的特定项目上,有效地屏蔽了清单中其他项目的噪音。这种转变使模型能够为每个标准保持清晰、独立的推理路径,即使在同时处理这些项目时也是如此。

这项工作的意义延伸到了人工智能系统如何被评估和改进的层面。随着这些模型越来越多地被用于为训练其他系统提供反馈,反馈的可靠性至关重要。如果裁判本身是不一致的,那么训练信号就会变得嘈杂且不可靠。通过证明“量表干扰”是一个真实且系统性的问题,并提供了一种无需人类标注员提供正确答案即可修复它的方法,这项研究提供了一条切实可行的路径。它表明,自动化评估可以变得更加鲁棒和值得信赖,从而确保驱动下一代人工智能的反馈循环建立在稳定且一致的判断基础之上。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →