← 最新论文
💬 NLP

Anchoring Bias in LLM-as-a-Judge Systems: Prior Scores Compromise Evaluation Independence

本文表明,作为裁判的大语言模型会受到其上下文元数据中包含的先前评分的显著影响,从而导致系统性的评分偏移和决策错误,且这种现象在采用思维链(Chain-of-Thought)或警告等缓解措施后依然存在,进而对 LLM-as-a-Judge 系统中评估独立性的假设提出了挑战。

原作者: Ante Kapetanovic, Kemal Altwlkany, Andro Mercep, Tomislav Duricic, Emanuel Lacic

发布于 2026-08-27
📖 1 分钟阅读☕ 轻松阅读

原作者: Ante Kapetanovic, Kemal Altwlkany, Andro Mercep, Tomislav Duricic, Emanuel Lacic

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在现代数字化景观中,人工智能已从一个仅仅回答问题的工具,演变成了一个能够评判其他系统质量的系统。这种被称为“AI作为评判者”(AI as a judge)的新角色,正越来越多地被用于评分论文、审查代码以及在内容到达人类读者之前进行过滤。这种做法背后的假设是,AI评判者会根据每一件作品自身的优点进行评估,将每一次提交都视为一个全新的开始。然而,人类心理学早已发现了一种被称为“锚定效应”(anchoring)的现象,即一个人的估计或决策会被其之前看到的某个数字微妙地拉向该数字,即使那个数字是随机的或无关的。几十年来,研究人员在人类身上观察到了这种现象,从法庭判决到价格谈判。对于数字时代的关键问题在于,这些我们信任其公正性的机器内部是否存在同样的类人偏见。如果一个AI评判者受到背景中看到的先前分数的干扰,那么整个自动化评估系统可能会出现系统性的偏差,导致内容的通过或拒绝变得不公平。

Infobip的一个研究团队致力于直接测试这一假设。他们设计了一个实验,旨在观察AI评判者的分数是否仅仅因为看到了来自不同评判者的先前分数而发生变化,即便这个先前的分数与当前的作品完全无关。他们收集了八种不同的语言大模型,涵盖了从庞大强大的系统到更小、更高效的系统,并要求它们对二十篇不同的文本进行评分。这些文本涵盖了四个不同的领域:总结文章、审查计算机代码、创作创意故事以及回答事实性问题。研究人员为AI评判者创建了三种不同的场景。在第一种场景中,评判者只看到任务和文本。在第二种场景中,评判者看到文本时附带了一个表示它是修订版的注释。在第三种场景中,评判者看到文本的同时,还看到了一段包含代表前一次尝试的特定数字的“先前分数”的注释。至关重要的是,这些先前分数是随机生成的数字,且始终低于及格线,这意味着它们被设计为是非信息性的且无关紧要的。

结果在大多数测试的模型中都是清晰且一致的。当AI评判者被展示随机的先前分数时,它们的评分显著下降。模型似乎并没有将文本视为独立的个体作品,而是将判断锚定在了那个较低的数字上。在研究中,八个模型中有七个表现出了在存在先前分数时评分统计学意义上的显著下降。这种影响不仅仅是微小的波动;对于某些模型而言,这种偏移大到足以改变评估结果。例如,在测试的最强力模型之一中,先前分数的出现导致文本的接受率下降了近百分之二十二。这意味着原本会被批准为高质量的内容,仅仅因为评判者在背景中看到了一个较低的数字,就突然被拒绝了。研究人员发现,这种偏见在不同类型的任务中并不统一;它在创意写作和事实性问题中最为强烈,而在代码审查中的反应则较弱且不一致。

为了理解机器内部是如何发生这种情况的,研究人员观察了模型在生成评分时所考虑的具体词汇。他们发现了一种看起来更像是“开关切换”而非“逐渐下滑”的模式。当引入先前分数时,模型选择高分的概率急剧下降,而选择低分的概率则跃升。然而,改变该先前分数的具体数值似乎并不重要;仅仅是该数字的存在就触发了这种转变。这表明模型并非在仔细计算一个新的平均值,而是在对元数据本身的存在做出反应。研究人员还测试了简单的指令是否能解决这个问题。他们尝试要求模型在评分前进行“逐步思考”,并尝试明确警告模型忽略先前分数。这两项策略都没有奏效。事实上,在某些情况下,逐步思考的指令反而加剧了偏见,而明确的警告未能阻止分数下降,尽管它确实降低了模型在已经产生偏见的情况下跟随特定数字的倾向。

研究进一步探讨了这种偏见是否会影响现实世界的决策,而不仅仅是抽象的数字。利用一个已被人类标记为“安全”或“违规”的消息营销数据集,研究人员测试了当AI评判者被给予错误的先前标签时表现如何。当AI看到一个错误的先前标签时,在原本可以纠正错误的近一半案例中,它未能纠正错误。相反,它经常固守于元数据中提供的错误标签。在一次AI此前判断正确的配对测试中,引入错误的先前标签导致它在超过百分之十的案例中将正确的判断转变为错误的判断。这证明了这种偏见不仅限于简单的评分,还延伸到了决定内容是否允许或拦截的类别决策中。研究人员得出结论,防止这种偏见的唯一可靠方法是从提示词(prompt)中完全移除无关的元数据。他们发现,无论多少提示或警告,一旦该先前信息存在,都无法完全恢复评判者的独立性。

这些发现的意义对于任何依赖AI进行公平评估的人来说都非常重大。研究表明,自动化系统中公正性的假设是脆弱的。即使提供的信息显然是无关的,模型也无法免受上下文的影响。这种偏见不是一个可以通过简单指令轻松修复的“漏洞”;它似乎是这些系统处理信息的一种基本方式。研究人员强调,虽然他们的测试涵盖了一组特定的模型和任务,但结果表明存在更广泛的脆弱性。为了构建值得信赖的系统,开发人员必须仔细设计AI运行的上下文,确保没有任何无关的数字或来自前一步骤的标签泄露到当前的评估中。未来的路径需要对每一个具体的模型和任务进行主动验证,而不是被动地相信机器能够清晰地看待世界。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →