Judging Against the Reference: Uncovering Knowledge-Driven Failures in LLM-Judges on QA Evaluation
本文揭示了在问答评估中,当参考答案与大语言模型内部的参数化知识发生冲突时,基于大语言模型的裁判经常无法遵循所提供的参考答案,从而导致尽管采用了常见的缓解策略,评分仍然不可靠。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你雇佣了一位非常聪明、博学多才的图书管理员来批改一叠学生论文。你的规则很简单:“仅根据我给你的答案解析进行评分,不要根据你自己的记忆。”
这篇论文研究的是,当这位图书管理员是一个人工智能(大语言模型,或称 LLM),且答案解析中包含一个“陷阱”时,会发生什么。
设定:“被调换”的答案解析
研究人员设计了一个特殊的测试。他们选取了一系列问题及其正确答案(“金标准”)。然后,他们秘密地将正确答案与一个听起来很合理的错误答案进行了调换。
原始场景:
- 问题: 谁赢得了 2ized 2024 年 F1 锦标赛?
- 答案解析(金标准): 马克斯·维斯塔潘 (Max Verstappen)。
- 学生的回答: 马克斯·维斯塔潘。
- AI 评委的判定: ✅ 正确。(轻而易举)。
“调换后”的场景:
- 问题: 谁赢得了 2024 年 F1 锦标赛?
- 答案解析(金标准): 兰多·诺里斯 (Lando Norris)。(注意:在现实中这是错误的,但 AI 被告知这是本次测试的“金标准”真相)。
- 学生的回答: 兰多·诺里斯。
- AI 评委的判定: ❌ 错误。
等等,怎么回事?学生完美地匹配了答案解析!但 AI 却给了不及格。为什么?因为 AI 的内部记忆(其“参数化知识”)在尖叫着说:“不!马克斯·维斯塔潘赢了!兰多·诺里斯没赢!” AI 忽略了指令和答案解析,因为它更信任自己的记忆。
核心发现:“好为人师”的问题
论文将此称为**“知识驱动型失败” (Knowledge-Driven Failure)**。
把这个 AI 评委想象成一个自以为是的学生,如果老师的答案解析与他们在高中背下的知识相冲突,他们就拒绝参加考试。即使老师说:“对于这次特定的考试,答案是 X”,学生仍坚持认为:“不,我知道事实是 Y”,并根据 Y 来评分。
研究人员发现:
- 这发生在所有人身上: 即使是最聪明、最强大的 AI 模型(如 GPT-4o、GPT-5 和庞大的 Llama 模型)也会这样做。
- 随着知名度增加而恶化: 如果解析中的“错误”答案是一个名人或事实(如“埃隆·马斯克”或“月球”),AI 就更有可能忽略解析。事实越出名,AI 的内在信念就越强,也就越难以被覆盖。
- 规模大并不代表更好: 增大 AI 模型(增加“脑力”)并没有解决这个问题。事实上,有时更大的模型反而更固执,因为它们拥有更多的内部知识可以依赖。
“魔法咒语”不起作用
研究人员尝试通过给 AI 提供“魔法咒语”(提示词)来修复这个问题。他们尝试了:
- 直接命令: “请忽略你自己的知识,只看解析!”
- 出声思考: “在评分前,请逐步思考。”
- 示例: 向 AI 展示如何操作的例子。
结果: 这些都没有奏效。当两者发生冲突时,AI 仍然倾向于选择自己的记忆而非提供的指令。这就像是在告诉一只固执的狗:“别追那只松鼠,看这个球!”而松鼠就在那里。狗的本能(参数化知识)压倒了指令。
为什么这很重要
在现实世界中,我们使用这些 AI 评委来评判从学校考试到医疗建议的一切事物。我们假设它们是公正且遵守规则的。
这篇论文揭示了一个关键缺陷:如果“规则”(参考答案)与 AI 的“信念”(训练数据)相冲突,AI 就会破坏规则。
如果一个数据集更新了新事实(例如,“2025 年选举的获胜者是人物 B”),但 AI 仍然“记得”人物 A,那么任何说人物 B 的答案都会被 AI 不公平地判错,即便人物 B 是根据新数据得出的正确答案。
底线
论文得出结论:如果提供的答案解析与 AI 的内部记忆发生冲突,我们目前无法信任 AI 评委能够严格执行该解析。这不是代码中的漏洞;这是这些模型思考方式的一个基本习惯。它们对自己的“知识”如此自信,以至于当事实发生变化时,很难作为一个中立的裁判。
简而言之: 这个 AI 评委是一位博学的图书管理员,但如果图书馆的目录与他们自己在互联网上读到的内容不符,他们就会拒绝使用目录。在我们解决这个问题之前,我们无法完全信任他们根据特定的参考资料来评分。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。