AMEL: Accumulated Message Effects on LLM Judgments
本文提出了“大语言模型判断中的累积消息效应”(AMEL),表明作为评估者使用的大语言模型会显著偏向先前对话历史的主流极性——尤其在不确定或暴露于负面语境时——且不受模型规模或历史长度的影响,从而建议采用全新语境或平衡历史以实现可靠的自动化评估。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
以下是用通俗语言和日常类比对论文《AMEL:累积消息效应对大语言模型判断的影响》的解释。
核心观点:AI 的“坏心情”
想象你雇佣了一位非常聪明的自动化法官,让它审查代码、审核评论或批改论文。你要求它在同一个聊天窗口中连续完成 50 项任务。
这篇论文提出了一个简单的问题:法官的心情是否会根据它刚刚做过的事情而改变?
如果法官刚刚连续拒绝了 10 份糟糕的代码提交,它是否会变得过于严厉,从而不公平地拒绝第 11 份?或者,如果它刚刚批准了 10 份优秀的提交,它是否会变得过于宽容?
研究人员将这种现象称为累积消息效应(AMEL)。他们发现,是的,AI 的心情绝对会发生变化。 它会“陷入”其近期历史所形成的模式中。
关键发现(“发生了什么”)
1. AI 会“陷入”某种模式
把 AI 想象成一个在走廊里行走的人。如果它打开的前几扇门都是“不”,它就开始预期下一扇门也是“不”。
- 结果: 当 AI 看到一连串“不”的回答历史时,即使下一个项目实际上是好的,它也极有可能对下一个项目说“不”。
- 令人惊讶的是: 无论历史是 5 项还是 50 项,结果都一样。AI 仅需5 项就能识别出这种模式。在此之后,增加更多历史并不会加剧这种偏见;它只是会保持在那个偏见的水平上。
2. “坏消息”偏见(负面不对称性)
AI 更容易被坏消息左右,而不是好消息。
- 类比: 想象一个天平。需要很重的重量才能将其推向“是”,但只需一根羽毛就能将其推向“否”。
- 结果: 一连串的拒绝(“不”)促使 AI 变得消极,其强度是连续批准(“是”)促使 AI 变得积极的1.6 倍。
- 转折: 即使是“中立”的历史(50% 是,50% 否),仍然会让 AI 倾向于说“不”。看来 AI 天生就倾向于批判,而任何对话历史只会放大这种倾向。
3. AI 在难题上会感到困惑
这种偏见对 AI 的影响并非均等。
- 简单问题: 如果答案显而易见(例如,“这段代码是否充满了病毒?”),AI 会忽略历史并给出正确答案。
- 难题: 如果答案棘手或处于临界状态(例如,“这段代码是否勉强合格?”),AI 就会感到困惑。在这些时刻,历史就像它耳边响亮的声音,迫使它选边站队。
- 问题: 这是最糟糕的情况。AI 最有可能犯错的时候,恰恰是你最需要它保持最谨慎和客观的时候。
4. 更大的模型也无法免疫
你可能会认为,超级聪明、庞大的 AI 不会受骗。
- 现实: 大模型比小模型不太可能产生偏见,但它们并非免疫。即使是测试过的最先进的模型(如 GPT-5.2 或 Opus)仍然表现出这种偏见。它们只是较少受骗而已。
5. 这与历史“在哪里”无关
研究人员测试了这种偏见是源于对话的开头(首因效应)还是结尾(近因效应)。
- 结果: 这并不重要。无论那 5 个“坏”的回合发生在开头、结尾,还是分散在 50 个回合的对话中,结果都是一样的。AI 只是感知整个对话的“氛围”并采纳它。
为什么会发生这种情况?(“如何发生”)
该论文进行了特殊测试以找出其机制:
- 这不是一个简单的开关: AI 并不是简单地从“是”切换到“否”。其内部的“概率”(它有多确定)实际上是逐渐变化的。
- 词汇与含义: 这种偏见似乎来自两个方面:
- “不”这个词: AI 可能只是更喜欢“不”这个词,因为它在训练数据中经常看到它。
- 拒绝的概念: AI 可能被训练得谨慎和安全,因此“拒绝”事物感觉是更安全、更“正确”的路径。
- 注: 不同的模型更倾向于其中一种解释。
解决方案:每次都要“重新开始”
该论文为将 AI 用作法官的人们提供了一个非常简单的解决方法:
- 不要批量处理: 不要要求 AI 在一个长聊天中判断 50 个项目。
- 重新开始: 为每一个项目提供一个全新的、空的聊天窗口。
- 为什么? 这样可以切断“累积消息效应”。没有历史,AI 就无法陷入坏心情。
如果你必须批量处理(为了节省金钱或时间),该论文建议打乱顺序(不要先做所有“坏”的项目)并平衡历史,以免 AI 获得片面的观点。
总结
AI 法官就像一个在漫长的一天里不断说“不”后感到疲惫和脾气暴躁的人。它开始对一切都说“不”,甚至包括好东西。保持其公平的唯一方法是在做出每一个决定之前,给它一杯“新咖啡”(一个新的聊天窗口)。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。