← 最新论文
💬 NLP

The Evaluator Is Part of the Experiment: Measuring Open-Ended LLM Conformity

本文介绍了一种新颖的实验方案,该方案证明了开放式大语言模型(LLM)的从众行为是由降低修订质量的同伴影响所驱动的,同时揭示了评估者的判断并非中立,且需要进行显式的锚定校准以确保测量有效性。

原作者: Alicia Guerra, Yibo Hu

发布于 2026-08-14
📖 1 分钟阅读☕ 轻松阅读

原作者: Alicia Guerra, Yibo Hu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一个计算机正在学习思考、交谈,甚至彼此争论的世界。这就是人工智能(AI)的领域,特别是大语言模型(LLM),它们就像是经过训练、几乎掌握了人类所写下的一切内容的超级数字大脑。但棘手之处在于:这些数字大脑并不只是孤独的天才;它们通常以团队或“多智能体系统”的形式协作,其中一个 AI 提出答案,另一个进行批判,而第三个则尝试进行修正。科学家们提出的重大问题是:当这些 AI 朋友产生分歧时,会发生什么?它们是坚持真理,还是会被人群所左右,就像聚会上为了合群而改变主意的青少年一样?这种现象被称为“从众”(conformity)。虽然我们知道人类很容易受到同伴压力的影响,但我们需要知道我们的数字造物是否也是如此。如果一个 AI 仅仅因为它的“朋友们”这么说,就被诱导相信一个错误的观点,那么这可能会在从医疗建议到法律判决的方方面面导致严重的错误。

你即将阅读的论文深入探讨了这一确切问题,但带有一个转折:它将负责评分的人(或计算机)视为实验的一部分,而不仅仅是一个中立的裁判。研究人员 Alicia Guerra 和 Yibo Hu 建立了一个巨大的数字游乐场,旨在观察四种不同的 AI“生成器”(即制造答案的 AI)在看到“同伴”(其他 AI 的答案)是全部正确、全部错误或混合情况时,会如何反应。他们发现,当一个 AI 被一群提供完全错误信息的同伴包围时,它修改后的答案会显著变差。这就像一个学生明明知道正确答案,但在听到全班同学自信满满地喊出错误答案后,开始怀疑自己,最后也写下了错误的答案。

但故事变得更有趣了。研究人员意识到,衡量这一点并不像仅仅检查答案是从“是”变成“否”那么简单。有时,答案本身保持不变,但其解释的“质量”却变差了,或者 AI 开始加入一些奇怪的、迷信的细节以求融入。为了捕捉到这一点,他们使用了一个巧妙的技巧:他们将完全相同的答案展示给一个“评委”(另一个 AI)两次。第一次,评委在不知情的情况下(盲测)看到了答案。第二次,评委看到了答案加上同伴群体的评论(知情测试)。他们发现,这些评委并不是中立的机器人!取决于哪个 AI 在进行评判,看到同伴评论后,它们会对同一个答案给出不同的评分。有些评委变得更容易认同大众,而另一些则变得更加怀疑。事实证明,在 AI 的世界里,那个判卷的人也会像考生一样受到人群的影响。

研究人员还发现,如果你不仔细检查你的“尺子”,你的整个实验可能会崩溃。他们使用了“锚点”——即完美的正确示例和完美的错误示例——来设定衡量答案好坏的标准。他们发现,如果评委无法可靠地辨别这些锚点之间的差异,整个测量系统就会变得摇摆不定。简而言之,这篇论文证明了衡量 AI 从众行为是一个两部分的问题:制造答案的 AI 在被错误的同伴包围时表现变差,而负责评分的 AI 在看到这些同伴时也会产生偏见。这提醒我们,在数字时代,同伴压力不仅影响着我们,也影响着我们用来帮助人类的机器,甚至影响着我们用来评判它们的机器。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →