← 最新论文
💬 NLP

Decomposing Wrong-Consensus Agreement in LLM Self-Consistency: A GPT-4.1 Case Study

本文通过引入一个将共识分解为机械偏好驱动成分和残差成分的“多元一致性指数”,定量分析了大语言模型自一致性投票的不稳定性表现,揭示了虽然在多项选择任务中共享偏好占据主导地位,但在开放领域问题上仍存在无法解释的异质性,且高一致性并不保证正确性。

原作者: Lizhuo Zhang, Mengmeng Tang, Chenfeng Long, Xiaoyong Tang, Xiang Luo

发布于 2026-08-20
📖 1 分钟阅读☕ 轻松阅读

原作者: Lizhuo Zhang, Mengmeng Tang, Chenfeng Long, Xiaoyong Tang, Xiang Luo

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在人工智能领域,大型语言模型常被视为能够通过思考来解决复杂问题的类先知机器。为了提高这些系统的可靠性,研究人员开发了一种名为“自一致性”(self-consistency)的技术。其核心思想很简单:与其向模型寻求单一答案,不如让它对同一个问题进行多次回答,并让答案进行投票。如果模型在大多数情况下产生相同的答案,那么假设是这种共识很可能是正确的。这种方法已成为提高准确性的标准工具,其运作基于一种直觉性的信念,即多次尝试之间的达成一致信号着真理。然而,这一信念面临着一个顽固的现实:有时,模型可以非常强烈地与自己达成一致,却仍然完全错误。这种情况最常发生在难题上,模型可能会自信地陷入一个看似合理但错误的答案中,从而制造出一种虚假的安全感。理解为什么会发生这种情况至关重要,因为如果我们无法区分一个自信的正确答案和一个自信的错误答案,我们就无法在涉及高风险的情况下信任这些系统。

湖南农业大学和岳麓实验室的研究人员最近的一项研究,利用强大的新模型 GPT-4.1 调查了这一特定的失效模式。研究团队并非仅仅观察到错误发生的现象,而是设计了一种方法,精确测量有多少错误的一致性来自于问题本身的性质,又有多少来自于模型思维中更深层的、共同的缺陷。他们将这个问题视为对模型投票过程的一次法证审计,使用了来自先前版本的公开逐次运行数据。当模型回答错误时,他们追问:错误答案之所以聚集在一起,是因为存在一个极具吸引力的错误选项导致每个人都选择了它,还是有其他原因导致它们在错误的道路上达成一致?为了回答这个问题,他们创建了一个模拟实验,通过剥离模型对特定答案的偏好,来观察剩余的一致性情况。

研究人员发现,答案很大程度上取决于所提问题的类型。当模型面对具有固定选项的多项选择题时,情况相对简单。在这些案例中,对错误答案的强烈一致性几乎完全可以用模型对某个特定、具有吸引力的干扰项的机械性偏好来解释。模型本质上是被同一个错误的门扉所吸引,而投票系统仅仅反映了这种单一的吸引力。在这些场景下,导致错误的“共同偏差”被模型对该特定错误选项的个体偏好所捕捉。研究表明,对于这些多项选择任务,模型的内部偏好解释了 81% 到 93% 的错误共识。这表明,在受限任务中,错误并非整个群体中一种神秘的、相关的失效,而是一种对特定陷阱的可预测的趋向。

然而,当研究人员观察开放式问题(例如数学竞赛中那种没有可选列表的问题)时,情况发生了剧烈变化。在这里,模型对特定答案的内部偏好仅解释了约 59% 到 78% 的一致性。在剔除了模型的偏好因素后,仍有相当大比例的错误共识无法得到解释。这种剩余的一致性表明,当模型从头开始生成自己的答案时,它们不仅仅是在挑选一个热门的错误选项;不同的尝试似乎在某种程度上相互协调,以一种超越简单偏好的方式在同一个错误上达成一致。研究人员指出,这种无法解释的一致性符合这样一种观点:模型在其训练过程中携带了一种共同的、系统性的偏差,导致即使在尝试以不同方式思考时,也会重复犯下同样的错误。

该研究还证实,高一致性并不保证正确性。研究人员观察了那些答案最为一致的群体——即模型几乎完美实现自我一致的情况——并发现,即便在这种情况下,准确率也远非完美。在最难的问题上,那些达成最高共识的答案正确率仅为 42% 到 83%。这意味着,即使模型表现得极其一致,它在很大程度上仍是错误的。此外,研究表明,在处理难题时,使用投票法实际上可能比直接进行单次猜测的效果更差。这种“适得其反”的效应在最难的问题上最为显著,此时模型达成错误共识的倾向足以抵消偶尔出现的正确猜测。

最终,这项研究重新定义了我们看待人工智能信心的方式。研究表明,一致性并非真理的认证,而是一个必须谨慎解读的分级信号。在多项选择测试中,错误的共识通常只是模型锁定了一个具有吸引力的错误答案。但在开放式任务中,错误的共识可能隐藏着一种更深层的、无法解释的相关性,即模型的不同尝试在强化彼此的错误。研究人员得出结论,虽然自一致性是一个有用的工具,但它存在上限:它可以显著提升准确率,使其高于单次猜测,但无法将其推向完美,尤其是在问题难度较高时。研究结果表明,我们必须停止将高一致性视为正确的“绿灯”,而应将其视为一种需要进一步审查的细致证据,特别是当模型在没有固定选项的情况下生成自身答案时。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →