When LLMs Agree, Are They Right? Auditing Self-Consistency and Cross-Model Agreement as Confidence Signals
本文挑战了将自一致性和跨模型一致性作为大语言模型置信度信号的可靠性,通过一项大规模研究表明,虽然一致性是正确性的一个正向但微弱的预测指标,但在前沿模型中,高一致性往往与频繁的错误同时出现,从而导致过度自信。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在举办一场规模宏大的才艺表演,旨在寻找最强的 AI 大脑。你有一组评审团(AI 模型),并向他们提出了百万计的刁钻问题。大家遵循的一个大规则是:“如果所有的评审都对一个答案达成一致,那么这个答案一定是正确的。” 这听起来很符合常识,对吧?如果十个人都说天空是绿色的,也许我们都在看某种奇怪的滤镜?但如果有一百个人都这么说,那它很可能就是事实!
这篇论文就像一部侦探故事,它深入幕后去检查这个规则是否真的奏效。作者 Kaihua Ding 进行了大规模实验,使用了 53 个不同的“运行者”(运行 AI 测试的人),并要求他们针对一些最难的数学和科学问题(称为 GPQA Diamond 和 AIME)生成了 26.5 万个答案。
这里有一个转折:达成共识并不等于正确。
“回声壁”陷阱
把 AI 模型想象成一群从同一本略有瑕疵的教科书中学到知识的学生。如果他们都背诵了同一个错误的答案,他们就会同时举手,并对那个错误的答案达成一致。他们达成一致并不是因为他们聪明,而是因为他们拥有共同的偏见或“记忆启发式(memorized heuristic)”。
论文发现,当 AI 模型彼此达成一致(或与自身达成一致)时,这往往只是在重复一个共同的错误,而不是真理的标志。
“过度自信”的明星学生
最令人惊讶的发现涉及到了“前沿(frontier)”模型——即那些最先进、最强大的 AI 版本。你可能会认为最聪明的模型应该是最可靠的。然而,论文显示事实恰恰相反。
- 发现: 最先进的模型(gpt-4.1)在 89% 的情况下与其自身达成了一致(这是一个非常高的置信度分数)。但即便达成了一致,它也仅在 48% 的情况下是正确的。
- 类比: 想象一个学生,他对自己给出的答案如此笃定,以至于以 100% 的信心大声喊出来,但实际上他有一半的时间是错的。论文称这种现象为“过度自信”。事实上,这个超强模型在发出“正确信号”方面,甚至不如一个稍逊一筹的“中层”模型。
- 证据: 研究通过一个统计学联系(称为相关性)来衡量“一致性”与“正确性”之间的关系。对于最聪明的模型,这种联系非常微弱(大约为 0.20),这意味着它的高置信度几乎无法作为信任信号。
“思维链(Chain-of-Thought)”有帮助吗?
有些人认为,如果你要求 AI “展示其推理过程”(一种称为 Chain-of-Thought 的方法),它会变得更加诚实。
- 结果: 是的,要求 AI 展示其推理过程确实让它变得稍微准确了一些(它答对了更多问题)。
- 症结: 然而,这并没有让“一致性信号”变得更好。AI 仍然无法通过它与自身达成一致的程度,来可靠地告诉你它何时是正确的。这就像一个学生写下了长篇且详细的解释,但他最终还是答错了题,而你仅仅通过观察他字迹的整洁程度,是无法分辨出他在出错的。
“共同偏见”之谜
研究人员还检查了不同的 AI 家族(如 GPT 和 Claude)是否犯了同样的错误。
- 发现: 他们发现,当不同的 AI 模型答错时,它们往往会选择完全相同的错误答案。
- 类比: 这就像两个来自不同学校的学生,因为他们都在课堂上学到了某个特定的错误技巧,所以对同一个数学题都答错了。这表明,当 AI 对一个错误答案达成一致时,这并非巧合,而是植根于它们训练数据中的共同偏见。
那么,我们应该停止使用“一致性”吗?
不完全是。论文并不是说“永远不要信任一致性”,而是说:“谨慎使用,并了解其局限性。”
- 有利于预算控制: 一致性对于决定投入多少计算资源非常有用。如果模型都表现得不确定(低一致性),你可能需要投入更多的时间或金钱来获得更好的答案。
- 不利于信任判断: 你绝不应该将一致性作为一个独立的“信任我”按钮。如果一个超强模型说:“我有 90% 的把握”,并且它与自身达成了一致,你仍然无法确定它是对的。事实上,论文建议,根据置信度将难题路由给“最聪明”的模型是一个坏主意,因为那个模型是最过度自信的。
核心结论
论文总结道,自洽性(Self-consistency)是一种“条件代理(conditional proxy)”。它在某些情况下(例如处理中层模型时)是一个有用的提示,但它不是真理的保证。
- 被证实的是: 在这些特定的测试中,高一致性往往意味着高置信度和低准确度,对于最先进的模型尤其如此。
- 被建议的是: “过度自信”可能是这些模型训练方式的一种副作用,而共同的错误发生是因为不同的模型学习了相似的数据。
- 未知的是: 论文指出,这些结果是针对所测试的模型和问题的。我们不知道这种情况是否发生在每种类型的 AI 或每种类型的问题上,但警告是明确的:不要假设仅仅因为大家意见一致,他们就是正确的。 有时候,他们只是在看同一张错误的地图。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。