← 最新论文
🤖 AI

Wisdom of LLM Crowds: Aggregation and Contamination in Language Model Ensembles

本文表明,通过学习方法聚合来自不同大语言模型的预测可以超越单个模型的性能,同时强调了训练截止日期污染显著扭曲了能力评估,并且此类集成模型的主要益处源于对多样化模型输出进行线性组合,而非复杂的非线性交互。

原作者: Igor Douven

发布于 2026-07-22
📖 1 分钟阅读☕ 轻松阅读

原作者: Igor Douven

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一个这样的世界:房间里最聪明的人其实并不是真正的聪明。相反,真正的天才在于围坐在桌旁的整个群体。这个被称为“群体智慧”的概念表明,如果你将许多不同人的猜测进行平均处理,其结果往往比单一顶尖专家的猜测更为准确。这就像一群鸟儿:没有哪一只鸟能看到全貌,但它们在一起时却能完美地导航。科学家们早就知道这对人类是有效的。但现在,随着人工智能(AI)无处不在,一个大问题出现了:这种魔术般的技巧对机器人也有效吗?如果你让许多不同的AI模型去猜测未来事件的结果,它们的组合答案会比任何单个AI都更聪明吗?这不仅仅是一个有趣的比赛;它至关重要,因为如果AI群体能够奏效,我们就可以利用它们来预测从天气到股市的一切,而无需人类专家团队。但这里有一个陷阱:AI模型是基于过去的数据进行训练的,如果它们已经通过训练数据“见过”了答案,那么它们就不是在真正猜测——它们只是在通过记忆来作弊。

本论文深入探讨了这个问题,将15个不同的语言大模型(LLM)视为一场预测比赛中的参赛选手团队。研究人员要求这些AI猜测254个现实世界问题的结果,类似于赌博某支运动队是否会获胜或某位政治家是否会当选。然后,他们尝试用不同的方式组合这些AI的答案,以观察这个群体是否能战胜个体。研究结果既带来了令人兴奋的消息,也贴上了重大的警告标签。

首先是好消息:“群体智慧”似乎对AI确实有效,但前提是你必须正确地组合它们。研究人员发现,仅仅采取所有AI猜测的平均值并不是最好的策略。相反,他们使用了一个聪明的计算机程序(“学习聚合器”)来研究如何混合这些答案。这个聪明的混合器比任何单个AI模型表现得都要好,甚至比简单的平均值还要好。有趣的是,这项研究表明,这种进步并非源于AI混合器进行了某种复杂的、神奇的数学运算。相反,它是通过学习如何给予那些犯了“不同类型错误”的模型更多的权重来实现的。这就像一位体育教练意识到,如果一名球员擅长防守但不擅长进攻,而另一名球员恰好相反,那么将他们组合在一起就能覆盖所有的需求。研究发现,一种简单的线性组合——基本上就是加权平均——就足以获得最佳结果,这表明AI群体智慧的关键在于错误的差异性,而非复杂的相互作用。

然而,有一个巨大的“但是”改变了一切。研究人员发现,许多AI模型都在偷偷作弊。由于这些模型是在截至某一日期的大规模互联网数据上进行训练的,它们经常会“记住”那些在训练停止前就已经有了结果的问题。这被称为“污染”。当研究人员过滤掉所有AI可能已经知道答案的问题后,结果发生了戏剧性的变化。那些昂贵的、高端的“云端”模型与较小的、本地化模型之间的巨大差距几乎消失了。当这些大模型无法依赖记忆时,它们看起来就不再那么令人惊叹了。事实上,即使是最好的AI群体,其表现仍然显著逊于真实的“人类预测市场”——即人们在实时针对结果进行投注的市场。即便人类面对的是与AI相同的资料,人类市场的准确度仍大约是AI群体的两倍。

那么,结论是什么?AI群体可以很聪明,但它们很容易被自己的记忆所迷惑。如果你想知道一个AI是否真的擅长预测未来,你必须测试那些发生在它完成学习之后的事情。在此之前,AI群体的“智慧”可能仅仅是对它已知事物的反映,而非它所能推导出的东西。这项研究表明,虽然我们可以通过混合不同的模型来构建更好的AI团队,但要达到人类群体那种动态、实时的智能水平,我们还有很长的路要走。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →