Wisdom Of The (AI) Crowd: Investigating Artificial Swarm Intelligence In Large Language Models
本文表明,通过在不同架构内部及跨架构之间聚合多个大语言模型的输出,可以显著降低估计误差并揭示对不确定性的元认知意识,从而为组织决策提供一种可扩展的人类集群智能替代方案。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
大思路:AI 能通过“众包”获得更聪明的答案吗?
想象一下,你正在尝试猜测一头巨型公牛的重量。如果你只问一个人,他可能会错得很离谱。但如果你问 100 个人并取他们猜测的平均值,结果通常会非常准确。这就是著名的“群体智慧”(Wisdom of the Crowd)。
几十年来,人类一直在使用这个技巧。但召集 100 个人既慢又贵,而且很难组织。
这篇论文提出了一个新问题:我们能否利用像 GPT-5、Gemini 和 Claude 这样的大型语言模型(LLM)来创建一个“人工群体”? 与其询问 100 个人类,我们是否可以问一个 AI 30 次,或者问三个不同的 AI 各 10 次,从而得到比只问一个 AI 更好的答案?
实验过程:“猜谜游戏”
研究人员设置了一个受控的游戏来测试这一点。他们没有问 AI 像“谁是总统?”这样简单的问题,因为 AI 只是记住了这些事实。相反,他们给了它们 8 个棘手的估算问题,这些问题需要进行猜测和推理,例如:
- “从头开始重建整个纽约市地铁系统的成本是多少?”
- “一辆汽车在其寿命周期内会消耗多少加仑汽油?”
- “某家特定公司的股价明年会是多少?”
他们把 AI 当作一群人来对待。他们使用了三种主要策略:
- 独奏艺术家(The Solo Artist): 他们向一个特定的 AI(例如,仅使用 GPT-5)重复提问同一个问题 30 次。因为 AI 具有一定的随机性(就像人类会有“状态不好”或“状态很好”的一天),它会给出 30 个略有不同的答案。
- 专家小组(The Panel of Experts): 他们向三个不同的 AI(GPT-5、Gemini 和 Claude)各提问 10 次同一个问题。
- 大平均值(The Grand Average): 他们将所有这些答案汇总并取平均值,以观察这个“群体”是否比任何单个个体更聪明。
研究发现
1. 群体更聪明(在大多数情况下)
就像人类一样,“人工群体”通常比任何单个 AI 的猜测都更准确。
- 类比: 想象三个朋友在猜罐子里有多少颗软糖。一个猜 500 颗,一个猜 1,000 颗,一个猜 2,000 颗。平均值是 1,166 颗。如果真实答案是 1,100 颗,那么平均值比任何一个朋友的猜测都要接近。
- 结果: 通过对答案取平均值,误差显著下降。在某些情况下,“群体”的准确度比单个 AI 的猜测高出多达 37%。
2. “回声壁效应”问题(The "Echo Chamber" Problem)
当他们询问同一个 AI 30 次时,虽然有所帮助,但不如询问不同的 AI 有效。
- 类比: 如果你问同一个人 30 次,他可能会只是把同一个错误重复 30 次,或者他的“坏心情”可能会让这 30 次猜测都朝着错误的同一个方向偏移。
- 结果: 混合使用不同类型的 AI(“专家小组”)效果最好,因为它们会犯不同种类的错误,而这些错误会相互抵消。
3. “置信度计量器”有效
研究人员要求 AI 不仅要给出一个数字,还要给出一个“置信区间”(即它们认为答案可能存在的范围)。
- 类比: 想象一位气象预报员说:“会下雨,我有 90% 的把握是在下午 1 点到 3 点之间。”
- 结果: AI 在了解自己何时不确定方面表现得惊人地好。当它们给出一个宽泛的范围(例如,“可能在 10 到 100 之间”)时,它们通常错得很离谱。当它们给出一个狭窄的范围(例如,“肯定在 40 到 42 之间”)时,它们通常是对的。这表明 AI 对自身的确定性具有某种形式的“自我意识”。
4. 并非所有的猜测都是平等的
“群体”在处理具有历史规律性的问题时表现最好,比如股票价格或经济趋势。
- 类比: 猜测 7 月份的平均气温很容易,因为你有过去 10 年的数据。但要猜测一个从未建造过的假设性新地铁系统的成本就非常困难。
- 结果: AI 群体擅长预测趋势,但在面对完全没有过去数据可以借鉴的全新、具有创造性的“假设性”场景时,则显得力不从心。
核心结论
这篇论文证明了 AI 可以模仿“群体智慧”。通过询问多个 AI 模型(或多次询问一个模型)并对它们的答案取平均值,你可以获得比依赖单个 AI 更准确的结果。
它还表明,这些 AI 模型可以告诉我们它们何时是在盲目猜测(通过给出宽泛的置信范围),这对于任何试图利用 AI 进行决策的人来说都是一个非常有用的工具。然而,这种“超级群体”在有数据或历史记录可以引导猜测时效果最好,而非纯粹的想象。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。