想象一下,你有一组五位专家正在尝试解决一个棘手的谜题。在人工智能的世界里,这些“专家”就是大型语言模型(LLMs)——那些在海量数据上训练出来的超级智能计算机程序。
这篇论文提出了一个简单的问题:让这五位专家就正确答案达成一致的最佳方式是什么?
目前,人们通常尝试两种方法:
- 投票法:每位专家写下他们的答案,然后小组选择出现频率最高的那个(多数投票)。
- 辩论法:专家们进行多轮对话,根据彼此的观点改变自己的看法,直到达成共识。
这篇论文的作者认为,这两种方法实际上都在丢失信息。他们使用了一个名为“布莱克韦尔信息量”(Blackwell's Informativeness)的数学概念(可以将其想象为一个“真理计”)来证明:当你进行投票或辩论时,你本质上是在丢弃每位专家所持有的部分独特线索。
核心理念:“丢失的线索”问题
想象每位专家都拥有一本充满独特事实的私人笔记本。
- 在投票中:你只看他们写下的最终答案。你扔掉了他们的笔记本。你无法知道他们为什么选择那个答案,或者他们是 99% 确定还是仅仅在猜测。
- 在辩论中:他们彼此交谈,但在交谈过程中,他们往往会重复相同的事实,或者被对话中的噪音所迷惑。最终,他们得到的真相版本比直接合并他们的笔记本要“更嘈杂”。
这篇论文从数学上证明,直接合并专家的私人笔记本总是优于听他们投票或争论。
解决方案:"MA-PoP"(魔法胶水)
作者们创造了一种名为MA-PoP的新方法。这种方法不是让专家们交谈或投票,而是像“魔法胶水”一样,直接结合他们的私人信念。
以下是其工作原理,使用一个简单的类比:
- “私人笔记本”(后验概率):该方法不是问专家“答案是什么?”,而是问“你对答案是 A 有多确信?你对答案是 B 有多确信?”。它将他们的答案转化为概率图。
- “魔法胶水”(后验概率乘积):该方法将来自所有五位专家的这些概率图相乘。
- 类比:想象五个人试图寻找一处隐藏的宝藏。每个人手中都有一张标有“可能”区域的地图。如果你叠加所有五张地图,并寻找所有“可能”区域重叠的地方,你就能找到最可能的宝藏位置。MA-PoP 在数学上正是这样做的。
- “校准”(翻译器):有时,AI 模型会过于自信(当他们实际上是在猜测时,却声称“我 100% 确定”)。作者们添加了一个“翻译器”步骤来修正这一点,确保在将它们“粘合”在一起之前,置信度水平是诚实的。
他们的发现
研究人员在六种不同类型的难题(如医学考试、逻辑谜题和常识推理)上测试了这种方法。
- 结果:MA-PoP 始终击败了当前的最佳方法(投票和辩论)。
- 辩论的问题:他们发现,让 AI 智能体进行辩论往往会使情况变得更糟。就像人类一样,如果 AI 智能体交谈过多,它们可能会陷入死循环,或者就错误的答案达成一致。
- 投票的问题:投票尚可,但它忽略了细微差别。如果一位专家有 99% 的把握,而四位专家只有 51% 的把握,投票可能会忽略那位强有力的专家。MA-PoP 倾听的是信念的强度,而不仅仅是数量。
一个关键警告:“回声室”效应
论文指出了一个陷阱。这种“魔法胶水”在专家们彼此不同时效果最佳(例如,一位在医学书籍上训练,另一位在法律上训练,另一位在科学上训练)。
如果你使用五位完全相同的模型(相同的训练数据)作为专家,他们拥有的都是同一本“私人笔记本”。在这种情况下,将他们的信念相乘就像看了五次同一张地图——它不会给你新的信息。该方法仍然有效,但并不会比单个专家好多少。
总结
- 旧方法:让 AI 智能体投票或争论。(丢失信息,容易出错)。
- 新方法(MA-PoP):不要让他们交谈。相反,提取他们的内部“置信度分数”,修正任何过度自信,然后在数学上将它们结合起来。
- 结果:只要 AI 智能体拥有不同的知识可以贡献,这种方法就能比其他任何测试过的方法更接近“完美”的答案。
简而言之:不要让 AI 争论;只需倾听他们的私人想法并将它们结合起来。
技术摘要:基于布莱克韦尔信息性的多智能体决策
问题陈述
大语言模型(LLM)的快速发展激发了人们对多智能体系统的兴趣,其中多个智能体协作解决复杂任务,如问答(QA)。当前的聚合策略主要依赖投票(例如多数投票)和多智能体辩论(MAD)。然而,这些方法在很大程度上是临时的。实证研究表明,多轮辩论往往无法超越简单的投票,有时甚至会收敛于多数持有的错误观念,或者表现不如单智能体基线。此外,无论协议如何,LLM 在多轮设置中经常表现出性能下降。
所解决的核心问题在于缺乏对何时以及为何多 LLM 系统无法提取所有可用信息的正式理解。现有方法缺乏关于结果决策相对于智能体组合知识理论极限的信息性的正式保证。
方法论
作者通过布莱克韦尔信息性框架(一种用于比较信息结构的决策理论方法)分析多智能体决策。
理论分析
- 信息结构与混淆:本文将决策问题形式化为元组 (S,A,ϕ,ρ),其中 S 表示状态(真实标签),A 表示动作(预测),ϕ 表示效用(负损失),ρ 表示先验。信息结构由给定状态下观测信号的条件分布定义。
- 混淆定理:一个关键概念是“混淆”,即一种信息结构是另一种的噪声版本。作者证明,任何将私有信息 d1:M 映射到集体决策 g 的聚合机制(包括投票和辩论)都构成了原始联合私有信息 (d1,…,dM) 的混淆。
- 上界:因此,在布莱克韦尔排序下,源自投票或辩论的信息结构不如所有智能体的聚合私有信息具有信息性。最优决策规则被确定为贝叶斯聚合后验最大化:
y^∗=argymaxPr(y∣x,d1:M)
该规则作为信息论上界。
提出的方法:MA-PoP
受理论上界的启发,作者提出了MA-PoP(多智能体后验乘积),这是一种无需访问原始私有训练数据即可近似聚合后验的实用方法。
- 后验估计:由于私有数据 dm 不可用,该方法通过采样多个响应(N 个蒙特卡洛样本)并计算这些响应与候选选项之间的语义相似度(使用自然语言推理 NLI 交叉编码器)来估计每个智能体的后验 Pr(y∣x,dm)。
- 后验乘积估计量:假设智能体的私有信息具有条件独立性且先验均匀,聚合后验被近似为各个后验的乘积:
Pr(y∣x,d1:M)∝m=1∏MPr(y∣x,dm)
在条件独立下,该公式是精确的;当智能体相关时,它作为证据累积的近似。
- 校准:为了处理多项选择题中选项的排列并确保概率形式良好,该方法采用Deep Sets架构在校准相似度分数后再进行乘法运算。
主要贡献
- 形式化表征:本文提供了基于布莱克韦尔的形式化描述,表明投票和辩论在信息获取上劣于访问智能体的联合私有证据。它确立了这些协议是信息聚合的实例,相对于聚合后验不可避免地会丢失信息。
- MA-PoP 算法:作者实例化了一个实用估计量(MA-PoP),通过乘以各智能体的后验直接近似聚合后验。该估计量在条件独立下是精确的,并且在异构设置中具有鲁棒性。
- 实证验证:在六个 QA 基准测试(MMLU 专业医学/形式逻辑、HellaSwag、CommonsenseQA、HH-RLHF、MedMCQA)上的广泛实验表明,MA-PoP 优于最先进的辩论方法(集中式、去中心化、稀疏、自由 MAD)和基于投票的基线(多数投票、自洽性、对数线性意见池、反直觉流行度)。
结果
- 性能:MA-PoP 在异构设置的所有评估数据集中均实现了最高准确率(例如,MMLU Pro. Med. 上为 0.8787,CSQA 上为 0.8800)。
- 辩论局限性:结果证实,与单轮聚合相比,多轮辩论往往产生递减甚至负面的回报。在某些情况下(例如 HellaSwag),传统辩论方法的表现甚至不如最佳单智能体,而 MA-PoP 成功利用了互补知识。
- 效率:MA-PoP 计算高效,所需的 token 使用量与单轮投票相当,且显著低于多轮辩论方法。额外的校准步骤(NLI 评分)每个样本耗时不到一秒。
- 鲁棒性:即使智能体多样性降低(例如 2 个智能体)或在同质设置中,该方法仍然有效,尽管随着智能体冗余增加导致条件独立性假设被违反,性能提升趋于平稳。
- 校准:与未校准方法相比,MA-PoP 显著改善了期望校准误差(ECE)和最大校准误差(MCE)。
意义与主张
本文主张,多 LLM 系统中对话辩论的局限性并非源于多智能体协作本身,而是源于次优的聚合策略,这些策略丢弃了信息。通过将决策建立在布莱克韦尔信息性框架之上,作者证明了贝叶斯聚合后验最大化是信息论参考规则。
MA-PoP 的意义在于它能够近似这一最优规则,而无需访问智能体的私有训练数据或复杂的迭代通信。作者谦逊地指出,该方法依赖于条件独立性的假设;在 LLM 共享重叠预训练数据的现实场景中,估计量可能会变得过度自信。然而,实证结果表明,即使存在部分依赖,该方法也为现有的辩论和投票协议提供了一种稳定且优越的替代方案。这项工作将多智能体决策从启发式过程重新框架化为具有正式信息论保证的过程。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。