← 最新论文
💬 NLP

Sixteen models, fewer than two voices: measuring ensemble dispersion where no answer is uniquely correct

本文引入了一种基于单模型的异议贡献度指标,用以分析十六个语言模型如何生成对心理治疗案例的多样化解读,研究揭示了虽然模型身份显著地构建了这种异议,但由此产生的离散程度更多是由临床内容和特定的集成组合驱动,而非由标准的模型类别或案例预期的解释开放性所驱动。

原作者: Mario Vega-Barbas, Lidia Mora-Valenciano, Iván Pau, Fernando Seoane, Farhad Abtahi

发布于 2026-08-04
📖 1 分钟阅读☕ 轻松阅读

原作者: Mario Vega-Barbas, Lidia Mora-Valenciano, Iván Pau, Fernando Seoane, Farhad Abtahi

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在试图解开一个棘手的谜题,但你不是只问一个朋友,而是问了一整屋子的朋友。你希望因为他们都是不同的人,所以他们会提供各种各样具有创造性的解决方案。这就是使用人工智能(AI)“集成”(ensembles)背后的基本理念。在计算机科学领域,集成简单来说就是一组不同的 AI 程序协同工作来解决问题。其宏大的愿景是,通过收集许多不同的“声音”,你能够获得比仅靠一个模型更丰富、更多元化的答案。

但问题在于:仅仅拥有满屋子的人并不意味着他们都在表达不同的观点。如果他们都上了同一所学校,读了同样的书,并遵循同样的规则,那么他们最终可能会给出完全相同的答案,只是措辞略有不同。这篇论文深入探讨了一个被称为“多样性测量”(diversity measurement)的特定 AI 研究领域。它提出了一个简单而深刻的问题:当我们要求一组 AI 去解决一个没有单一标准答案的问题(例如解读复杂的人类情感)时,它们是真的在进行不同的思考吗?还是它们只是在互相回声?研究人员之所以关心这个问题,是因为如果我们认为自己正在获得广泛的视角,而实际上得到的却是一群克隆体的回声,我们可能会基于一种虚假的安全感做出错误的决策。

伟大的 AI 回声室

在这项研究中,研究人员设计了一个大规模实验,以观察一组 AI 模型实际上制造了多少“噪音”。他们收集了一个由来自 10 个不同家族(可以把这些看作是不同的 AI 品牌或血统)的 16 个不同 AI 模型组成的专家小组。他们要求这些模型扮演经验丰富的治疗师,并为一个虚构的患者撰写案例研究。这个患者的故事足够模糊,以至于不存在一种“正确”的解读方式;一位优秀的治疗师可以从同一个故事中看到许多不同的角度。

团队想要衡量模型之间的“分歧”或不一致程度。他们使用了一种特殊的数学工具,叫做 Vendi Score。想象一下,你有一群人在大声喊出答案。如果每个人喊出的词都完全一样,V \emph{en} di Score 就很低(比如 1)。如果每个人喊出的词都完全不同,分数就会很高(比如 16)。研究人员想看看他们的 16 个模型是会表现得像 16 个独特的个体,还是会坍缩成一个单一且乏味的声调。

大吃一惊:不足两个声音

结果令人有些震惊。尽管他们拥有来自 10 个不同家族16 个不同模型,但该小组平均表现得就像只有 1.69 个截然不同的声音在说话。

为了让你理解这个概念,研究人员还测试了单个 AI 模型,通过让它针对同一个问题独立回答 16 次。即便只是一个模型本身,仅仅通过改变其“情绪”(科学家称之为“随机变异”,stochastic variation),就能产生 1.43 个不同版本的答案。因此,这 16 个模型的整个团队,仅仅比单个模型自身能产生的多样性多出了大约四分之一的“声音”。

这就像是你雇佣了一个由 16 名歌手组成的合唱团,他们来自 10 所不同的音乐学院,本以为会听到一场风格独特的交响乐,结果却发现他们听起来都像是在用同一个人略微跑调的方式哼唱同一段旋律。论文明确排除了这样一种观点,即仅仅向组内增加更多的模型会自动创造更多的多样性。事实上,这项研究表明,向专家小组中添加更多模型是获取更多视角的一种拙劣方法。

谁是反叛者?(以及为什么这取决于人群)

研究人员还想知道:“是否存在一个特定的模型,它总是那个反叛者,即那个与众不同的、不随大流的模型?”他们追踪了在每一次实验轮次中哪个模型是最具“差异性”的。

转折点在于:反叛者的身份取决于房间里还有谁。

在一个只有三个模型的较小实验中,有一个特定的模型(GPT-4o)大部分时间都是反叛者。但当团队将规模扩大到 16 个模型时,同一个模型却退到了第三名。新的“反叛者”出现了,比如 Ministral 14B 和 Llama 3.3 70B,它们夺取了与群体产生分歧的主导权。

这证明了成为“离群值”并不是某个特定 AI 的永久性格特征。它是一种关系。一个模型之所以显得非常不同,可能仅仅是因为其他模型恰好彼此非常相似。如果你更换了组合,那个“反叛者”可能会突然变成“从众者”。这意味着,如果一个系统向你展示了一个“差异化声音”以帮助你做决策,那么这个声音告诉你的更多是关于当前存在的这组特定 AI 的情况,而不是关于那个特定的 AI 模型本身。

规模或品牌重要吗?

团队还测试了人们对 AI 的两个常见假设:

  1. 越大越不同吗? 他们比较了同一家族内的“小型”模型和“大型”模型。结果很混乱。有时是较小的模型成为了反叛者;有时则是较大的一个。并没有统一的规律。
  2. 家族名称重要吗? 他们观察了来自同一个“家族”(例如同一品牌的不同版本)的模型。虽然来自同一家族的模型确实倾向于彼此之间比与其他陌生模型更相似,但由于他们只有极少数的对比对,证据显得很微弱。

论文得出结论:你不能仅仅通过观察一个 AI 的规模或品牌名称来预测它的“差异性”程度。你必须在使用的特定语境下对其进行实际测量。

AI 到底在对什么产生分歧?

最后,研究人员检查了模型是否在那些旨在提供多种解读的案例上产生了更多分歧。他们将患者的故事分为三类:具有单一清晰解读的故事、具有共同但无效解读的故事,以及具有真正截然不同解读的故事。

他们原本预期模型会在“开放式”故事上产生最大的分歧。然而事实并非如此。 模型在“开放式”故事上的分歧程度,与在其他故事上的分歧程度一样多(甚至略低)。相反,分歧的程度是由临床内容驱动的。例如,关于“抑郁症”的故事引发的分歧比关于“创伤”的故事更多。

这表明,AI 模型在处理问题时,并不像人类那样对问题的“开放性”敏感。它们是对故事中的特定细节(如提到的疾病类型)做出反应,而不是对情境本身的哲学复杂性做出反应。

总结

这项研究并不是说 AI 是没用的;它只是说我们需要停止假设一大群 AI 自动就是一个聪明且多样化的群体。如果你把 16 个模型放在一个房间里,你可能只能得到两个人的智慧。你所获得的“多样性”并不是一个可以通过增加模型数量来购买的固定数值;它是一种脆弱的东西,取决于模型的特定组合以及它们正在解决的具体问题。

最重要的教训是,如果你正在使用一组 AI 来帮助你做出艰难的决策,不要只计算你有多少个模型。你需要衡量它们实际上有多么不同,因为你看到的那个“离群”的声音,可能只是由于坐在桌边的成员不同而产生的临时效应,而非来自一台独特机器的深刻洞见。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →