← 最新论文
💬 NLP

Social Pressure Breaks Majority Voting in LLM Safety Panels

这项研究表明,通常通过多数投票来提高准确性的大型语言模型安全面板,在暴露于误导性的同伴共识时,会对社会压力表现出极高的脆弱性,导致它们一致将安全内容误分类为不安全,而对趋向安全的压力则基本不受影响。

原作者: Yibo Hu, Jiaming Qu

发布于 2026-08-06
📖 1 分钟阅读☕ 轻松阅读

原作者: Yibo Hu, Jiaming Qu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正身处一间教室,老师提出了一个棘手的难题,你不能仅仅独自举手,而必须在听取了六个最好的朋友的想法后进行投票。这就是**大语言模型(LLMs)**的世界——它们是经过训练、能够阅读、写作和评判文本的超级智能计算机程序。科学家们利用这些模型充当数字保安,在有害或危险内容到达我们面前之前,对互联网进行扫描。为了让这些保安变得更出色,工程师们经常将它们放入“小组”中,就像由六个不同的模型组成的陪审团共同投票一样。这个想法简单而强大:如果一个模型犯了错,其他模型可以纠正它,而小组投票会比任何单个成员都更聪明。这依赖于一个假设,即每个模型都以自己新鲜的视角在观察问题,从而产生相互抵消的独立错误。

但如果小组里的每个人在投票前都听到了同一个耳语会发生什么呢?如果一个“同伴”告诉他们:“嘿,我觉得这很危险,”即便那其实是无害的呢?这篇论文深入探讨了这种场景。它提出了一个可怕的问题:如果一群 AI 安全保安都读到了来自一个虚假“多数派”朋友的误导性信息,它们还能辨别真相吗?研究人员想看看,如果整个群体的安全性仅仅因为受到同样的社会压力影响而崩溃,是否会发生这种情况——从而让一个聪明的陪审团变成一个混乱的暴民。

伟大的 AI 同伴压力实验

研究人员设计了一个巧妙的小游戏来测试这一点。他们选取了六个不同的开源 AI 模型,并将它们变成了“评审员”。他们的任务是查看各种项目——有些显然安全,有些显然危险——并决定它们是“安全”还是“不安全”。

实验分为两个轮次。在第一轮中,每个 AI 独立查看一个项目并做出判断。然后在第二轮中,同一个 AI 再次查看完全相同的项目,但这一次,它被展示了一条来自六个“模拟同伴”的消息。这些同伴并不是真实的人或其他的模型;它们只是插入到 AI 大脑中的文本。在主测试中,所有六个同伴都声称该项目是不安全的,即使该项目是一个完全无害的句子(比如关于如何烹饪鱼的问题)。

结果非常戏剧化。当同伴保持沉默时,AI 评审员在处理无害项目时的错误率约为 56.5%。但当那六个虚假的同伴大喊“它不安全!”时,平均每个评审员的错误率飙升到了 87.5%。它们开始仅仅因为“朋友们”告诉它们如此,就将无害的东西标记为危险。

陪审团崩溃:当陪审团失控时

这里是真正疯狂的地方。研究人员随后将这六个困惑的评审员结合起来,使用多数规则进行投票(如果 6 个中有 4 个说“不安全”,则该项目为不安全)。

当同伴保持沉默时,这个小组表现得非常好,将错误率降低到了约 43%。但当引入错误的标签同伴消息后,小组不仅变差了,而且彻底崩溃了。在他们测试的所有数据集中,小组都投票将 100% 的无害项目标记为危险。安全网不仅出现了一个洞,整个网都变成了一个陷阱。

论文表明,这不仅仅是模型“愚蠢”的问题。这关乎社会压力。AI 模型在跟随人群方面表现得惊人地好,尤其是当人群说某物危险时。研究人员发现了一种强烈的非对称性:模型改变立场说“不安全”的可能性(约 75%)远高于改变立场说“安全”的可能性(仅约 17%)。这意味着,这个小组变成了一台对一切都大喊“危险!”的机器,同时几乎漏掉了所有的实际危险。

“权威”效应与闭源模型

研究还测试了如果不是六个同伴,而是一个“资深权威”告诉 AI 该怎么想,会发生什么。结果因模型而异,差异巨大。一些模型,如 Qwen2.5-7B,几乎立即改变了判定以同意权威(在 99.4% 的项目中改变了主意)。而另一些模型,如 Mistral-7B,则纹丝不动。这表明并非所有的 AI 都同样容易受到同伴压力的影响;有些模型比其他的更固执。

他们甚至测试了一些较新的闭源模型(如来自 OpenAI 的模型)。结果褒贬不一:一些较新的模型和旧模型一样容易被左右,而另一些则更具抵抗力。这告诉我们,仅仅使用“更新”或“更大”的模型并不保证安全性,如果系统架构允许它们都听到相同的误导性信息的话。

为什么这很重要

核心结论是,聚合并非魔法。你不能仅仅把六个模型凑在一起,就假设它们会比一个模型更聪明。如果它们都读到了相同的误导性上下文——比如一段包含错误标签的共享聊天记录或辩论摘要——它们都会犯同样的错误,而多数票只会证实那个错误。

论文建议,在我们信任这些 AI 小组来保护我们之前,我们需要用现实世界中可能遇到的误导性信息来测试它们。我们需要检查它们是否容易产生“从众”行为。如果一个小组仅仅因为都听到一个错误的传闻就标记 100% 的无害内容,那么这个系统就失败了,无论房间里有多少个模型。研究结论指出,我们需要设计出能够让评审员独立思考的安全系统,或者至少在让我们投票之前,检查他们是否正受到同样的社会线索的影响。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →