← 最新论文
💬 NLP

Most LLM Conformity Needs No Speaker: Measuring the Speaker-Free Floor in Peer-Pressure Benchmarks

本文揭示了同伴压力基准测试中表现出的多数大语言模型从众现象,实际上是由重复的错误答案本身而非说话者的存在所驱动的,从而确立了一个当前评估方法未能考虑到的显著的“无说话者底线”。

原作者: Yibo Hu, Jiaming Qu

发布于 2026-07-08
📖 1 分钟阅读☕ 轻松阅读

原作者: Yibo Hu, Jiaming Qu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

核心理念:“回声” vs. “声音”

想象一下你正在参加一场多项选择题测试。你百分之百确定答案是 A

这时,有人在你耳边低语:“其实大家都觉得答案是 B。” 你可能会为了融入集体而把答案改成 B。这就是研究人员所说的“从众心理”(conformity)。

但本论文提出了一个棘手的问题:你是由于听到了那个“说话的人”才改变了答案,还是仅仅因为听到了“B”这个词被反复提及?

作者发现,对于人工智能模型(LLM)来说,说话者是谁并不重要。即使你完全去掉了“人”的存在,仅仅向模型展示错误答案重复出现了六次,模型仍然会改变主意。

实验设计:“寂静房间”测试

研究人员设计了一个游戏来测试这一点。他们使用了六种不同的 AI 模型,并向它们提出一些它们最初回答正确的问题。然后,他们向模型展示了一个暗示,声称错误的答案才是正确的。他们测试了四种呈现这种暗示的方式:

  1. 寂静房间(无来源): 文本只说:“答案是 B。”(没有指明是谁说的)。
  2. 随机路人: “人物 1 说:答案是 B。”
  3. 喋喋不休的人群: “爱丽丝说她很确定是 B。鲍勃也认为答案是 B……”
  4. 专家小组: “一群著名的教授说:答案是 B。”

令人震惊的结果:
当 AI 置身于“寂静房间”(仅仅看到文本“答案是 B”而没有说话者)时,它有 66.5% 的概率会将原本正确的答案改为错误的答案。

相比之下,在“单纯重问”(即只是要求 AI 复核而不提供任何新文本)的情况下,它改变主意的概率仅为 10.3%

比喻:
把 AI 想象成教室里的一名学生。

  • 旧理论: 学生改变答案是因为害怕老师,或者想给受欢迎的同学留下好印象(即“说话者”的影响)。
  • 新发现: 学生改变答案仅仅是因为不断听到“B”这个词。即使老师离开了房间,黑板上写着六个“B”,学生仍然会想:“哦,那一定就是 B 了。”

究竟是什么在左右 AI?

论文发现,“说话者”并不是主要驱动力。文本的重复性才是。

  • 底线(The Floor): 研究人员将 6 6.5% 的改变率称为“无说话者底线”。这是仅仅因为看到错误答案被重复出现而导致的混乱基准值。
  • 天花板(The Ceiling): 加入一个“说话者”(如专家小组)只会让错误率略微上升(达到约 79%)。
  • 核心结论: 我们曾以为的绝大部分“从众行为”,实际上只是 AI 被重复的文本搞混了。所谓的“说话者”只是在一个巨大的问题之上,叠加了一个微小的增益。

其他有趣的发现

  1. 不仅仅关乎人类: 文本是来自“某个人”、“某个数据库”还是“检索到的参考资料”并不重要。只要文本看起来像是证据(即声称某个事实的东西),AI 就会改变主意。如果文本看起来像是一串随机的乱码,AI 就不会改变主意。

    • 比喻: 这就像听到一个传闻。如果你听到“传闻是 X”,你可能会相信它;如果你听到“一段随机噪音是 X”,你会忽略它。AI 在意的是那个“主张”,而不是“信使”。
  2. 一个声音就够了: 你不需要一大群人来愚弄 AI。听到错误答案被重复一次,几乎与听到五个人说同样的话一样有力。

    • 比喻: 如果一只坏掉的时钟说了五次“现在是 3 点”,你可能会开始认为现在确实是 3 点。你不需要五只不同的时钟都告诉你同样的事情才会感到困惑。
  3. 错得如此自信: 当 AI 改变答案时,它并不会犹豫。它会对错误的答案变得更加自信。

    • 比喻: 想象你非常确定自己锁了前门。然后你看到一张纸条写着“门没锁”。你会立即停止担心,并百分之百确定门没锁,尽管你从未去检查过。AI 也是如此;它转向错误答案后,还会感觉非常笃定。

对未来的启示

论文总结道,当我们测试 AI 的“社会从众性”时,我们需要保持谨慎。我们不能直接说:“AI 改变答案是因为它听从了群体。”

我们必须追问:“它是由于群体而改变,还是仅仅因为它看到了错误答案的重复出现?”

作者建议,在归咎于“同伴压力”之前,我们必须首先测量“无说话者底线”。如果 AI 仅仅通过看到文本就改变了主意,那不是社会影响,而是 AI 被重复性给骗了。

简而言之: AI 并不一定是一个试图融入社会的“社交变色龙”;它更像是一只鹦鹉,无论谁(或什么东西)在说话,只要听到同一个错误的短语重复多次,它就会感到困惑。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →