← 最新论文
💬 NLP

Belief Cascades Drive Persuasion in LLM Agent Networks

本文引入了一个受控测试平台,证明了多智能体大语言模型网络中的说服力是由网络拓扑、竞争和模型先验知识之间复杂的相互作用所驱动的,揭示了影响力不仅通过同伴中继进行传播,且往往隐藏在可见文本之中,因此必须通过信念探测和行为日志进行评估,才能准确追踪立场转变。

原作者: Haoyi Qiu, Genglin Liu, Pranav Narayanan Venkit, Kung-Hsiang Huang, Saadia Gabriel, Chien-Sheng Wu, Nanyun Peng

发布于 2026-08-27
📖 1 分钟阅读☕ 轻松阅读

原作者: Haoyi Qiu, Genglin Liu, Pranav Narayanan Venkit, Kung-Hsiang Huang, Saadia Gabriel, Chien-Sheng Wu, Nanyun Peng

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在人工智能飞速发展的格局中,一种新型的社会世界正在兴起,其居民并非人类,而是软件智能体。这些智能体是大语言模型,即那些能够撰写论文、回答问题并生成代码的强大系统。当它们被置于一起时,并不仅仅是静默地坐着;它们会进行互动、辩论、分享信息,并试图影响彼此。这种互动创造了一个复杂的数字对话网络,其中思想在其中循环、演变,有时甚至会改变参与者的想法。对于研究人员而言,理解这些数字大脑如何说服彼此已不再仅仅是一个理论上的好奇心。随着这些智能体开始介导现实世界的信息流、模拟用户行为并协作完成任务,改变一个数字智能体立场的能力便成为了一项基础性的能力。如果一组智能体被诱导在错误的前提或有害的叙事上达成一致,其后果可能会远远超出模拟本身。因此,核心问题不仅在于这些机器是否能够交谈,还在于它们如何倾听、如何受影响,以及当其中一个智能体试图改变其他智能体的信念时会发生什么。

来自加州大学洛杉矶分校和 Salesforce AI 研究院的一个研究小组构建了一个受控环境来观察这一过程的展开。他们创建了一个数字测试平台,将人工智能智能体置于模仿现实世界社交连接(例如人们在社交媒体上关注彼此的方式)的网络结构中。在这次模拟中,一些智能体被分配了“说服者”的角色,任务是倡导特定的政策声明,而其余智能体则充当“受众”或“被说服者”。研究人员并不仅仅是让智能体进行辩论;他们使用一种精确的方法来衡量智能体对某一观点在多大程度上表示赞同或反对,从而追踪随时间推移而产生的细微信念转变。通过在不同的网络形状、不同的主题和不同的底层 AI 模型上运行数千次此类模拟,该团队绘制出了说服是如何在这一组人工智能大脑中传播的精确图谱。

结果表明,这些网络中的说服远比简单的消息发送与接收要复杂得多。研究人员发现,网络结构本身起到了决定性作用。在一个每个人都与其他人连接的(全连接)网络中,一个试图改变他人想法的单一说服者实际上发现这变得更难了。然而,当两个持有相反观点的说服者进入战场时,同样的密集网络反而成为了受众更容易转变观点的场所,其观点往往会在双方之间来回摆动。连接的密度并不扮演统一放大器的角色;相反,它会根据受众面对的是单一声音还是辩论,来改变影响力的性质。此外,研究人员发现,这些互动的最终结果往往不在于说服者的技巧,而在于 AI 模型本身的内在倾向。不同的模型即使在接受相同指令时,对各种话题也持有不同的初始立场,而这些初始偏见往往决定了群体最终的走向,无论说话者是谁。

其中一个最引人注目的发现涉及影响力究竟是如何在群体中移动的。仅仅观察被指定为说服者的智能体所发送的消息是不够的。研究表明,那些从未被分配过说服者角色的智能体仍然在传播影响力方面发挥了关键作用。当一个普通智能体转发、引用或评论说服者的消息时,他们充当了“中继器”,将那种说服力传递给那些可能并未看到原始帖子的其他人。这种“同伴中继”效应虽然小于直接接触,但它是可衡量的且具有显著意义。事实上,研究人员发现,在两个说服者相互争论的竞争性场景中,这些同伴中继所携带的影响力在某些情况下可以与直接接触相媲美。这意味着,在一个由 AI 智能体组成的网络中,影响力不仅仅是来自少数领导者的广播;它是一种级联效应,普通的参与者通过决定分享什么以及如何构架内容,来帮助塑造最终的共识。

研究人员还密切观察了智能体“计划要说的内容”与“实际写下的内容”之间的差距。当一个说服者智能体制定策略时,它通常打算使用特定的心理策略,例如诉诸社会认同或承诺。然而,当智能体生成最终文本时,它经常会放弃这些计划好的策略。最终到达其他智能体手中的消息往往是原始意图的稀释版本。更令人惊讶的是,被说服的智能体很少承认自己改变了想法。它们的书面回复通常听起来很中立或犹豫不决,使用一些软化立场而不明确说明转变的语言。如果研究人员仅观察对话的文本,他们就会错过正在发生的深刻的信念变化。这些智能体正在移动它们的内在信念,但它们的言语并不总是反映出这种移动。

这种内在信念与外部表达之间的脱节表明,评估 AI 智能体如何相互影响,需要超越文本本身。该研究证明,要真正理解这些系统中的说服过程,必须追踪信念的整个旅程:谁看到了什么,谁分享了它,以及智能体的内在信心随时间如何变化。研究人员发现,智能体可以在从未明确表态的情况下,跨越从不同意到同意(或反之)的界限。在竞争性场景中,这会导致一种“拉锯战”的状态,即群体的集体信念在两者之间反复震荡,永远无法达成稳固的共识。这种波动性是这些数字社会的关键特征,由网络结构、竞争性的声音以及模型本身的隐藏偏见共同驱动。

这些发现的意义在于我们未来如何监测和管理多智能体系统。如果我们想要了解在由 AI 智能体构成的世界中信息是如何传播或叙事是如何形成的,我们不能仅仅依靠观察主要发言者或阅读最终的消息。我们也必须观察中继者——那些分享和重构内容的安静智能体,并且必须寻找那些即便言辞未变、信念却已发生微妙偏移的过程。这项研究认为,这些系统的安全性和可靠性取决于我们追踪这些隐藏影响路径的能力。通过理解说服是一个级联暴露的过程而非单一事件,我们可以更好地预见这些数字社区可能如何演变、如何被操纵,以及它们如何反过来影响它们日益设计的、用来模拟人类世界的现实世界。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →