Peer-Voted LLM-Agent Stress Tests Find Feed-Induced Lexical Convergence but No Reliable Matched-Exposure Advantage for Distributed Sources
本研究引入了一个由同伴投票的测试平台,旨在证明虽然暴露于同伴排名的信息流会诱导大语言模型智能体之间产生词汇趋同,但它并不能可靠地为分布式来源产生匹配暴露优势,也无法显著改变智能体相对于单一来源暴露时的立场。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在数字世界中,人工智能不再仅仅是回答问题的工具,它正逐渐成为对话的参与者。这些被编程为模仿人类行为的 AI 智能体,越来越多地出现在客户服务聊天、模拟社交网络和在线论坛中。多年来,科学家们一直对这些机器进行逐一测试,要求它们在孤立状态下解决谜题或撰写文章。但互联网上的真实生活并非一系列孤立的测试。它是一个递归循环:一个人发布一个想法,其他人对其做出反应,平台突出显示最受欢迎的反应,而这些被突出的信号又会塑造下一个人决定说什么。这种行动与反应的循环正是群体真实行为涌现的地方。理解这一循环至关重要,因为它涉及到了关于网络安全的两个主要担忧:一是内容的排名方式是否会在人们看到特定论点之前,就微妙地改变他们的想法;二是协调一致的恶意行为者群体是否天生比单个个体在改变公众舆论方面更具力量。
为了在不造成现实世界伤害的情况下研究这些问题,研究人员构建了一个受控的数字环境,称为“同行投票社交模拟测试平台”。在这个系统中,他们为每次实验创建了十二个具有不同人格和对四种不同平台规则相关话题初始观点的 AI 智能体。这些智能体被置于一个模拟社交网络中,它们可以发布简短的消息,通过简单的“点赞”或“踩”对彼此的帖子进行投票,并在下一轮中看到这些投票的结果。研究人员运行了数百次此类模拟场景,在观察结果之前仔细冻结了规则,以确保发现并非偶然。他们想看看,如果让这些智能体接触到一个按受欢迎程度排序的帖子信息流,是否会使它们最终的表达方式变得更加趋同;以及拥有四个不同的恶意行为者传播一条信息,是否会比只有一个恶意行为者传播相同信息时,在改变观点方面更有效,前提是每个人看到的帖子数量相同。
实验揭示了关于智能体如何交流的一个清晰且可复现的效果。当智能体看到由其同伴点赞数进行排序的前期帖子信息流时,它们的最终消息在词汇选择和句式结构方面变得明显更加相似。这种被称为“词汇相似性”的增加,在不同的 AI 模型类型和不同的主题中都一致地发生。智能体并不一定在观点上达成一致,但它们开始使用相同的词汇和句子结构,这表明观察并对排序信息流做出反应的过程,产生了一种向语言统一性的压力。无论模拟涉及的是较小还是较大版本的 AI 模型,这一发现都成立,表明该机制在所测试的系统中是稳健的。
然而,研究并未发现可靠的证据表明,在暴露量相等的情况下,协调一致的群体比单一来源更具说服力。在模拟中,研究人员对比了一个场景:即一个对抗性账号试图改变观点,与另一个场景:即四个不同的对抗性账号试图做同样的事情。至关重要的是,在两种场景下,模拟中的每个诚实智能体看到的来自恶意行为者的帖子数量完全相同。在这些严格的条件下,四个来源的群体并没有比单个来源更有效地推动人群的观点转变。数据表明,如果保持总暴露量不变,仅仅拥有更多账号并不会自动赋予协调优势。这表明,现实世界中协调行动的力量可能来自于其他因素,例如触达更多的人、变换论点或针对特定子群体,而非仅仅是账号的数量。
研究人员还观察了热门信息流是否会压制少数派观点。在核心模拟组中,排序信息流的存在确实降低了持有相反观点的智能体的生存率,这意味着较少的智能体保留了其最初立场。然而,这种效应在所有测试的不同 AI 模型中并不一致;在较大的模型变体中,结果是不确定的。这表明,对少数派观点的压制并非这些系统的普遍规律,而是取决于所使用的特定 AI 模型类型。研究结论认为,虽然测试环境成功证明了同行排序的信息流会驱动语言趋同,但它并未证明这些系统普遍捕捉观点,也未证明分布式来源比单一来源具有内置优势。这项工作提供了一个方法论蓝图,表明要理解网络风险,科学家必须将信息流暴露、排序和来源多样性的影响区分开来,而不是将它们视为一个单一、不可分割的现象。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。