More Is Not More: What Matters for Diversity in LLM Opinions?
本文采用析因实验来证明,增强大语言模型观点多样性的关键不在于通过增加人格细节或温度等单一因素的规模,而在于有策略地结合不同的交互架构,并识别出过度细化人格所带来的收益递减现象。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图举办一场规模宏大的虚拟晚宴,每一位宾客都是一个拥有独特思想、记忆和见解的不同个体。你想要听到各种天马行空的观点,从激进的政治见解到关于未来的奇特理论。然而,这里有一个限制:你邀请的并不是真人。相反,你是在要求一个被称为“大语言模型”(LLM)的超级智能计算机程序来扮演这些宾客。这些模型就像出色的演员,能够阅读整个互联网并完美模仿人类的语言。然而,当你要求它们扮演一群人时,它们往往会听起来如出一辙。它们过于趋同,使用相同的短语,最终变成了一场乏味且单一的对话。这是一个问题,因为如果你想了解真实的人们在想什么,你需要的是一个真正像“人群”一样的群体,而不是一个在完美合唱中齐声歌唱的合唱团。
科学家们一直试图解决这个“乏味的派对”问题。他们尝试过给计算机提供更多关于它正在扮演谁的细节(比如说:“你是一位名叫莎拉的45岁教师”),或者改变这些计算机宾客相互交流的方式(比如让它们在小组中争论,而不是仅仅一个接一个地回答问题)。他们还尝试过调高计算机的“创造力旋钮”,看看是否能让它变得更随机和多样化。但直到现在,还没有人能清晰地绘制出哪种技巧实际上最有效。这就像是在不知道面粉、鸡蛋或烤箱温度究竟是让蛋糕变好吃的关键因素是什么的情况下,试图通过混合所有食材来烘焙一个蛋糕。
这篇题为《并非越多越好》(More Is Not More)的论文,就像是一次大规模的科学“味觉测试”,终于将这些成分拆解开来,以观察究竟什么才是真正重要的。研究人员设计了一个包含100个不同问题和7种不同计算机模型的庞大实验。他们测试了两种主要的增加观点多样性的方法:输入调节(即你向计算机提供了多少关于它所扮演身份的细节)和交互架构(即计算机宾客之间如何交流)。他们还测试了一些人们常尝试的“廉价伎俩”,比如直接告诉计算机“要保持多样性”,或者调高随机性。
以下是他们的发现,事实证明答案有些令人惊讶:
1. “细节陷阱”
许多人认为,你给计算机提供的背景故事越多,它的观点就会越独特。你可能会想:“如果我告诉计算机它是一位住在亚特兰大、去教堂、年薪7.8万美元、名叫莎拉的34岁黑人女性,它就会表现得超级独特!”但研究发现,事实并非如此。多样性最大的飞跃出现在仅提供极少信息的时候——比如仅仅说:“你是一名教师。”一旦你加入了这一句话,计算机就开始表现得更像一个真实的人。当你添加所有额外的细节(年龄、种族、收入、爱好)时,并没有带来多少帮助。事实上,对于某些模型来说,提供过多的细节反而会让观点变得不那么多样化,仿佛计算机产生了混乱,或者开始固守刻板印象。这就像试图通过给角色写一份10页的传记来让其变得有趣;有时,仅仅知道他们的职业就足以激发独特的声线,而其他的细节只会让剧本变得杂乱无章。
2. 群聊的力量
研究人员还观察了计算机宾客是如何互动的。他们比较了三种风格:
- 独奏者:计算机回答一个问题后便离开。
- 深度访谈:计算机回答问题,然后被问到一个后续问题,接着是另一个,从而与自己进行一场长对话。
- 焦点小组:五个不同的计算机“人”在一个群聊中进行交流。
结果显示,“深度访谈”和“焦点小组”都比“独奏者”创造了更多样化的观点。但关键在于,它们不仅仅是让相同的观点变得更好,而是探索了完全不同的思想世界。“深度访谈”风格挖掘了更深层的、内省的角度,而“焦点小组”风格则找到了不同且更具比较性的角度。研究表明,如果你想获得最广泛的观点,你不应该仅仅选择“最好的”方法。相反,你应该同时运行两种方法并将它们的答案结合起来。这就像是一位诗人与一支辩论队针对同一主题进行创作;他们的答案不会重叠,因此通过阅读两者的内容,你会得到一个更加丰富的思想集锦。
3. “廉价伎俩”不起作用
最后,论文测试了许多人首先尝试的低成本技巧。他们尝试提高“温度”(一个让计算机更随机、更不可预测的设置)以及添加诸如“请给出多样化的视角”之类的指令。结果呢?这些技巧几乎没有任何作用。调高随机性并没有创造出新的想法,只是让旧的想法听起来稍微有点混乱。告诉计算机“要多样化”就像告诉一个害羞的人“要幽默”一样——它并不会真正改变其个性。研究发现,一个简单的、一句话的职业描述(如“你是一名教师”)在创造多样化观点方面的效率,是最好的“廉价伎俩”的2.5倍。
底线结论
这篇论文的核心信息是,多样性不在于做更多同样的事情。它不是关于编写更长的传记,也不是关于调高随机性旋钮。相反,它关乎你提问的结构。要从计算机中获得真正多样化的观点,你需要先给它一个简单的身份,然后让它以不同的方式探索主题——比如让它在长篇访谈中与自己对话,以及让它在与一群朋友聊天。如果你想要一个真实的人类观点模拟,你需要的是策略的组合,而不是一堆更庞大的指令。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。