Rethinking the Evaluation and Optimization of LLM-Based Social Simulation
本文通过引入用于量化行为变异性的主观系数,并提出主体性自适应软标签训练(SALT)方法,解决了基于准确率的评估和硬标签训练在基于大语言模型的社会模拟中的局限性,该方法已在新建的 SUBJSIM 基准测试上得到验证,能够有效处理人类反应中固有的主观性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在社会科学的寂静角落里,研究人员长期以来一直试图理解人类如何思考、决策和互动。几十年来,这项工作的主要工具是问卷调查和受控实验,即通过向真实的人提问或将他们置于特定情境中来观察他们的反应。这些方法虽然强大,但速度慢、成本高,且难以规模化以研究诸如政治极化或市场转变等复杂的全球现象。最近,一种新的工具出现了:大语言模型。这些是能够编写故事、回答问题并进行对话的高级计算机程序。科学家们已开始利用它们来模拟人类行为,创建可以在虚拟环境中进行测试的数字人口。人们希望这些模拟能够提供一种低成本、可控的方式来研究社会。然而,一个根本性的问题一直阻碍着这一领域的发展。当一个计算机程序试图模仿人类时,我们如何知道它是否做得很好?标准的检查方法是问一个简单的问题:计算机选出的答案是否与真实人类给出的答案完全一致?如果答案匹配,则认为模拟是成功的。但这种方法假设人类行为就像一道数学题,其中有一个等待被发现的唯一正确答案。事实上,人类的选择要流变得多。同一个人在面对相同情况的两个不同日子里,可能会合理地做出不同的选择。一群背景相似的人可能会将选票分散在多个选项中。将单一的人类反应视为唯一的真理,忽略了定义我们真实生活的这种自然多样性和不确定性。
中国人民大学的一个研究团队现在对这种标准方法提出了挑战,认为我们目前测试和训练这些社会模拟的方式存在根本性的缺陷。他们提出,人类行为不是一个固定的目标,而是一个可能性的云团,而试图强迫计算机击中该云团中的某一个点是一个错误。为了证明这一点,该团队引入了一种看待“主观性”(即决策在多大程度上依赖于个人感受而非客观事实)的新思维方式。他们发现,对于像编程或数学这样有明确正确答案的任务,旧方法运行良好。但对于社会性问题,即人们观点差异很大的问题,旧方法则会失效。当研究人员训练模型仅仅去复制一个人给出的单一答案时,模型会变得僵化且狭隘。它会忘记一个人可能做出的其他合理选择,从而有效地失去了人类不可预测性的本质。此外,当他们试图通过检查是否匹配那个单一答案来判断模型的成功时,往往会被误导。一个可能无法捕捉人类思想全貌的模型,可能仅仅因为运气好就获得高分;而一个完美的模型可能仅仅因为没有猜中测试者恰好选中的那个特定答案而获得低分。
为了解决这个问题,研究人员开发了一种名为“主观性自适应软标签训练”(Subjectivity-Adaptive soft-Label Training,简称 SALT)的新方法。SALT 不再强迫计算机死记硬一个特定的答案,而是教它理解可能答案的图景。该系统会观察许多与正在研究的情境相似的情况,并收集人们在这些邻近情境中的回答。然后,它将这些答案融合在一起,创建一个“软”目标,即一张显示不同选择可能性的地图。至关重要的是,系统足够聪明,知道应该进行多少程度的融合。如果一个问题是非常客观的(如数学题),它会进行极少的融合,并紧贴观察到的单一答案。但如果一个问题具有高度主观性(如询问个人价值观),它会从更广泛的类似情境中融合答案,以捕捉人类观点的完整分布。这使得模型能够学习人类行为的真实形状,而不仅仅是其单一的快照。
为了测试这个想法,该团队必须构建一个以前并不存在的东西:一个能够看到人类选择的全貌,而不仅仅是一个答案的大型数据集。他们招募了 193 人来回答 100 个涵盖政治、健康和文化等主题的不同调查问题。但他们并没有仅仅选择一个答案,而是要求每个人在所有可能的选项中分配一组概率点,从而有效地告诉研究人员他们认为每个选择的可能性有多大。这创造了一个丰富的、包含 19,300 个独特场景的图谱,展示了人们观点是如何分布的。利用这个新的基准,他们训练了模型。结果令人震惊。试图复制单一答案的标准方法表现不佳,经常无法捕捉到人类思想的真实多样性。然而,新的 SALT 方法的表现显著优于其他所有方法。它大幅降低了预测人类行为的误差,特别是在人类观点最为多样化的最具主观性的问题上。在最困难的情况下,即人们的答案广泛分散时,新方法在预测完整响应分布方面的改进,以降低 KL 散度衡量,比旧的训练方式提高了近 97%。
研究还揭示了旧方法为何挣扎的原因。当研究人员尝试使用仅仅通过年龄或职业等宽泛类别对人进行分组的技术时,结果仍然充满噪声且不准确。事实证明,关键不仅在于分组,还在于找到寻找相似性的正确程度。SALT 的自适应特性使其能够自动找到这种平衡,它能拉取足够多的相似案例来构建可靠的图景,而不会混入无关的观点。研究人员发现,当模型被允许保持不确定性时,这种方法效果最好,这镜像了人类真实的状况。这项工作表明,要真正模拟社会,我们必须停止将人类的选择视为需要被纠正的错误,而要将其视为在完整复杂性中被理解的数据。通过从对单一正确答案的僵化搜索转向对一系列可能性的灵活理解,我们可以构建出不仅在统计上准确,而且真正忠实于人类生活那混乱而美妙的不可预测性的模拟系统。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。