Emulate or Estimate? The Divergent Strengths of Base and Post-Trained Language Models for Opinion Simulation
本文通过区分“仿真”(生成个体响应)与“估计”(预测分布),解决了关于使用大语言模型进行意见模拟的研究结论存在冲突的问题,证明了基座模型擅长前者,而经过后训练的模型则在后者方面表现更优。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图了解一大群人的情绪,但又不想逐一询问每个人。你可能会询问几个人他们的看法,或者请一位专家来猜测整体氛围。这就是科学家在尝试利用人工智能(AI)来模拟人类观点时所面临的一种谜题。在计算机科学领域,特别是在一个被称为“自然语言处理”的领域中,研究人员正在构建巨大的 AI 模型,这些模型几乎阅读了互联网上所有的文字。这些模型极其擅长预测下一个词是什么,这使得它们看起来像是可以作为真实人类完美替代品的存在。但棘手之处在于:仅仅因为一个 AI 能写出一个令人信服的故事,并不意味着它能准确预测一群人会如何投票、如何看待经济或如何回答调查问卷。科学家们目前正在争论,这些 AI “人”究竟是擅长模仿人类的多样性,还是仅仅在伪装成它们并不具备的东西。
这篇论文介入了这场争论,旨在解开一个谜团:为什么有些研究说 AI 在模拟人类观点方面表现出色,而另一些研究却说它失败得一塌糊涂?作者是来自女王大学和多伦多大学的研究人员,他们指出,这种混乱源于混淆了两个截然不同的任务。他们将第一个任务称为仿真(Emulation)。这就像雇佣一名演员来扮演特定的角色。AI 生成一段单一的回复,仿佛它是一个真实的人,如果你询问足够多的“演员”,他们的答案自然会汇聚起来,展现出人群观点的轮廓。第二个任务是估计(Estimation)。这就像是请一位统计学家观察人群并直接说:“我认为 60% 的人会选择选项 A。”研究人员通过让两种类型的 AI 进行对决来测试这个想法:一种是“基础(Base)”模型(原始的、未经抛光的版本),另一种是“后训练(Post-trained)”模型(经过微调以成为得力助手的版本)。
他们在皮尤研究中心(Pew Research Center)真实调查数据上进行的实验结果揭示了明显的才能分化。当任务是仿真——即生成个体文本回复,以观察当你把它们全部相加时人群的样貌——基础模型成为了赢家。它们生成的回复看起来更像真实的人类数据,并且在保持不同群体(如民主党人与共和党人,或富人与穷人)之间的差异方面做得更好。事实上,“后训练”模型经常遭受作者所称的“人格坍缩(persona collapse)”之苦,即它们开始听起来都一样,就像一群克隆人组成的合唱团,失去了真实人类那种杂乱无章的多样性。
然而,当任务变为估计时,故事发生了反转。当研究人员简单地询问 AI“预测会有百分之多少的人会选择这个答案”时,后训练模型脱颖而出。它们在直接给出正确数字方面表现得更为出色。原始的基础模型在这方面表现尚可,但那些经过抛光、乐于助人的助手型模型,在无需生成任何一句虚假文本的情况下,在猜测分布方面明显更加准确。
作者认为,这是因为“后训练”过程教会了 AI 如何成为一名得力的助手。当你要求一名助手去猜测人群的观点时,它会利用其知识给出一个聪明、直接的答案。但当你要求同一个助手去扮演一个特定的人时,它会陷入其“得力助手”的角色中,这使得它的语气过于统一,从而失去了不同人口统计特征所具有的独特特质。相比之下,原始的基础模型尚未被强行塞进那个单一的“助手”框框里,因此在被要求生成文本时,它们可以从更广泛、更混乱的人类声音池中汲取营养。
因此,论文得出结论:并不存在一种单一的“最佳”用于模拟人类的 AI。如果你需要生成感觉像是一群多样化的人的文本(例如用于电子游戏或社会科学模拟),你应该使用原始的基础模型。但如果你只是需要一个关于一个群体会如何思考的快速、准确的预测,你应该要求经过抛光的后训练模型来进行估计。该领域的困惑并不是因为某种类型的 AI 有缺陷;而是因为研究人员在执行特定任务时使用了错误的工具。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。