← 最新论文
💬 NLP

PALMs: Using Multi Construct-Grounded Rationales for Modeling Population Preferences in LLMs

本文介绍了人口对齐语言模型(Population Aligned Language Models, PALMs),这是一套通过利用基于多维度构念的理性依据进行偏好微调,从而与特定国家人口保持一致的模型套件,该模型在无需特定任务监督的情况下,在模拟多样化的文化价值观、信仰和社会推理方面显著优于现有基准模型。

原作者: Priyanka Dey, Brihi Joshi, Preyashi Poddar, Jieyu Zhao, Emilio Ferrara

发布于 2026-08-04
📖 1 分钟阅读☕ 轻松阅读

原作者: Priyanka Dey, Brihi Joshi, Preyashi Poddar, Jieyu Zhao, Emilio Ferrara

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在试图教一个机器人如何理解人类。目前,大多数机器人就像是全能型大厨,虽然尝过各种各样的食物,但并不真正懂得如何烹饪某个特定家庭的最爱。它们可能知道什么是“食物”,但并不理解为什么一位意大利的老祖母会偏爱慢炖肉酱(ragù),而一位巴西的青少年却渴望吃香辣的黑豆饭(feijoada)。这就是大语言模型(LLMs)的世界——这些超级智能的计算机程序可以写作、聊天并解决问题。但棘手的地方在于:这些机器人往往表现得像是一个单一的、平均水平的人。它们忽略了那些让不同人群产生不同思维和感受的深层、隐形的规则。

为了解决这个问题,科学家们开始研究“偏好”——即人们喜欢什么、相信什么以及珍视什么。他们知道,我们的选择并非随机,而是受到我们的个性(我们是冒险型还是谨慎型?)、文化(我们重视集体还是个人?)以及道德准则(什么才是公平或正确的?)的影响。研究人员提出的核心问题是:我们如何教机器人停止扮演一个通用的“平均人类”,转而开始扮演一个来自特定地方、拥有独特怪癖和文化背景的具体的人?如果我们能做到这一点,这些机器人就能更好地帮助我们、理解我们,甚至模拟真实人类对新想法的反应。

正是在这里,一个名为 PALMs(群体对齐语言模型)的新型研究团队提出了一个聪明的解决方案。把标准的机器人想象成一名试图通过只看最终成绩来背诵考试答案的学生。他们可能会得到正确答案,但并不真正理解为什么这个答案是正确的。开发 PALMs 的研究人员意识到,要真正理解一个群体,机器人需要学习答案背后的“秘方”。他们不仅仅是向机器人喂入关于人们说了什么的资料;他们还教会了机器人在给出答案之前写下一份“推理日记”。

他们是这样做的:他们创建了五个特殊的机器人版本,分别对应五个国家:美国、印度、巴西、法国和意大利。但他们并没有简单地告诉机器人“你是一个美国人”,而是给了它一个更深层的工具包。他们教会机器人使用五种特定的视角进行思考,就像戴上了一副能改变视觉效果的特制眼镜:

  1. 个性: 这个人是乐于接受新事物,还是喜欢循规蹈矩?
  2. 文化: 他们重视独立自主,还是重视集体凝聚力?
  3. 价值观: 他们的驱动力是什么?是自由、安全,还是帮助他人?
  4. 世界观: 他们认为世界是一个安全、令人兴奋的地方,还是一个危险、混乱的地方?
  5. 道德观: 他们认为什么是公平的,或者什么是神圣不可侵犯的?

机器人被训练去使用这五个视角写一段短文,以此来解释为什么来自某个国家的人会做出某种选择。例如,如果一个巴西人偏好某种类型的音乐,机器人不会只说“他们喜欢它”。它会写下一段笔记说:“因为这个人重视社区感和感官享受(文化与价值观),并且将世界视为一个充满乐趣机会的地方(世界观),所以这种音乐让他感到契合。”机器人反复练习这个过程,学习如何将这些“推理笔记”隐藏在脑海中,以便稍后能自动调用。

结果非常出色。当研究人员测试这些新机器人时,他们发现 PALMs 比旧的通用型机器人更能理解人类。事实上,在所有五个国家中,新模型的准确率比之前的最佳方法平均提高了 8.59%。这表明,将机器人的学习建立在深层的心理学和文化理论之上,比仅仅展示表面数据或简单的统计标签(如“年龄”或“性别”)要有效得多。

研究人员还检查了这些机器人是否能胜任其他任务,比如充当“个性化奖励模型”(决定一个特定的人会喜欢什么)或模拟一个群体对新政策的反应。在这些测试中,PALMs 再次超越了竞争对手,在个性化奖励方面提升了 5.19%,在群体模拟方面提升了 6.34%。即使被要求解决关于人类情感和意图的社会谜题(一项被称为 Social IQA 的任务),这些机器人的表现也变得更好,达到了 80.23% 的准确率。

然而,研究人员也谨慎地指出,这并不是万能的灵丹妙药。他们发现,如果只是单纯地向机器人喂入更多的调查数据而不采用这种“推理日记”的方法,在某些情况下反而会让情况变糟,导致机器人失去观察不同视角的的能力。他们也承认,将整个国家视为一个单一群体是一种简化处理;在每个国家内部,还存在着许多不同的地区和文化,目前的模型尚未能完全捕捉到这些细节。但主要的启示是明确的:如果你想让一个机器人真正理解一个群体,你必须教它如何像他们一样思考,而不仅仅是像他们一样说话。通过给机器人一个结构化的方式去推理个性与文化,我们能获得一个更清晰、更多元的人类世界图景。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →