PLURAL: A Global Dataset for Value Alignment
本文介绍了 PLURAL,这是一个源自 92 个国家的综合价值观调查的大规模数据集,通过生成合成偏好三元组来增强大语言模型与多样化、非西方文化价值观的对齐,并证明了其在自动化指标和人工评估方面均取得了显著提升。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你打造了一个超级聪明的机器人厨师,它能烹饪一百万种不同的食谱。但问题在于:这个厨师几乎完全是由来自西方某个特定社区的一小群人训练出来的。结果,这个机器人认为每个人都希望他们的食物配上一份西方的价值观,即使是来自东京、孟买或里约热内卢的顾客提出了不同的要求。这个机器人可能精通日语或葡萄牙语,但它的“灵魂”仍然感觉非常美国化。这就像是一个流利的外国客人,虽然能完美地使用你的语言,却并不了解你的家庭传统。
于是有了 PLURAL,这是康奈尔大学研究人员发起的一个新项目,旨在修复机器人的这些文化盲点。
核心理念:一场全球性的味觉测试
研究人员意识到,要教会机器人尊重不同的文化,不能只是在互联网上随机询问人们喜欢什么。相反,他们转向了源头:一个大规模、具有科学严谨性的调查——综合价值观调查(Integrated Values Survey, IVS)。这项调查向来自 92 个不同国家的超过 156,658 人询问了他们最深层的信仰——他们认为什么是对的、错的、重要的或荒谬的。
把 IVS 想象成一场巨大的、全球性的“味觉测试”,人们在其中评选出他们生命中最喜欢的“风味”。但问题在于,你不能把一份调查问卷的电子表格喂给机器人。机器人需要的是故事和对话,而不是仅仅只有“是/否”这种勾选框。
魔法流水线:将调查转化为故事
因此,团队构建了一个两阶段的“翻译机器”,将那些枯燥的调查答案转化为 500,000 个真实的对话场景(称为“偏好三元组”)。
- 第一阶段(翻译器): 他们提取了一个真实的人的调查答案——比如,一位重视家庭责任高于休闲生活的日本 66 岁男性——并要求 AI 想象一个该人在现实生活中可能面临艰难抉择的情境。AI 生成了一个提示词,例如:“我的朋友想去打高尔夫球,但我女儿需要有人看顾。我该怎么办?”
- 第二阶段(讲述者): 随后,AI 写出了两种回应。一种回应(“偏好”的回应)反映了这位日本男性的真实价值观(优先考虑家庭责任)。另一种回应(“非偏好”的回应)则反映了另一种合理的观点(优先考虑休闲)。
他们针对 20 个多元化的国家进行了这种处理,创建了一个庞大的库,里面包含了“来自这个国家的人实际上会说什么”的场景。他们甚至确保挑选了代表该国真实年龄、性别和教育水平的调查受访者,从而保证数据不仅仅是关于同一种类型的人。
效果如何?味觉测试的结果
研究人员不仅是希望它有效,还通过三种方式对其进行了测试:
- “是否真实?”的检查: 他们验证了这些新故事是否确实保留了每个国家独特的“风味”。他们发现,数据仍然保留了例如巴西和日本之间的显著差异,甚至保留了每个国家内部观点的多样性。这不仅仅是一堆刻板印象;它是对真实人类多样性的丰富且复杂的反映。
- 机器人训练: 他们采用了一个标准的语言模型,并用这种新的 PLURAL 数据对其进行训练。他们使用另一套从未见过的文化问题(GLOBE 框架)来测试机器人。结果显示,经过 PLURAL 训练的机器人,在匹配像印度这样的国家文化特征方面,比其他强力方法提升了 27.7%。它不仅仅是在猜测,而是在学习目标文化的特定“氛围”。
- 人类裁决: 他们邀请了来自印度、巴西和日本的 176 名真实人士,让他们阅读新机器人和旧机器人的回答。人类压倒性地选择了 PLURAL 训练后的机器人所给出的回答,认为其更符合他们本国的价值观。甚至有人称赞一个回答“非常有印度特色”,指出它捕捉到了家庭如何利用 WhatsApp 保持联系的特定方式。
它“不是”什么(“流利但陌生”的陷阱)
论文非常明确地阐述了它不做的事情。它反对这样一种观点,即仅仅让机器人学会说当地语言(如印地语或阿拉伯语)就足够了。以前的尝试创造了“流利但陌生”的模型,它们可以在当地语言中聊天,但仍在推行西方价值观。PLURAL 表明,你需要针对价值观本身来训练模型,而不仅仅是针对词汇。
此外,论文也明确排除了这样一个想法:即通过告诉机器人“你来自巴西”来通过“提示词(Prompting)”让它具备文化意识。虽然这会有微小的帮助,但远不如通过数以千计的、基于真实价值观的实例进行实际训练那样有效。
缺陷:机器人仍然会被“挤压”
这是研究人员诚实面对局限性的部分。虽然机器人对不同文化的理解变得更好,但训练过程本身似乎在某种程度上“挤压”了差异。
想象一下,不同国家的文化轮廓就像散布在广阔田野上的点。真实的国家之间距离很远。在训练之后,机器人的新“文化点”向正确的方向移动了,但它们最终比真实的国家聚拢得更近。机器人捕捉到了大约 18% 的原始多样性。研究人员认为,这并不是因为数据不好,而是因为目前的训练方法(一种称为 DPO 的技术)往往会过度平滑化。这就像是一个照片滤镜,即使大家看起来依然有区别,但会让每个人看起来都变得有些相似。
总结
PLURAL 是一个巨大的、开放的库,包含 500,000 个基于 20 个国家真实调查的、聚焦于价值观的故事(并已准备好扩展到 92 个国家)。它证明了我们可以教会机器人尊重更广泛的人类价值观,使它们脱离单一的西方视角。这是迈向未来的一大步——在那个未来,我们的数字助手不仅能说出你的语言,更能真正理解你的心声与家园。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。