Learning Mixtures of Plackett-Luce Models for Multi-Objective Alignment
本文介绍了 MoPLEx,这是一种高效的期望最大化算法,它结合了通过大语言模型进行的排序增强与基于梯度的估计,旨在从多路排序中学习 Plackett-Luce 混合模型,从而克服理论上的可识别性限制,并显著提高异质偏好对齐任务中的聚类和排序准确度。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在人工智能领域,一个主要的挑战是如何教计算机理解人类真正的需求。当语言模型生成响应时,通常由人类对多个选项进行从优到劣的排序来对其进行评判。这个被称为“对齐”的过程,通常假设所有人类对于什么是好的回答都持有共识。然而在现实中,人们拥有不同的价值观、背景和优先级。一个人可能优先考虑响应的帮助性,而另一个人则更在意其真实性。当这些多元化的意见混合在一起时,试图从中学习的单一计算机模型往往会感到困惑,无法捕捉到任何特定群体的独特偏好。
为了解决这个问题,东北大学和密歇根大学的研究人员开发了一种新方法来理清这些混合信号。他们将这个问题比作整理一堆被混在一起的来自不同社区的邮件。他们并不试图将每封信都强行归入一个单一的类别,而是旨在识别出不同的社区,并为每个社区学习一套特定的规则。该团队创建了一种名为 MOPLEX 的算法,全称是 Plackett-Luce 模型的混合模型。简单来说,这是一种统计工具,它可以观察一份排序选择列表,并判断出这份列表很可能是由不同类型的群体混合而成,且每个人都有自己判定优劣的方式。
研究人员在工作中发现了一个显著的障碍:当选择列表过短时,在数学上是不可能区分出不同群体的。想象一下,如果你试图根据一份人们仅从两个选项中选出一个首选项的列表,来猜测两个不同群体的偏好。这些模式看起来可能完全一致,使得真实的群体变得不可见。团队发现,如果排序列表很短,无论看到多少数据,计算机都无法区分不同的潜在偏好。为了解决这个问题,他们设计了一个巧妙的变通方法。在训练模型之前,他们利用计算机本身生成额外的、虚构的响应,并将它们添加到排序列表的底部。通过扩展这些列表,算法终于获得了足够的信息来识别不同群体之间的差异,并学习它们的独特规则。
然而,仅仅延长列表会产生一个新的问题:这会让计算机处理起来变得过于缓慢且昂贵。为这些长列表中每一个项目计算概率需要巨大的计算能力。为了克服这一点,团队引入了一个基于计算机如何“思考”文本的捷径。算法不再对每一个响应都进行完整的、沉重的计算,而是挑选出几个关键的示例进行详细分析。然后,它利用在这些少量示例中发现的数学模式来估算列表中其余项的分数。这种方法就像是通过测量房间内几个点的温度来了解整个空间的气候,而不是测量每一寸空间。
这种方法的测试结果非常显著。当在涉及不同评估标准(如帮助性和诚实性)的真实世界数据上进行测试时,这种新方法在对这些偏好进行分组的准确性方面,比旧技术提高了近百分之四十四。它在预测正确响应顺序方面的表现也提升了超过百分之十五。此外,通过使用他们的估算捷径,研究人员将运行训练所需的时间和内存减少了高达三倍。在实际应用中,这意味着以前需要昂贵、高端硬件才能完成的复杂任务,现在可以更高效地完成,从而为能够更好地尊重并适应不同人类用户多样化需求的 AI 系统打开了大门。这项研究证实,通过扩展数据并使用智能估算,是有可能教机器理解人类做出选择时那些微妙且多样的差异的。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。