← 最新论文
🤖 machine learning

Learning Sexism Detection Using Multi-Agent Perspectivist Preference Optimization

本文介绍了多智能体透视主义偏好优化(Multi-Agent Perspectivist Preference Optimization, MAP-PO)框架,该框架通过聚类标注行为并微调经过偏好优化协调的专业化语言模型智能体,旨在解决性别歧视检测中的标注者分歧问题,从而在保持与多数标签一致性的同时保留多样化的视角。

原作者: Hadi Mohammadi, Tina Shahedi, Robert A. Bagheri, Mehdi Dastani, Masoume M. Raeissi

发布于 2026-08-06
📖 1 分钟阅读☕ 轻松阅读

原作者: Hadi Mohammadi, Tina Shahedi, Robert A. Bagheri, Mehdi Dastani, Masoume M. Raeissi

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教一个机器人如何识别恶毒的笑话。你请了十个不同的人来读一个笑话,并判断它是否带有性别歧视。有些人说:“是的,这太差劲了,”而另一些人则说:“不,这只是个玩笑。”在计算机科学的旧时代,如果大多数人投了“是”,计算机就会直接忽略那些“否”的票数,并将其视为事实。但如果那些“否”的票数并不是错误呢?如果它们仅仅是不同的人通过不同的视角看世界呢?这就是被称为“透视主义”(perspectivist)科学的核心领域。它认为,当人类产生分歧时,这种分歧不是要被删除的噪音,而是值得研究的信号。核心问题在于:你如何构建一台不仅能选出胜者,而且能真正理解为什么不同的人会有不同见解的计算机?

这篇论文介绍了一个名为 MAP-PO(多智能体透视主义偏好优化)的巧妙新系统,正是为了解决这个问题。研究人员并没有试图强迫一个机器人成为“完美”的裁判,而是构建了一个由三个专业化机器人智能体组成的团队。他们是这样做的:首先,他们观察了标注数据的人(人类),并且没有按年龄或性别进行分组,而是根据他们“如何投票”来进行分组。有些人非常严格,经常投“是”;而另一些人则比较宽容。研究人员发现,这些“投票风格”才是理解数据的关键,而不是人类的背景。

接着,他们训练了一个机器人智能体去模仿这三种投票风格中的每一种。但棘手的地方在于,如果他们只是告诉每个机器人:“只听从你自己的群体”,这些机器人就会变得疯狂。它们变成了极端的刻板印象,一个机器人对所有事物都说“是”,而另一个则对所有事物都说“否”,从而失去了它们本应代表的真实人类的联系。论文发现,要解决这个问题,机器人需要一个“团队信号”。它们不仅要因为忠于自己的风格而获得奖励,还要因为协作得出正确答案而获得奖励。当研究人员加入这个团队奖励时,机器人就保持了平衡。它们学会了在不失控的前提下,拥有独特的个性。最终,这个由三个机器人组成的团队在识别性别歧视方面,比任何单个机器人或任何旧式的计算机程序都要出色,这证明了保持不同视角的生命力,会让系统变得更聪明、更诚实。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →