想象一下,你正试图教一个机器人如何识别恶毒的笑话。你请了十个不同的人来读一个笑话,并判断它是否带有性别歧视。有些人说:“是的,这太差劲了,”而另一些人则说:“不,这只是个玩笑。”在计算机科学的旧时代,如果大多数人投了“是”,计算机就会直接忽略那些“否”的票数,并将其视为事实。但如果那些“否”的票数并不是错误呢?如果它们仅仅是不同的人通过不同的视角看世界呢?这就是被称为“透视主义”(perspectivist)科学的核心领域。它认为,当人类产生分歧时,这种分歧不是要被删除的噪音,而是值得研究的信号。核心问题在于:你如何构建一台不仅能选出胜者,而且能真正理解为什么不同的人会有不同见解的计算机?
这篇论文介绍了一个名为 MAP-PO(多智能体透视主义偏好优化)的巧妙新系统,正是为了解决这个问题。研究人员并没有试图强迫一个机器人成为“完美”的裁判,而是构建了一个由三个专业化机器人智能体组成的团队。他们是这样做的:首先,他们观察了标注数据的人(人类),并且没有按年龄或性别进行分组,而是根据他们“如何投票”来进行分组。有些人非常严格,经常投“是”;而另一些人则比较宽容。研究人员发现,这些“投票风格”才是理解数据的关键,而不是人类的背景。
接着,他们训练了一个机器人智能体去模仿这三种投票风格中的每一种。但棘手的地方在于,如果他们只是告诉每个机器人:“只听从你自己的群体”,这些机器人就会变得疯狂。它们变成了极端的刻板印象,一个机器人对所有事物都说“是”,而另一个则对所有事物都说“否”,从而失去了它们本应代表的真实人类的联系。论文发现,要解决这个问题,机器人需要一个“团队信号”。它们不仅要因为忠于自己的风格而获得奖励,还要因为协作得出正确答案而获得奖励。当研究人员加入这个团队奖励时,机器人就保持了平衡。它们学会了在不失控的前提下,拥有独特的个性。最终,这个由三个机器人组成的团队在识别性别歧视方面,比任何单个机器人或任何旧式的计算机程序都要出色,这证明了保持不同视角的生命力,会让系统变得更聪明、更诚实。
技术摘要:使用多智能体透视主义偏好优化学习性别歧视检测
问题陈述
自然语言处理(NLP)中的性别歧视检测本质上具有主观性。标注者对于特定文本是否包含性别歧视存在分歧,这并非由于错误,而是因为他们确实以不同的方式感知内容。标准的 NLP 方法通常通过将多个标注合并为一个单一的“地面真值”(ground truth)——即通过多数投票法——来丢弃这种分歧,将少数派观点视为噪声。然而,透视主义研究认为,这种分歧是一种应当被建模而非被平均化掉的信号。挑战在于如何创建一个能够表示这些多样化标注者视角,同时确保系统仍能与人类判断的实际分布保持校准的系统,而不是强行追求单一的共识。
方法论:MAP-PO
作者提出了多智能体透视主义偏好优化(MAP-PO),这是一个旨在通过多智能体系统保留多样化标注者视角的框架。该方法分为三个主要阶段:
行为聚类:
作者并没有根据人口统计属性(年龄、性别等)对标注者进行分组,而是根据其标注行为进行聚类。利用 EXIST 2024 数据集(英文和西班牙文推文),标注者通过三个特征进行刻画:
- YES 率: 标注者将文本标记为性别歧视的频率。
- 一致率: 与标注者多数派达成一致的频率。
- 标签熵: YES/NO 决策的平衡程度。
针对每种语言分别应用 K-means 聚类(k=3),从而产生三种截然不同的行为簇(clusters)。
智能体训练(微调):
为每个簇训练一个大语言模型(LLM)智能体。训练过程包含两个阶段:
- 第一阶段(SFT): 智能体在所属特定簇的多数派标签上进行监督式微调(SFT)。为了防止智能体过度偏离,训练数据中混合了“共享正例”(所有簇都达成一致的文本)和“团队对齐示例”(标记为整体标注者多数派的文本)。
- 第二阶段(偏好优化): 作者探索了三种优化目标来精炼智能体行为:
- DPO(直接偏好优化): 在不同簇存在分歧的文本上,训练智能体倾向于选择其所属簇的标签而非相反标签。
- Mars-PO: 将 DPO 适配于多智能体系统,在包含个体偏好对的同时,加入共享偏好对(一致性文本)。
- GRPO(群组相对策略优化): 使用一个结合了个体奖励(匹配所属簇的标签)和团队奖励(匹配整体标注者多数派)的凸奖励函数。团队权重 (α) 用于平衡这两个目标。
推理:
在推理阶段,三个智能体独立进行预测。最终的团队预测由智能体之间的多数投票决定。系统还利用智能体之间的分歧作为置信度信号;高分歧意味着文本在人类标注者之间也存在高度争议。
核心贡献
- 行为聚类 vs. 人口统计聚类: 论文证明,在性别歧视检测任务中,基于行为特征(YES 率、一致率、熵)的聚类比基于人口统计属性的聚类能更有效地对标注者进行分类。统计测试显示,簇成员身份与性别或年龄等人口统计特征之间没有显著关联。
- 多智能体偏好优化: 作者改编了 Mars-PO 框架,为处理“地面真值”依赖于视角的任务微调专门化的 LLM 智能体。
- 奖励设计分析: 通过在四种设置(两种语言 × 两种骨干模型:GPT-4.1-mini 和 Qwen3-8B)下的广泛实验,论文指出:仅在各自簇的标签上训练智能体会导致极端的两极分化(智能体的行为远超其所代表的行为)。相反,引入共享团队级信号(通过 SFT 中的数据混合实现隐式,或通过 Mars-PO/GRPO 奖励实现显式)对于使智能体在保持特定簇校准的同时维持团队准确性至关重要。
结果
评估涵盖了四个设置:GPT-EN、GPT-ES、Qwen-EN 和 Qwen-ES。关键发现包括:
- 微调的必要性: 若不进行微调,零样本(zero-shot)智能体的表现几乎完全一致(接近 100% 一致),无法捕捉多样化的视角。
- 仅靠个体训练导致的极化: 纯粹的个体偏好优化(例如不含团队信号的 DPO)会导致智能体过度反应,使得簇 1 智能体几乎将 0% 的文本标记为性别歧视,而簇 3 智能体则几乎标记了近 100%,无论实际的簇分布如何。这导致了高分歧和低校准度。
- 团队信号的有效性: 加入团队信号能一致地恢复校准度。
- 在 GPT-EN 设置下,表现最佳的系统(α=0.17 的 GRPO)实现了 90.3% 的团队准确率和 89.9 的团队 F1,超越了所有基准模型。
- SFT-mixed 方法(隐式团队信号)同样表现稳健,以极低的误差实现了高水平的校准。
- 在较小的 Qwen 骨干模型上,SFT 的表现略优于 GRPO,这表明存在容量效应,即 GRPO 中的拒绝采样相对于监督标签引入了噪声。
- 泛化性: 核心发现——即仅靠个体优化会导致智能体极化,而团队信号可以修复这种极化——在两种语言和两种骨干模型中均得到了验证。
意义与主张
论文声称 MAP-PO 成功地将标注者分歧视为一种信号而非噪声。其主要意义在于证明了:
- 视角是行为性的,而非人口统计性的: 处理主观任务时,有效的智能体身份源于标注行为,而非人口统计画像。
- 校准需要团队锚点: 为了防止智能体漂移到不切实际的极端情况,引入共享的团队级训练信号是必不可少的。该信号确保智能体在代表特定观点的同时,仍能锚定在更广泛的人类判断分布中。
- 分歧具有信息量: 系统产生差异化输出的能力可作为有用的置信度信号,用于标记那些真正存在争议、可能需要人工审查的文本,而不是强行制造一个潜在的虚假共识。
作者将 MAP-PO 定位为一种辅助内容审核的工具,旨在强调有争议的情况,而非做出自主的审核决策,同时也承认了在数据集范围(EXIST 2024)和数据特定块设计方面的局限性。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。