Learning Moral Diversity: Modelling Individual Perspectives in Moral Classification of Texts
本文提出了一种通过利用标注者特定特征来扩展预训练语言模型,从而在道德文本分类中对个体标注者视角进行建模的方法,证明了考虑主观分歧比将标签聚合为单一真值的传统方法能产生更准确的预测和更深刻的见解。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图了解人们对某个特定新闻故事或一条推文的看法。你请了 23 位不同的朋友去阅读它,并根据他们个人的道德准则告诉你是“好”、“坏”还是“中立”。
在过去,研究人员会把这 23 个答案全部揉在一起,然后说:“好吧,大多数人都认为它是‘坏’的,所以那就是真相。”他们将朋友之间的分歧视为仅仅是“噪声”或错误,并将其忽略。
这篇论文指出,忽略分歧才是真正的错误。
以下是研究人员所做工作的简单拆解,使用了日常类比:
1. 问题所在:“平均水平”的朋友并不存在
研究人员观察了一个庞大的推文集合,其中许多人已经对这些推文进行了道德价值观(如“公平”、“忠诚”或“纯洁”)的标注。他们注意到人们经常产生巨大的分歧。一个人可能认为某条推文违反了“权威”,而另一个人则认为它是“公平”的捍卫者。
标准的 AI 模型试图寻找一个单一的“平均”答案。研究人员认为,这就像试图通过只看所有像素的平均颜色来描述一幅复杂的画作。你会丢失细节、纹理和艺术家的特定意图。通过强行设定一个单一的“地面真理”(ground truth),AI 错失了人类思维中丰富且混乱的现实。
2. 解决方案:赋予 AI “人格”
团队构建了一种新型 AI 模型。可以将标准的 AI 模型想象成一个通用的翻译员,说着一种通用的语言。
他们的新模型则像是一个拥有 23 种不同“人格”或“面具”的翻译员。
- 他们使用了一个已经具备优秀文本阅读能力的强大预训练 AI(称为 BERT)。
- 他们在上面添加了一个特殊的“标注层”(Annotator Layer)。
- 这个层充当了每位 23 位朋友的个人过滤器。它能学习到“朋友 #5”在“纯洁”方面往往非常严格,而“朋友 #12”对“关怀”非常敏感。
模型不再问:“这条推文的真实道德价值是什么?”,而是问:“朋友 #5 会如何评价这条推文?”以及“朋友 #12 会如何评价这条推文?”
3. 结果:更准确的预测与新的洞察
当他们测试这个新模型时:
- 它更擅长猜测个人观点: 与旧的“平均”模型相比,该模型在预测特定人会对推文进行何种标注方面,准确度有了显著提升。其准确率提高了约 10%。
- 它揭示了隐藏的模式: 因为模型学习了标注者的“人格”,研究人员可以观察数据并发现诸如:“哦,这组朋友总是将推文视为‘道德违规’,而那组人则非常谨慎,很少将任何内容标注为道德相关。”
- “聚合”陷阱: 当他们尝试强迫这个高度个性化的模型给出一个单一的“平均”答案(以模仿旧方法)时,其性能反而下降了。这证明了旧的平均标签的方法掩盖了一个事实:人们看待世界的方式确实不同。那个“平均”答案并不一定是“最好”的答案,它只是一个失去了细微差别的折中方案。
4. 核心启示
论文得出结论:分歧不是漏洞,而是一种特性。
在道德判断的世界里,人们不仅仅是在犯错,他们拥有不同的视角。通过构建能够尊重并学习这些个体视角的 AI,我们可以获得更清晰的人类道德图景。研究人员建议,未来的 AI 不应仅仅试图寻找“唯一的正确答案”,而应该学习理解人们解读世界的多种多样的方式。
简而言之: 他们教会了 AI 停止假装每个人都想得一样,转而学习如何理解每一个特定的人是如何思考的。结果是一个更聪明、更诚实的模型,它理解了人类观点的复杂现实。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。