← 最新论文
💬 NLP

LeWiDi-2025 at NLPerspectives: Third Edition of the Learning with Disagreements Shared Task

NLPerspectives 上的第三届 LeWiDi 共享任务通过将基准扩展到具有序数标签方案的四个多样化 NLP 任务,引入软标签和透视主义评估范式及新颖指标,并提供新的资源和对建模人类判断差异的见解,推进了具备分歧感知能力的 AI 的发展。

原作者: Elisa Leonardelli, Silvia Casola, Siyao Peng, Giulia Rizzi, Valerio Basile, Elisabetta Fersini, Diego Frassinelli, Hyewon Jang, Maja Pavlovic, Barbara Plank, Massimo Poesio

发布于 2026-02-09
📖 1 分钟阅读☕ 轻松阅读

原作者: Elisa Leonardelli, Silvia Casola, Siyao Peng, Giulia Rizzi, Valerio Basile, Elisabetta Fersini, Diego Frassinelli, Hyewon Jang, Maja Pavlovic, Barbara Plank, Massimo Poesio

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在试图教一个机器人如何理解人类语言。长期以来,我们通过向机器人展示那些每个人都对答案一致的例子来教导它们,比如“2 + 2 = 4”。但在现实生活中,人类经常存在分歧。一个人可能觉得一个笑话非常搞笑,而另一个人可能觉得它具有冒犯性。一个人可能认为一句话是谎言,而另一个人则认为这只是一个无伤大雅的观点。

这篇论文描述了第三届旨在教导 AI 如何处理这些分歧(而非假装分歧不存在)的“竞赛”(称为 LeWiDi-2025)的第三版。

以下是他们所做工作的简单拆解,使用了日常类比:

1. 目标:教 AI 倾听大众的声音

与其强迫 AI 仅选择一个“正确”答案,组织者更希望看到 AI 是否能够理解人类观点的全貌

  • 旧方法: 如果 10 个人对一部电影投票,其中 6 个人说“好”,4 个人说“坏”,旧的 AI 只会被告知:“答案是‘好’。”它忽略了那 4 个人。
  • 新方法: AI 被告知:“这里是完整的故事:6 个人喜欢,4 个人不喜欢。你的任务是理解他们为什么会有这种感觉,并预测观点的分布情况。”

2. 四种“游戏”(数据集)

竞赛提供了四种不同类型的谜题来解决,每种都代表了一种不同的人类分歧类型:

  • 讽刺游戏 (CSC): 想象在读一条短信。它是真诚的赞美还是讽刺的挖苦?不同的人会对其“讽刺程度”进行 1 到 6 级的评分。
  • 反讽游戏 (MP): 一个短贴和一条回复。回复是否具有反讽意味?这项比赛以 9 种不同语言(如英语、西班牙语和阿拉伯语)进行,展示了反讽是一个全球性的问题。
  • 释义游戏 (Par): 提出两个问题。它们是在问同样的事情吗?人们不再使用简单的“是/否”,而是按 -5 到 5 的比例对它们的相似度进行评分。
  • 逻辑游戏 (VEN): 一个陈述和一个事实。这个事实是证明、反驳该陈述,还是与该陈述无关?在这里,人们还必须写下对答案的解释

3. 两种玩法(任务)

参与者需要在两种不同的方式之间做出选择,以展示其 AI 的理解能力:

  • 任务 A:“天气预报员”(软标签/Soft-Label)
    与其猜测一个特定的答案,AI 扮演的是天气预报员的角色。它不只是说“会下雨”;它会说:“有 60% 的概率下雨,30% 的概率晴天,10% 的概率下雪。” AI 预测的是人类投票的分布情况
  • 任务 B:“读心者”(透视主义/Perspectivist)
    这更难。AI 必须猜出一个特定的人会说什么。如果你告诉 AI:“这是 X 先生通常的想法”,AI 必须预测:“根据 X 先生的历史记录,他很可能会给出这样的答案。” 这就像是在预测你那位脾气暴躁的叔叔或乐观的阿姨会对一个笑话做出怎样的反应。

4. 新的计分卡(指标)

过去,评委使用一把简单的尺子来衡量 AI 偏离了多少。但对于像“讽刺等级”或“多种语言”这样的事物,那把尺子并不适用。

  • 新的尺子: 他们发明了新的衡量方式。
    • 对于“等级”(如 1 到 6 级),他们使用了一种能够理解“差一点”的概念的指标(例如,说 4 而不是 5,比说 1 而不是 5 要好)。
    • 对于“读心者”任务,他们衡量了 AI 模仿个人特定偏好和习惯的能力。

5. 结果:谁赢了?

大约有 15 支队伍参加了这次竞赛。以下是他们的发现:

  • “大脑袋”方法: 顶尖团队使用了大语言模型 (LLMs)——即那些能写文章并能和你聊天的超聪明 AI。这些模型非常擅长观察不同人的投票示例,并模仿那种模式。
  • “小而强大”的方法: 一些团队使用了较小的专门化模型。这些模型在规模较小、难度较高的数据集上表现得惊人地好。
  • 秘密武器: 获胜的系统不仅看文本,还看是谁在写文本。它们利用了诸如标注者的年龄、性别或过去的投票历史等线索,从而做出更好的预测。
  • “解释”加成: 在逻辑游戏中,那些将人们写的解释(而不只是答案)喂给 AI 的团队表现得更好。这就像是理解了人们为什么这样投票,而不仅仅是如何投票。

6. 局限性(注意事项)

作者坦诚地说明了他们没有测试的内容:

  • “新面孔”问题: 在现实世界中,你可能会遇到一个从未见过其观点的陌生人。在这次竞赛中,AI 测试的是那些在训练期间已经“见过面”的人。我们目前还不清楚这些模型是否能处理一个完全陌生的人。
  • 仅限文本: 竞赛仅限于阅读和写作。我们不知道这些方法是否适用于图像、视频或语音。

总结

这篇论文是一份关于一场教导 AI 停止假装所有人意见一致的竞赛的成绩单。通过使用新的评分方法并专注于人类分歧的复杂现实,获胜者表明,最好的 AI 模型是那些能够观察人群、理解其中的不同声音,并预测观点混合情况(而非仅仅挑选一个单一赢家)的模型。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →