← 最新论文
💬 NLP

Not All Subjectivity Is the Same! Defining Desiderata for the Evaluation of Subjectivity in NLP

这篇立场论文针对旨在反映多元视角的 NLP 模型,提出了七个以用户为中心的主观性评估标准,并通过分析 60 篇论文的实验设置,揭示了当前在区分歧义与多声输入、主观性表达及标准间协同等方面存在的评估缺口。

原作者: Urja Khurana, Michiel van der Meer, Enrico Liscio, Antske Fokkens, Pradeep K. Murukannaiah

发布于 2026-03-31
📖 1 分钟阅读☕ 轻松阅读

原作者: Urja Khurana, Michiel van der Meer, Enrico Liscio, Antske Fokkens, Pradeep K. Murukannaiah

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文就像是一份**“给 AI 的‘主观性’体检指南”**。

想象一下,你正在教一个超级聪明的机器人(AI)如何理解人类的世界。对于像“法国首都是什么”这样的问题,答案只有一个(巴黎),机器人很容易学。但对于像“这句话是不是在骂人?”或者“这个电影好不好看?”这类问题,不同的人有不同的看法。这就是论文里说的**“主观性”**。

现在的 AI 模型往往太“随大流”了,它们倾向于只给出一个“大多数人的答案”,就像班级里只统计了“谁举手最多”,而忽略了那些少数派的声音。这篇论文的作者们认为,这样不行!我们需要一种能听懂“众声喧哗”的 AI。

为了做到这一点,他们提出了7 个检查标准(Desiderata),就像给 AI 医生开的 7 张处方,用来评估它是否真的“懂”了人类的主观世界。

🌟 核心比喻:AI 是一个“翻译官”

想象 AI 是一个站在人群中间的翻译官。

  • 传统的 AI:只把大家吵得最凶的那句话翻译出来,或者把所有人的意见揉成一个“平均意见”告诉你。
  • 理想的“主观敏感”AI:能听出谁在生气、谁在开玩笑、谁是因为文化背景不同才这么想,并且能把这些不同的声音都清晰地传达给你。

📋 7 个检查标准(AI 的“七项全能”)

作者把这 7 个标准设计成了一套循序渐进的考试

  1. 🕵️‍♂️ 第一步:认出“什么时候需要主观”

    • 比喻:就像警察在街上巡逻。看到有人打架(事实),直接抓人;看到有人吵架(观点不同),不能直接抓,得先判断这是不是“主观分歧”。
    • AI 要做:分清什么时候是“标准答案”,什么时候是“大家看法不一”。
  2. 🧩 第二步:认出“是哪种主观”

    • 比喻:就像医生看病。是“病情模糊”(信息不全,比如“把那个东西拿走”——哪个东西?),还是“众口难调”(信息很全,但大家就是看法不同,比如“这衣服丑不丑”)?
    • AI 要做:区分是**“信息模糊”(Ambiguous)还是“观点多元”**(Polyphonic)。
  3. 🤔 第三步:搞懂“为什么会有分歧”

    • 比喻:医生不仅要看病,还要知道病因。是因为病人没睡醒?还是因为文化差异?
    • AI 要做:解释清楚为什么大家看法不同。是因为语境缺失?还是因为文化背景不同?
  4. 🎯 第四步:准确预测

    • 比喻:既然知道了原因,就要给出一个符合逻辑的预测。
    • AI 要做:根据前面的分析,给出一个能反映这些分歧的答案。
  5. ⚖️ 第五步:校准“比例”

    • 比喻:如果 90% 的人觉得这是笑话,10% 的人觉得这是冒犯,AI 不能只说“这是冒犯”,也不能只说“这是笑话”。它得说:“大部分人觉得好笑,但有一小部分人觉得被冒犯了。”
    • AI 要做:预测出的观点分布,要和真实人类的观点分布对得上号。
  6. 🗣️ 第六步:代表“所有声音”

    • 比喻:开大会时,不能只让嗓门大的人说话。那些少数派、边缘群体的声音(比如少数族裔、特定文化背景的人)也要被听到。
    • AI 要做:不能只迎合“主流观点”,要能代表少数派的声音,避免偏见。
  7. 🎨 第七步:表达得“让人舒服”

    • 比喻:就算 AI 知道所有观点,如果它像念经一样把 100 种观点全念给你听,你会疯掉的。它得像个高明的主持人,把复杂的观点整理得清晰、简洁,让你听得懂,又不觉得烦。
    • AI 要做:把复杂的主观性用用户喜欢的方式表达出来,既全面又不啰嗦。

🔍 现在的 AI 做得怎么样?(论文发现)

作者们像“阅卷老师”一样,检查了60 篇相关的学术论文,结果发现:

  • 做得好的:大部分研究都在努力让 AI 猜对“大多数人的答案”(第四步),或者算算 AI 猜得准不准(用各种数学公式)。
  • 做得差的(巨大的空白)
    • 分不清“模糊”和“多元”:很多研究没搞清楚,到底是信息不够(模糊),还是大家就是看法不同(多元)。这就像把“没看清路”和“路有两条”混为一谈。
    • 忽略了“为什么”:很少研究去解释“为什么”会有分歧。
    • 忘了“怎么表达”:几乎没人研究怎么把这些复杂的观点舒服地讲给用户听(第七步)。如果 AI 把用户搞晕了,那它再聪明也没用。

💡 总结与启示

这篇论文的核心思想是:不要试图把人类复杂的想法“压扁”成一个单一的答案。

未来的 AI 不应该只是一个“正确答案生成器”,而应该是一个**“观点的策展人”**。它需要:

  1. 知道什么时候该问“你确定吗?”(识别模糊)。
  2. 知道什么时候该说“有人这么想,也有人那么想”(识别多元)。
  3. 最重要的是,要把这些不同的声音,有礼貌、有逻辑、不让人头疼地讲出来。

这就好比,以前 AI 是**“独裁者”,只告诉你一种真理;现在我们要把它培养成“民主主持人”**,让每一种声音都有机会被听见,同时还能把场面控制得井井有条。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →