Not All Subjectivity Is the Same! Defining Desiderata for the Evaluation of Subjectivity in NLP
这篇立场论文针对旨在反映多元视角的 NLP 模型,提出了七个以用户为中心的主观性评估标准,并通过分析 60 篇论文的实验设置,揭示了当前在区分歧义与多声输入、主观性表达及标准间协同等方面存在的评估缺口。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
这篇论文就像是一份**“给 AI 的‘主观性’体检指南”**。
想象一下,你正在教一个超级聪明的机器人(AI)如何理解人类的世界。对于像“法国首都是什么”这样的问题,答案只有一个(巴黎),机器人很容易学。但对于像“这句话是不是在骂人?”或者“这个电影好不好看?”这类问题,不同的人有不同的看法。这就是论文里说的**“主观性”**。
现在的 AI 模型往往太“随大流”了,它们倾向于只给出一个“大多数人的答案”,就像班级里只统计了“谁举手最多”,而忽略了那些少数派的声音。这篇论文的作者们认为,这样不行!我们需要一种能听懂“众声喧哗”的 AI。
为了做到这一点,他们提出了7 个检查标准(Desiderata),就像给 AI 医生开的 7 张处方,用来评估它是否真的“懂”了人类的主观世界。
🌟 核心比喻:AI 是一个“翻译官”
想象 AI 是一个站在人群中间的翻译官。
- 传统的 AI:只把大家吵得最凶的那句话翻译出来,或者把所有人的意见揉成一个“平均意见”告诉你。
- 理想的“主观敏感”AI:能听出谁在生气、谁在开玩笑、谁是因为文化背景不同才这么想,并且能把这些不同的声音都清晰地传达给你。
📋 7 个检查标准(AI 的“七项全能”)
作者把这 7 个标准设计成了一套循序渐进的考试:
🕵️♂️ 第一步:认出“什么时候需要主观”
- 比喻:就像警察在街上巡逻。看到有人打架(事实),直接抓人;看到有人吵架(观点不同),不能直接抓,得先判断这是不是“主观分歧”。
- AI 要做:分清什么时候是“标准答案”,什么时候是“大家看法不一”。
🧩 第二步:认出“是哪种主观”
- 比喻:就像医生看病。是“病情模糊”(信息不全,比如“把那个东西拿走”——哪个东西?),还是“众口难调”(信息很全,但大家就是看法不同,比如“这衣服丑不丑”)?
- AI 要做:区分是**“信息模糊”(Ambiguous)还是“观点多元”**(Polyphonic)。
🤔 第三步:搞懂“为什么会有分歧”
- 比喻:医生不仅要看病,还要知道病因。是因为病人没睡醒?还是因为文化差异?
- AI 要做:解释清楚为什么大家看法不同。是因为语境缺失?还是因为文化背景不同?
🎯 第四步:准确预测
- 比喻:既然知道了原因,就要给出一个符合逻辑的预测。
- AI 要做:根据前面的分析,给出一个能反映这些分歧的答案。
⚖️ 第五步:校准“比例”
- 比喻:如果 90% 的人觉得这是笑话,10% 的人觉得这是冒犯,AI 不能只说“这是冒犯”,也不能只说“这是笑话”。它得说:“大部分人觉得好笑,但有一小部分人觉得被冒犯了。”
- AI 要做:预测出的观点分布,要和真实人类的观点分布对得上号。
🗣️ 第六步:代表“所有声音”
- 比喻:开大会时,不能只让嗓门大的人说话。那些少数派、边缘群体的声音(比如少数族裔、特定文化背景的人)也要被听到。
- AI 要做:不能只迎合“主流观点”,要能代表少数派的声音,避免偏见。
🎨 第七步:表达得“让人舒服”
- 比喻:就算 AI 知道所有观点,如果它像念经一样把 100 种观点全念给你听,你会疯掉的。它得像个高明的主持人,把复杂的观点整理得清晰、简洁,让你听得懂,又不觉得烦。
- AI 要做:把复杂的主观性用用户喜欢的方式表达出来,既全面又不啰嗦。
🔍 现在的 AI 做得怎么样?(论文发现)
作者们像“阅卷老师”一样,检查了60 篇相关的学术论文,结果发现:
- 做得好的:大部分研究都在努力让 AI 猜对“大多数人的答案”(第四步),或者算算 AI 猜得准不准(用各种数学公式)。
- 做得差的(巨大的空白):
- 分不清“模糊”和“多元”:很多研究没搞清楚,到底是信息不够(模糊),还是大家就是看法不同(多元)。这就像把“没看清路”和“路有两条”混为一谈。
- 忽略了“为什么”:很少研究去解释“为什么”会有分歧。
- 忘了“怎么表达”:几乎没人研究怎么把这些复杂的观点舒服地讲给用户听(第七步)。如果 AI 把用户搞晕了,那它再聪明也没用。
💡 总结与启示
这篇论文的核心思想是:不要试图把人类复杂的想法“压扁”成一个单一的答案。
未来的 AI 不应该只是一个“正确答案生成器”,而应该是一个**“观点的策展人”**。它需要:
- 知道什么时候该问“你确定吗?”(识别模糊)。
- 知道什么时候该说“有人这么想,也有人那么想”(识别多元)。
- 最重要的是,要把这些不同的声音,有礼貌、有逻辑、不让人头疼地讲出来。
这就好比,以前 AI 是**“独裁者”,只告诉你一种真理;现在我们要把它培养成“民主主持人”**,让每一种声音都有机会被听见,同时还能把场面控制得井井有条。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。