← 最新论文
💬 NLP

Fault of Our Stars: Behavioral Drivers of Rating-Sentiment Incongruence

本研究通过分析斯里兰卡旅游评论发现,由于特定的行为模式和上下文因素,星级评分经常与文本情感产生分歧,这表明不应将评分自动视为情感分析的地面真值标签。

原作者: Ramanaish Abaiyan, Ruththiragayan Sutharsan, Kusal Amantha, Anusan Krishnathas, Asma Rauff, Kovindarajah Sriyathurshan, Patalee Narasinghe, Nirasha Munasinghe, Nisansa de Silva, Sandareka Wickramanaya
发布于 2026-06-25
📖 1 分钟阅读☕ 轻松阅读

原作者: Ramanaish Abaiyan, Ruththiragayan Sutharsan, Kusal Amantha, Anusan Krishnathas, Asma Rauff, Kovindarajah Sriyathurshan, Patalee Narasinghe, Nirasha Munasinghe, Nisansa de Silva, Sandareka Wickramanayake

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正在一家餐厅。你在一个流行的 App 上留下了一篇评论。你给出了 4 颗星(满分 5 颗),但在你的文字描述中,你写道:“食物是冷的,服务很慢,我差点闹病。”

这正是这篇论文所研究的准确问题。它在问:当人们在网上写评论时,他们的星级评分真的与他们用言语表达的内容相符吗?

来自斯里兰卡莫拉图瓦大学(University of Moratuwa)的研究人员决定不再仅仅假设星级就能说明全部情况。相反,他们将星级和文字视为两个不同的证人,并检查了这些证词是否一致。

以下是他们研究结果的简单解析:

1. “两头”评论

把每一条在线评论想象成有两个头:

  • 头 A(星级): 一个快速的数值评分(1 到 5 分)。
  • 头 B(文本): 人们书写的实际故事。

通常,我们假设头 A 和头 B 是总是达成共识的好朋友。但这篇论文发现,它们经常是陌生人,甚至是敌人。 在他们研究的评论中,大约有 18.6%(约五分之一)的评论中,星级和文字讲述的是完全不同的故事。

2. 六种“错位人格”

研究人员不仅说“它们不一致”,还发现这些不一致是以六种特定的、可预测的方式发生的。把这些想象成六种不同类型的“困惑评论者”:

  • “保守型评分者”(最常见): 这个人写了一段充满赞美、令人愉悦的故事,但只给了个中规中矩的 3 或 4 星。他们就像一位严厉的老师,虽然很喜欢你的文章,但不会给你打“A”,因为他们希望你继续进步。
  • “义务性 5 星派”(第二常见): 这个人写了一篇充满抱怨的糟糕评论,但仍然给了 5 星。他们就像一位礼貌的邻居,虽然抱怨你的狗很吵,但还是会挥手说:“祝你愉快!”
  • “严苛贬低者”: 他们写了正面的故事,却给了低分。
  • “礼貌抬高者”: 他们写了负面的故事,却给了高分。
  • “沮丧的中立者”: 他们写了负面的故事,但给了中立的(3 星)评分。
  • “积极的中立者”: 他们写了正面的故事,但给了中立的评分。

最大的两个群体(保守型和义务型)占据了所有错位情况的三分之二。这证明了这种不一致并非随机的噪音,而是一种模式。

3. 为什么会发生这种情况?(驱动因素)

研究人员使用了计算机模型(具体来说是一种被称为“Transformer”的 AI 类型,它们就像超级聪明的阅读机器)来找出原因。他们发现了四个主要原因:

  • “博物馆效应”: 有些地方本身就更难进行评价。博物馆的错位率最高。可以这样想:参观博物馆是一个复杂的过程。你可能喜欢艺术品(正面文本),但讨厌拥挤的走廊或昂贵的门票(导致较低的星级评分)。海滩或公园更容易评分,因此星级和文字在这些地方匹配得更好。
  • “专家型”评论者: 那些写了大量评论的人(专家)更有可能成为“保守型评分者”。他们似乎会将 5 星评分留给真正完美的体验,即使他们对一次“不错”的体验仍会写下美好的文字。新手则更有可能对一切都给 5 星。
  • 故事的长度: 较长的评论更有可能出现错位。似乎当人们写得越多时,他们表达的情感就越复杂,以至于简单的 1 到 5 星量表无法捕捉到这些情感。
  • 时间旅行: 在过去的岁月里(从 2010 年到 2023 年),人们在让星级与文字匹配方面做得越来越好了。这种错位现象正在缓慢减少。

4. 对计算机(AI)的重要启示

这是对科技界最重要的部分。

多年来,计算机科学家一直在训练 AI 去理解人类的情感(情感分析),其方法是使用 星级评分作为“真相”。他们会将一条评论喂给 AI,并说:“看,这是一个 5 星评论,所以 AI 必须学习到这段文字意味着‘快乐’。”

这篇论文说:停止这样做。

如果你使用星级作为“真相”来训练你的 AI,你就是在教它向一个骗子学习。因为星级经常撒谎(或者至少,它们讲述的是另一个故事),AI 会学到错误的模式。

类比:
想象你在教一个孩子识别“快乐”的面孔。

  • 旧方法: 你展示一张人在哭泣的照片,但你告诉孩子,“这是快乐的”,因为那个人手里拿着一个 5 星奖杯。孩子就会学到:哭泣 = 快乐。
  • 新方法: 你观察脸部本身(文本)来判断他们是否快乐,并将奖杯(星级)视为另一种独立的、有时并不靠谱的观点。

总结

  • 星级和文字经常不一致。
  • 博物馆和专家型评论者是最大的“罪魁祸首”。
  • 这种不一致遵循特定的模式,而非随机的混乱。
  • 计算机程序在学习理解人类情感时,不应盲目信任星级评分作为“真相”。

论文得出结论:如果我们想要了解人们真正的想法,我们需要倾听他们的文字,而不仅仅是数一数他们的星星。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →