Creation of the Estonian Subjectivity Dataset: Assessing the Degree of Subjectivity on a Scale
本文介绍了一个新的爱沙尼亚语文档级主观性数据集,其中包含 1,000 篇由人类标注者按连续尺度评分的文本,同时也评估了使用 GPT-5 进行自动化主观性评分与人类判断相比的可行性与局限性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图测量一碗汤里有多少“风味”。有些碗里只是白开水(完全客观的事实),而另一些则加入了大量的香料、草药和厨师的个人见解(完全主观)。长期以来,计算机和语言处理(自然语言处理)领域的研究人员只能问:“这碗汤是辣的吗?”(是/否)。
这篇论文介绍了一套全新的、更精确的量杯,专门用于测量爱沙尼亚语。研究人员不再使用简单的“是或否”,而是创建了一个数据集,通过 0 到 100 的滑动刻度来对 1,000 篇不同的爱沙尼亚语文本进行评分。0 分代表纯粹、不加修饰的事实(就像天气预报),而 100 分则是纯粹的个人观点(就像是对一部烂片的吐槽)。
以下是他们如何构建这个数据集以及他们发现了什么的简要说明:
1. 配方:构建数据集
团队想要看看人类是否能在这些“风味得分”上达成一致。
- 原料: 他们收集了 1,000 篇文本。其中 300 篇是来自互联网的新闻和评论文章,另外 700 篇是随机的网络文本(如博客、论坛、食谱和广告)。
- 品鉴者: 他们雇佣了人类“品鉴者”(标注员)来阅读这些文本,并给出 0 到 100 之间的分数。
- 试运行: 在处理全部 1,000 篇文本之前,他们先在仅有的 60 篇文本上测试了该方法。效果很好!品鉴者理解这个刻度,并且能够分辨出干巴巴的新闻报道与充满“辛辣味”的观点文章之间的区别。
2. 品鉴测试:人类并不总是达成共识
当团队要求三个人分别对这 1,000 篇文本进行评分时,结果显得有些混乱。
- “主观性”问题: 就像人们对辣度的耐受程度不同一样,人们对于什么才算“主观”也有不同的看法。一个人可能认为带有引言的新闻报道是中立的,而另一个人则认为那个引言让文章变得有偏见。
- 相关性: 人类之间的共识程度是“中等”的。虽然不算糟糕,但也不完美。有时,一个人给出的分数是 10(非常客观),而另一个人给出的分数却是 90(非常主观)。
- 重新品鉴: 为了解决这个问题,他们挑选了人类分歧最大的 250 篇文本,并请两名品鉴者再次进行评分。这一次,一致性大大提高了。事实证明,阅读文本的顺序很重要。如果他们连续读了一堆愤怒的吐槽,他们会对下一个文本变得过度敏感,从而过度强调其客观性。这就像如果你吃了一个超级酸的柠檬,接下来的水果尝起来就会比实际情况更甜。
3. 机器人品鉴员:迎来 GPT-5
研究人员提出了一个问题:“一个超级聪明的计算机(一个名为 GPT-5 的人工智能)能否做得像人类一样好?”
- 实验: 他们让 AI 对所有 1,000 篇文本进行评分。
- 结果: AI 的表现出奇地一致。如果你要求它对同一批文本进行三次评分,它给出的答案几乎每次都一样(不像人类,人类的评分会受到情绪和语境的影响而改变)。
- 差异: 然而,AI 和人类并不总是能达成共见。
- 引言: 当一篇新闻文章引用了别人的话时,人类能理解这是作者在“报道事实”。但 AI 看到引言后,会认为:“嘿,这个人正在表达观点!”因此它给了该文本更高的主观性分数。
- 俚语: 人类喜欢给使用俚语或论坛用语的文本打高分,因为这感觉更具个人色彩且富有情感。而 AI 则更关注俚语中的“事实”,因此给出了更低、更“客观”的分数。
4. 最终结论
论文得出结论如下:
- 数据集是真实的: 他们成功创建了第一个能够在细粒度刻度(0–100)上衡量主观性的爱沙尼亚语数据集,而不是仅仅停留在“是/否”的层面。
- 人类是有缺陷但真实的人: 人类可以使用这个刻度,但他们的评分会受到之前阅读内容的以及自身个人观点的影响。
- AI 是助手,而非替代品: AI(GPT-5)在一致性和速度方面表现出色,但它对文本的“品鉴”方式与人类不同。它会错过人类所能捕捉到的语气和语境中的细微差别。
简而言之: 你可以使用 AI 快速获得文本主观程度的一个大致印象,但如果你需要理解文字背后的“人类情感”,你仍然需要人类来进行品鉴。AI 和人类就像是两位使用相同食材、但遵循略微不同的配方的厨师。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。