← 最新论文
💬 NLP

From Entity Mentions to Tone: An LLM-Based Pipeline for Media Bias Analysis

本文提出了一种基于大语言模型(LLM)的流水线,用于通过将文章按主题分组、标注实体与情感,并比较不同来源的报道模式,来分析在线新闻中的媒体偏见与框架效应,并在一个专门工具受限的阿尔巴尼亚新闻数据集上证明了其有效性。

原作者: Klesti Hoxha, Olti Qirici

发布于 2026-08-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Klesti Hoxha, Olti Qirici

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在现代世界中,我们阅读的新闻很少是以中立的事实流形式呈现的。相反,它们经过了编辑的选择以及决定我们看到什么的算法的过滤。这些过滤器充当了守门人的角色,决定了哪些故事能传达到我们面前,以及它们是如何被构架的。关于一个政治事件的故事,在一个媒体眼中可能是胜利,而在另一个媒体眼中则可能被视为失败,这并不是因为事实发生了变化,而是因为语调和侧重点发生了转移。这种被称为“媒体偏见”的现象很难进行大规模追踪,因为它涉及语言的微妙变化、特定细节的选择,以及赋予不同人物和事件的情感权重。几十年来,理解这些模式需要专家团队逐一阅读并分析文章,这是一个缓慢且昂贵的过程,无法跟上互联网的速度。

研究人员已开始转向人工智能来解决这一问题,希望能够自动检测这些微妙的偏见。然而,对于世界上许多地区来说,一个重大的障碍仍然存在:大多数先进的语言工具都是为英语等主要语言构建的,这使得小语种缺乏可靠的软件来分析它们自己的新闻。在这些地区,由于缺乏专门的工具,即使是基本的问题——例如,哪些新闻来源报道了特定事件,或者不同的媒体如何描述同一个公众人物——都难以得到一致的回答。由于缺乏这些工具,很难看清信息是如何被塑造和传播的全貌。

来自阿尔巴尼亚地拉那大学的一个研究小组开发了一种新方法来弥补这一差距。他们创建了一个系统,利用一个强大的通用语言模型来阅读数千篇以阿尔巴尼亚语编写的文章,而阿尔巴尼亚语是一种专门数字工具极少的语言。该系统不仅仅是阅读文本;它将分析分解为三个不同的层面。首先,它将文章归类为主题和特定事件,以观察正在讲述哪些故事。其次,它识别出在这些故事中提到的个人和组织名称。第三,也是最重要的,它衡量写作的情感语调,确定对一个人或事件的报道是积极的、消极的还是中性的。通过结合这些层面,该流水线不仅可以绘制出新闻来源选择了报道什么,还可以描绘出它如何描述这些故事中的相关人员。

为了测试他们的系统,研究人员收集了 2026 年 4 月发表的来自 124 家不同阿尔巴尼亚新闻来源的 8,358 篇文章。他们将这些文章输入到他们的流水线中,该流水线使用了一个先进语言模型的本地版本来提取必要的数据。目标是观察这种自动化方法是否能在不需要大量预先存在的、由人工标注的示例数据库的情况下,产生可靠的结果。研究人员将他们的系统输出与 GDELT 进行对比,GDELT 是一个同样使用自动化工具来追踪新闻的大型全球数据库。对比结果显示,两个系统之间存在中度的吻合度,这表明新的流水线正朝着与既有方法相似的方向运行。更重要的是,研究人员发现他们的系统识别出了许多 GDELT 系统所遗漏的人物提及。这种捕捉额外名称的能力对于偏见分析至关重要,因为遗漏一位公众人物会扭曲对不同媒体对待该人物方式的理解。

该研究还测试了两套不同的指令(或称为提示词)给语言模型,以观察哪种效果更好。其中一套指令非常严格,要求模型必须进行自我检查,以确保其分配的情感标签与其给出的数值分数相匹配。另一套则更为简单快捷。严格的指令虽然消除了标签与分数之间的不一致性,但也显著减慢了处理速度,并导致系统跳过了近一半的处理文章。简单的指令虽然产生了一些不一致的情况,但允许系统分析更大规模的新闻集并运行得更快。研究人员得出结论,对于旨在持续监测新闻的系统而言,更快速、更广泛的方法更为实用,因为少量的不一致可以通过简单的规则在后期进行清理。

利用该流水线生成的数据,研究人员能够创建关于不同新闻来源运作方式的详细画像。他们发现,一些媒体始终以较为有利的语调来构架话题,而另一些媒体则系统性地表现得更为批判。该系统还可以追踪特定的公众人物,展示同一个人在一家报纸中可能被描述为积极语调,而在另一家媒体中则可能被描述为消极语调。例如,分析显示,对某些政治人物的报道因来源不同而差异巨大,有些媒体提供的几乎全是正面报道,而另一些媒体则主要是批判性的。此外,系统还可以识别“把关”事件——即仅被极少数来源报道、而被大部分媒体景观所忽视的故事。这使得研究人员不仅能看到新闻的语调,还能看到特定故事的影响范围,以及信息在哪里被集中或被拦截。

这项工作证明,在不需要专门的、针对特定语言训练数据的情况下,构建一个用于分析低资源语言媒体偏见的结构化自动化系统是可能的。研究人员强调,他们的工具并非旨在取代人类的判断或专家评审,而是作为一个快速的起点。它将海量的文章转化为可以更容易检查的清晰信号。通过自动化提取姓名、主题和语调的初始过程,该系统减少了人类需要从头开始阅读的内容量。这在持续监测困难且专门语言工具匮乏的环境中尤为有价值。研究人员建议,这种方法提供了一个可复制的蓝图,可以应用于其他语言和地区,从而为可视化新闻是如何被构架的,以及谁在公共对话中被听到,提供了一种方法。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →