← 最新论文
💬 NLP

FrenchNews-7: Benchmarking Cross-Publisher French News Editorial Desk Classification

本文介绍了 FrenchNews-7,这是一个用于将多个出版商的法语新闻文章分为七个编辑类别的全新基准测试,该研究表明经过微调的 CamemBERT 模型优于零样本大语言模型,并揭示了分类性能在不同类别之间存在显著差异,其中像“经济”和“社会”这样具有歧义的领域正趋于人类一致性的极限。

原作者: Amr Sobhy

发布于 2026-08-20
📖 1 分钟阅读☕ 轻松阅读

原作者: Amr Sobhy

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在现代新闻广阔而嘈杂的版图中,每一篇文章都属于报纸或网站内的一个特定部门。正如图书馆将书籍分类到历史、科学或小说等不同板块一样,新闻机构将故事路由至专门的编辑台:一个团队处理体育,另一个负责政治,第三个则管理国际事务。对于研究不同媒体如何塑造公众舆论的研究人员来说,自动对这些故事进行分类的能力至关重要。否则,比较两份报纸如何报道同一事件将变成一项无法完成的手动任务。然而,挑战在于每家出版商都使用自己独特的标签系统。一个网站可能将一篇故事称为“社会”,而另一个则称其为“国内事务”,即便其内容完全相同。为了构建一个能够适用于整个法国媒体版图的工具,科学家们需要一种方法,将这些不同的内部语言转化为一种单一且共享的理解方式。

一位研究人员现在为这项任务创建了一个名为 FrenchNews-7 的新标准。他们收集了来自 13 家不同法国出版商的近 88,000 篇新闻文章,涵盖了从主要全国性日报到纯数字媒体以及地方报纸的各类媒体。他们的目标是教会计算机识别一篇故事属于哪个编辑台,无论该网站是由谁发布的。为此,他们首先梳理出了这些机构中最常用的七个类别:社会、文化与休闲、国际新闻、国内政治、体育、经济以及科学与技术。随后,他们建立了一个混合标注系统。对于大约 72% 的文章,由于网站地址本身就包含了类别名称(例如以 "/sport" 或 "/politics" 结尾的网页链接),其标签非常直观。对于剩余 28% 地址模糊或缺失的情况,研究人员使用大型语言模型阅读标题和全文,并分配正确的类别。这一过程经过了人类专家和人工智能的双重仔细检查,以确保标签的准确性,从而产生了一个人类评分者之间一致性极高的数据集。

利用这个新数据集,研究人员训练了多个计算机模型来执行这项分类任务。他们测试了仅查看标题的模型与阅读全文的模型。结果显示,阅读全文具有明显的优势,它使计算机能够理解故事的语境,而不仅仅是从标题中进行猜测。表现最好的系统是一个专门针对法语进行训练的模型,它能准确识别约 80% 它从未见过的故事所属的编辑台。即使在针对四个完全不在原始训练组中的新出版商进行测试时,这一表现依然成立。研究发现,虽然体育和文化类故事很容易分类,但关于经济和一般社会的故事则很难进行一致的归类。事实上,当研究人员要求人类专家对这些来自新出版商的困难经济类故事进行分类时,人类之间的意见一致率仅为 55% 左右。这表明,难点并非在于计算机智能的缺陷,而是反映了新闻编辑室在决定如何归档这些复杂故事时本身存在的歧义性。

研究人员还将他们的专用模型与几种并未针对此特定新闻数据进行训练的强大通用人工智能系统进行了对比。即使是面对最先进的通用模型,专门的法国模型表现也更出色,尤其是在棘手的经济和社会类别中。这表明,对于像新闻分类这样特定的高容量任务,经过目标领域实际语言和结构微调的模型,其表现优于通用型工具。研究人员已将其数据集和表现最好的模型向公众开放,允许其他研究人员在此基础上开展工作。通过提供一种可靠的跨出版商分类新闻的方法,这项工作为研究法国媒体如何报道世界提供了新的基础,确保未来的分析是基于对每篇故事归属的一致且准确的理解。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →