想象一下,互联网就像一座繁忙、喧闹的大都市,每个人都在大声疾呼、分享故事和买卖商品。在这座城市里,真理与谎言之间进行着一场持久战。有时,人们因为没有核实事实而无意中传播了错误的故事(这就像一位友好的邻居不小心给了你错误的路线指引)。还有时候,人们为了制造麻烦或牟利而故意散布谎言(这就像一个恶作剧者画了一个假的“道路封闭”标志,仅仅为了看人们绕路的样子)。这座城市还有一个特殊的群体——“事实核查员”——可以把他们想象成这座城市的图书管理员和侦探的结合体。他们的工作就是四处奔走、验证故事,并挂上“已验证”或“虚假”的标牌,让每个人都知道什么是真实的。但棘手之处在于:这座城市规模宏大,故事每秒钟都在变化,而且参与其中的人既有普通民众、大型新闻机构,甚至还有能够自主撰写故事的计算机程序。直到现在,还没有人绘制出一张完整的地图来展示这些玩家是如何互动的,这使得理解整个系统或解决问题变得非常困难。
这篇论文介绍了那张缺失的地图。作者们是一支来自英国和土耳其大学的研究团队,他们创建了第一个关于虚假信息与事实核查生态系统的综合性“图形模型”。你可以把这个模型想象成一张巨大的、交互式的流程图,或者是互联网真相世界的一份族谱。他们并没有仅仅列出谁在做什么,而是使用了一种被称为“增强实体-联系”(EER)模型的特殊绘图风格,来展示不同的参与者是如何连接在一起的。在他们的地图中,“参与者”包括普通人、新闻机构、事实核查团体、政府监管机构,甚至是自动化的计算机机器人。他们还描绘了在这些参与者之间流动的“事物”,比如新闻文章、评论、法律规则和事实核查报告。
研究人员不仅仅是画了线条;他们通过代入现实世界的案例测试了他们的地图。例如,他们模拟了一个场景:一部英国电视节目误将旧的俄罗斯军用飞机画面当作当时正在乌克兰发生的画面进行播放。他们的地图展示了这一错误是如何发生的,来自不同国家的事实核查员是如何发现它的,以及电视台内部审查团队在其中扮演了怎样的角色。他们还模拟了一个场景:一个普通人尝试使用各种应用程序和新闻简报来核实一条可疑的新闻,展示了他们可能使用的复杂工具网络。另一个例子涉及一个实际上在传播宣传内容的“伪事实核查”团体,以及一个真实的事实核查组织如何必须调查并拆穿这些“拆穿者”。
论文指出,该模型是研究人员及任何试图打击虚假信息的人士的一件强大新工具。它有助于他们看到全局,而不仅仅是孤立的部分。例如,该模型揭示了事实核查不仅仅是一个侦探抓捕骗子的单向过程;它是一个复杂的博弈,新闻媒体、监管机构甚至公众都在其中扮演着角色。作者指出,他们的地图包含了以往模型所忽略的内容,比如能够既传播谎言又能核实事实的自动化人工智能代理,以及不同事实核查组织之间复杂的相互关系。通过使用这张地图,他们希望帮助科学家开发更好的计算机工具来检测谎言,帮助政策制定者制定更好的法律,并帮助记者理解问题的全貌。这篇论文并不声称已经解决了假新闻问题,但它提供了一种更清晰的研究方式,表明理解所有这些玩家之间的联系是让这座数字城市变得更安全、更真实的第一步。
问题陈述
虚假信息(包括误导性信息和恶意虚假信息)在网络上的广泛传播已成为数字化和全球化社会面临的关键威胁。尽管关于行为者行为、传播模式和技术检测方法的研究已非常广泛,但作者指出文献中存在一个显著空白:缺乏能够描述虚假信息与事实核查这一复杂生态系统的综合概念模型。现有的模型通常依赖于基于角色的框架(例如 Neumann 等人的研究),这些框架忽视了基于实体的关系,且未能充分捕捉监管机构、自动化代理和 AI 生成内容的角色。因此,需要一个统一的框架来系统地理解不同利益相关者之间的相互联系,包括传统媒体、用户生成内容(UGC)、AI 生成内容以及各类事实核查实体。
研究方法
为了填补这一空白,作者提出了一个基于增强型实体-关系(EER)范式的图形模型。该模型的开发遵循了“本体开发 101”方法论,并进行了调整,旨在构建一个概念性生态系统而非立即构建正式的本体。该过程包含七个阶段:
- 领域确定: 定义研究范围,涵盖传统和数字媒体中的虚假信息生成、消费、验证和监管。
- 复用考虑: 审查现有的语义模型(例如隐私-收益权衡模型)以启发实体结构,尽管并未发现针对该特定领域的直接 EER 模型。
- 术语枚举: 从文献和博弈论视角识别关键术语,并将相似概念(如用户、消费者、记者)合并为统一的类。
- 类层级定义: 建立自底向上的层级结构,其中超类
Actor(行为者)封装了 Person(个人)、Organisation(组织)、Group/Association(群体/协会)、Account(账号)、Automated Agent(自动化代理)和 Service(服务)。
- 属性定义: 为实体分配属性(如
self-claimed fact-checker [自称事实核查者]、automated [自动化的]、role [角色]),以区分实体类型并捕捉上下文。
- 方面定义: 定义关系的约束和基数。
- 实例创建: 通过构建特定现实场景的实例来验证模型。
最终生成的模型被形式化为一个有向图 G=(V,E),其中节点代表实体类型,边代表语义关系(例如 Publishes [发布]、Fact-checks [事实核查]、Regulates [监管])。
核心贡献
本文的主要贡献是引入了第一个关于虚假信息与事实核查生态系统的综合图形模型。其核心特征包括:
- 实体覆盖: 该模型定义了 21 种不同的实体类型,包括
Media Outlet(媒体机构)、Fact-checking Outlet(事实核查机构)、Regulatory Body(监管机构)、Automated Agent(自动化代理)和 Legal & Regulatory Document(法律与监管文件)的具体子类。它明确考虑了 AI 生成的内容和自动化代理,这些领域在生态系统层面的研究中经常被忽视。
- 关系建模: 它映射了复杂的语义关系,例如
Automated Agents 如何自主生成或核查信息,以及 Regulatory Bodies 如何实施由 Lawmaking Bodies 发布的法律。
- 统一框架: 通过使用标准的 EER 表示法,该模型促进了计算应用的发展,并允许对不同研究和场景进行系统性的比较。
结果与应用
论文通过两个主要应用展示了所提模型的效用:
模拟现实场景: 作者将该模型应用于七个不同的场景,揭示了在原始数据中无法直接观察到的见解:
- BBC Breakfast 事件: 追踪了一个被误认视频片段的时间线,展示了多个事实核查机构(Full Fact, Maldita)及媒体机构本身是如何互动的,并强调了内部审核机制的失效。
- 事实核查服务:* 绘制了普通人可获取的资源生态系统,包括档案库、时事通讯(IFCN)和应用程序(Logically),阐明了独立验证的复杂性。
- 英国媒体监管: 可视化了自愿监管中的利益冲突,展示了资金结构(例如 RFC 支持 IPSO)如何产生依赖关系,从而导致某些机构(如《卫报》)转向自我监管。
- 美国记者协会: 映射了记者、自由职业者与公民记者及其各自伦理准则和协会(SPJ, RTDNA, IRE)之间的关系。
- 特朗普推特禁令: 模拟了禁令实施前缺乏事实核查机制的情况,以及随后社区审核机制(Birdwatch)的实施。
- 多媒体事实核查: 展示了涉及反向图像搜索、地理定位和用于验证多媒体内容的 AI 代理的工作流。
- 事实核查“事实核查者”: 模拟了一个经过验证的机构(PolitiFact)拆穿一个亲俄“事实核查”服务的事件,证明了该模型区分合法实体与宣传驱动型实体的能力。
文献综述分析: 该模型被用于系统性地分类 2023 年发表的 10 篇同行评审文章。通过根据实体-关系对(例如 UserConsumesInformation [用户消费信息]、RegulatorRegulatesService [监管者监管服务])生成标签,作者发现当前研究过度集中于用户-信息动态和信息生成,而事实核查机制和监管方面的研究则相对较少。这种分析揭示了潜在的研究空白,特别是关于数字生态系统的监管以及数字工具滥用的问题。
意义
本文声称,该 EER 模型可作为未来形式化模型和计算本体的基础抽象。其意义在于能够:
- 提供一套系统性的词汇和结构,供研究人员和从业者描述该生态系统。
- 为构建事实核查报告和检测未来事件的知识图谱提供便利。
- 通过系统性的标签化,实现对不同研究和场景的比较。
- 通过识别相关利益相关者,支持实证研究的设计。
- 为基于智能体的模拟以及应用博弈论来研究行为者(如监管者、媒体、事实核查者)之间的策略性互动提供基础。
作者总结道,虽然该模型是一个概念性的阶梯,但它提供了一个必要的工具,旨在推动研究从碎片化的研究转向对虚假信息与事实核查生态系统的整体理解。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。