✨ 要点🔬 技术摘要
把社交媒体想象成一个巨大的、混乱的城镇广场,数以百万计的人每秒钟都在大声喊出自己的想法。有时,人们会喊出谎言、谣言或令人困惑的故事。在过去,一小群“城镇守卫”(专家)或一个“机器人扫描仪”(人工智能)试图倾听所有人的声音并标记那些糟糕的内容。但由于喊叫的人太多,守卫们无法跟上节奏,而机器人扫描仪也经常出错,因为它是在有偏见的数据上训练出来的。
为了解决这个问题,X(前身为 Twitter)推出了一项新理念,叫做 社区附注 (Community Notes,原名“Birdwatch”)。你可以把它想象成一个邻里守望计划 ,邀请普通公民来协助监管这个广场。
以下是这篇论文告诉我们的关于这个邻里守望计划在最初四年(2021–2025年)中运作情况的内容:
1. 设定:守望是如何运作的
在这个系统中,任何成为“合格公民”满六个月的人都可以成为“贡献者”(Contributor)。
工作内容: 如果你看到一条似乎具有误导性的帖子,你可以撰写一条“附注”(Note)来补充缺失的背景或事实。
投票: 其他贡献者会阅读你的附注,并投票决定它是“有帮助的”、“部分有帮助”还是“无帮助”。
规则: 只有当来自不同 政治立场的人都认为该附注有帮助时,这条附注才会向公众展示。这就像一座桥梁;如果只有河流一侧的人认为桥梁安全,这座桥就不会被建成。目标是寻找所有人都能达成共识的真相。
2. 谁在做这项工作?(“超级贡献者”)
研究发现,这项工作并没有被平等地分担。这就像一个社区,极少数敬业的志愿者承担了几乎所有的清扫和垃圾收集工作。
主力军: 极少数人撰写了绝大部分的附注。一个人(看起来像是一个机器人)撰写了超过 33,000 条附注,主要关于加密货币诈骗。
评分差距: 同样地,一小部分人承担了几乎所有的投票工作。
结果: 由于参与重活的人太少,许多需要附注的帖子从未获得附注,或者它们获得的附注从未获得足够的投票来展示。
3. 他们在讨论什么?(主题)
“城镇广场”很嘈杂,但志愿者们专注于特定类型的噪音:
政治至上: 最大份额的工作(约 30–45%)是关于政治和政府的。
健康: 在早期,出现了关于疫苗和大流行病的大规模附注浪潮。
战争与加密货币: 随着时间的推演,更多关于战争(如乌克兰和加沙)以及加密货币诈骗的附注出现了。
“NNN”现象: 有时,志愿者会写一条“无需附注”(Note Not Needed, NNN)的附注。这就像一个邻居在说:“嘿,那个故事其实不是谎言,别试图去纠正它!”论文指出,这已经变成了一种辩论“是否需要纠正”的方式,而不仅仅是纠正“什么东西”是错误的。
4. 语言障碍
尽管该系统是全球性的,但“邻里”之间大多是相互独立的。
一种语言,一个群体: 大多数人只使用一种语言。即使有人会五种语言,他们在撰写附注时通常也只坚持使用其中一种。
英语主导: 英语是这个城镇广场的主要语言。研究人员将深度分析集中在英文附注上,因为那里是活动最频繁的地方。
5. 速度问题:“太少且太晚”的问题
这是最关键的发现。该系统很慢。
等待时间: 一条附注从被撰写到向公众展示,平均需要 26 小时 。
错失窗口: 当一条“有帮助”的附注终于出现时,谎言通常已经传遍了世界。论文指出,到附注发布时,该帖子已经触达了 80% 的受众。
成功率: 在每 100 个被提议添加附注的帖子中,大约只有 13 个最终获得了向公众展示的“有帮助”的附注。大多数附注都卡在候补室里,从未获得足够的多元化投票来通过。
6. 他们从哪里获取事实?
在撰写附注时,贡献者被鼓励带来证据。
来源: 大多数附注都包含一个来源链接。
最爱: 最受欢迎的来源是维基百科(Wikipedia)、YouTube 和 X 本身。
偏见检查: 研究人员检查了所用网站的政治偏见。令人惊讶的是,大多数顶级来源被认为是“中立”的,尽管略微向左倾斜。然而,论文发现了一个可疑案例:一名用户不断链接到一个特定的杀毒软件网站以进行加密货币诈骗,这表明一些“志愿者”可能是为了推动特定议程的自动化机器人。
总结
社区附注是一场关于让群众进行自我监管的大胆实验。它成功建立了一个庞大的背景与事实库。然而,论文得出结论,该系统存在瓶颈 。
它过度依赖于少数超级志愿者。
它太慢了,无法在谎言传播之前将其阻止。
它难以在新闻周期结束之前,获得足够多不同背景的人对一条附注达成共识。
作者们已经发布了所有的相关数据和代码(就像交出了邻里守望计划的蓝图),以便其他研究人员可以研究如何让这个系统在未来变得更快、更公平。
技术摘要:从 Birdwatch 到 Community Notes,从 Twitter 到 X
问题陈述
社交媒体平台上用户生成内容的快速激增(通常缺乏编辑监督)增加了接触虚假和误导性信息的风险。传统的内容审核策略——依赖专家评估或自动化系统——在成本、可扩展性和缓解系统性偏差方面面临显著局限。虽然基于社区的审核已成为一种极具前景的替代方案,但迫切需要对大规模倡议(如 X 的 Community Notes,前身为 Birdwatch)的底层动态、有效性和运行特性进行实证评估。具体而言,本研究旨在刻画该系统在大规模运作下的功能特征,解决有关贡献者注意力分布、共识达成效率、语言多样性、溯源实践以及主题覆盖时间动态等问题。
研究方法
本研究对 Community Notes 在其前四年(2021 年 1 月 23 日 – 2025 年 1 月 23 日)期间的情况进行了描述性、观察性的调查。研究依赖于一个从 X 公开发布的 TSV 文件中提取的全面且经过整理的数据集。
数据收集与处理:
数据集范围: 作者解析了涵盖完整四年的 Notes 和评分数据。最终数据集包括由 227,702 名独特贡献者撰写的 1,614,743 条 Notes,以及 1,016,673 个不同的帖子(Posts)。
语言检测: 应用预训练的 FastText 语言识别模型对所有 Notes 进行语言多样性检测。
URL 与域名提取: 针对英语 Notes,使用基于正则表达式的脚本提取嵌入的 URL。隔离根域名,并针对品牌重塑(例如从 Twitter 到 X)及地域变体进行归一化处理,同时利用 Ad Fontes Media 2023 年的评级对其政治倾向进行分类。
主题建模: 采用了两阶段自动化分类流水线。首先通过 GPT-4.1-mini 对 10% 的英语 Notes 进行分层随机采样以诱导主题标签,随后通过迭代式人工精炼构建了包含 42 个类别(分为通用类和主题类)的最终分类法。
网络构建: 构建了每月交互网络,其中节点代表贡献者,有向边代表评分(有帮助、部分有帮助或无帮助),边权重对应评分数量。
分析方法: 研究采用了描述性统计、秩图分析(对数-对数尺度)以检查分布偏斜度,以及网络可视化(使用 Louvain 算法)来分析社区结构。由于英语在数据集中占据主导地位,分析主要集中在英语内容,尽管语言检测是全球范围进行的。
关键结果
1. 贡献者活动与分布:
高度偏斜的参与度: 活动分布并不均匀。极少数贡献者负责了绝大部分的 Notes 和评分。一个看似自动化的账号撰写了 33,186 条 Notes,主要用于标记 NFT 和加密货币诈骗。
内容集中的现象: 同样,一小部分帖子吸引了不成比例的关注。被标注最多的帖子(一条关于唐纳德·特朗普入狱照的帖子)收到了 90 条 Notes,但没有一条达到“有帮助”状态。
低发布率: 在至少有一条拟定 Note 的帖子中,仅有 13.55% 获得了“有帮助”的 Note。在整个数据集中,87.7% 的 Notes 仍处于“需要更多评分”类别,仅有 8.3% 达到了“有帮助”状态。
2. 语言与溯源特征:
语言细分: Notes 涵盖了 103 种语言。然而,贡献者的活动呈现出明显的分割特征;仅约 16% 的作者使用两种或多种语言,即使是多语言贡献者通常也将其产出集中在一种主导语言中。
来源依赖: 79.6% 的英语 Notes 包含至少一个 URL。最常引用的域名是众包平台(X、Wikipedia、YouTube),且主要被归类为政治中立。研究注意到一个特定异常:一名贡献者在与加密货币相关的 Notes 中排他性地引用了 web3antivirus.io。
3. 主题动态:
主导主题: “政治与治理”持续占据主导地位,占每月活动的 30–45%。“健康与医学”在 2021–2022 年间较为突出(受 COVID-19 讨论驱动),但随后有所下降。“战争与武装冲突”自 2023 年底以来显著增加,这与以色列-加沙冲突及乌克兰战争相吻合。
时间偏移: Note 撰写活动的构成动态反映了现实世界的实时新闻周期。
4. 网络与交互:
极化集群: 交互网络显示,贡献者根据共同的政治意识形态形成了集群。特别是“无帮助”的评分网络,凸显了强化这些分歧的负面交互。
延迟影响: 一条 Note 达到“有帮助”状态的平均延迟为 26 小时。这种延迟往往超过了许多帖子的峰值可见期,可能限制了干预措施的有效性。
核心贡献
描述性调查: 本论文提供了对 Community Notes 首个全面的四年描述性分析,刻画了其语言多样性、溯源实践、贡献者活动及交互网络。
开放数据发布: 作者发布了一个经过整理的数据集,包含英语 Notes 的 Note ID、检测到的语言、提取的主题、引用的链接及域名。
网络数据: 发布了基于三种评分类型(有帮助、部分有帮助、无帮助)的每月交互网络。
可复现代码: 发布了配套的源代码以支持未来的研究,允许对数据集和分析流水线进行复现、扩展或改编。
文献综述: 论文包含了对先前 Community Notes 研究的综述,将当前工作置于基于社区的内容审核更广泛的背景之下。
意义与局限性
本文旨在成为推进 Community Notes 及基于社区内容审核研究的基础资源。通过记录其运行现实——特别是活动的集中性、低共识率以及发布延迟——为理解基于志愿者的治理的可扩展性和极限提供了基准。
作者明确指出了若干局限性:
数据完整性: 数据集反映了截至 2025 年 4 月 7 日的公开存档,不包括在此日期之前删除的帖子或 Note。
分析范围: 虽然语言检测是全球性的,但详细的主题建模和网络构建仅限于英语 Notes。
因果关系: 作为一项观察性研究,分析描述了相关性和模式,但并未建立观察到的延迟或极化现象的因果机制。
研究结论认为,虽然 Community Notes 为传统审核提供了一种可扩展的替代方案,但其有效性受到注意力分布不均、政治极化以及显著发布延迟的制约。所发布的资源旨在促进针对这些挑战的进一步描述性和解释性研究。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。