Beyond speculation: Measuring the growing presence of LLM-generated texts in multilingual disinformation
本研究提供了在 ChatGPT 发布后,现实世界多语言虚假信息数据集中大语言模型生成内容日益增多的首个实证证据,通过记录不同语言、平台和时期的特定模式,以弥合关于这一威胁实际规模的学术争论。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
大局观:这支“机器人笔”是在编造谎言吗?
想象一下,这样一个世界:任何人都可以拿起一支超级聪明、能瞬间写作的笔(即大语言模型,或称 LLM),它可以编写任何语言的故事、新闻和帖子。自从 ChatGPT 等工具发布以来,人们一直很担心:这支笔是否正被用来编写假新闻和谎言(虚假信息)?
长期以来,专家们一直在循环论证。有人说:“别担心,互联网太混乱了,机器人无法掌控全局。”也有人说:“要小心,有些隐秘的角落里,机器人已经在捣乱了。”
这篇论文是第一篇真正去统计现实世界中到底有多少这类“机器人编写”的谎言的研究。他们没有仅仅靠猜测,而是深入到了经过事实核查的新闻和社交媒体数字档案中,寻找证据。
侦探工具:他们是如何发现机器人的
研究人员构建了两个“数字测谎仪”。你可以把它们想象成俱乐部里的两名不同的保安:
- 保安 A (Gemma_GenAI): 基于通用模式进行训练,旨在识别机器人写作。
- 保安 B (Gemma_MultiDomain): 专门针对社交媒体和新闻进行训练,以识别机器人写作。
他们通过已知的“人类 vs 机器人”写作列表对这些保安进行了测试,以确保他们能够胜任工作。他们发现,当两名保安都认定一段文本是由机器人编写时,他们的准确率高达 93% 到 99%。
一旦信任了这些保安,他们便派他们去巡逻四个不同的“社区”(数据集),包括经过事实核查的说法、选举推文以及与战争相关的相关新闻。
他们的发现:机器人入侵是真实的(但并不均匀)
研究发现,机器人编写的虚假信息确实存在,但这并不是一场洪水,更像是一个正在扩大的缓慢渗漏。
1. “ChatGPT 前后”效应
想象一条时间线。在 2022 年底(ChatGPT 开始流行)之前,机器人编写的谎言数量非常低。
- 类比: 这就像一个平静的池塘。在 2021 年,只有极少数(约 1%)由机器人制造的微小涟漪。
- 变化: 到 2023 年,随着 ChatGPT 的到来,涟漪变大了。研究发现,在 2023 年,其数据集中经过事实核查的谎言中,有 1.5% 到 15% 可能是由机器人编写或编辑的。最确定的估计值约为 1.85%。
- 趋势: 机器人编写的谎言数量每年都在上升。
2. “针对性”攻击
机器人编写谎言的方式在不同语言或不同平台上并不均衡。这就像一个只针对特定房屋行窃的窃贼。
- 语言: 虽然英语和西班牙语因为使用人数多而拥有最多的机器人谎言,但谎言的比例在波兰语 (4.7%) 和 法语 (4.2%) 中最高。
- 平台: 机器人在 Instagram (1.5%) 和 Facebook (1.3%) 上最为活跃,而在 Twitter/X 上活跃度较低 (0.64%)。
- 特定事件: 在 2024 年美国大选期间,推文中机器人编写的内容量从 1 月到 11 月翻了一番,并在选举前夕达到顶峰。
3. “假新闻”数据集
研究人员还查看了专门标记为“假新闻”的数据集。
- 他们发现,在被标记为“假”的文章中,有 2.6% 到 3.3% 实际上是由机器人编写的。
- 在一个关于加沙战争的数据集中,他们发现超过 10% 的法语帖子是机器人生成的,而其他语言的比例则低得多。
为什么这很重要
论文得出结论:机器人编写谎言的担忧不仅仅是推测;它正在发生。
- “坏消息”: 机器人正被用于制造虚假信息,而且它们正变得越来越聪明。这种情况发生在特定的语言和特定的时期(如选举期间),这表明有人正在有策略地使用它们。
- “好消息”: 机器人谎言在整个互联网中所占的比例仍然很小(2024 年约为 2%)。然而,由于互联网规模巨大,即使是 2% 也是大量的虚假内容。
- 警告: 随着机器人变得越来越聪明,它们可能会开始“污染”水源。如果未来的 AI 模型是在已经包含机器人编写谎言的数据上进行训练,那么这些新模型可能会开始相信这些谎言是真的,并更快地传播它们。
核心结论
作者们是在说:“停止猜测,开始测量。” 我们现在有了证据,证明机器人在现实世界中编写谎言,尤其是在波兰语、法语以及选举季节。我们需要更好的工具来捕捉它们,也需要更好的系统来告诉我们何时正在阅读机器人的故事,以免被愚弄。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。