← 最新论文
💬 NLP

Robust Fake News Detection using Large Language Models under Adversarial Sentiment Attacks

本文介绍了 AdSent,这是一个鲁棒的虚假新闻检测框架,它通过提出使用大语言模型进行受控的情感攻击,以及一种新型的情感无关训练策略以确保一致的真实性预测,解决了当前模型在对抗性情感操纵下的脆弱性问题。

原作者: Sahar Tahmasebi, Eric Müller-Budack, Ralph Ewerth

发布于 2026-01-22
📖 1 分钟阅读☕ 轻松阅读

原作者: Sahar Tahmasebi, Eric Müller-Budack, Ralph Ewerth

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你是一名在图书馆门口值守的保安。你的职责是识别并拦截“假书”(假新闻),同时让“真书”(真实新闻)通过。长期以来,你一直接受关于观察写作**语调(tone)**的训练。你学到了一个简单的规则:“真实新闻通常是冷静且中立的,就像天气预报一样;而假新闻通常是吵闹、愤怒或过度兴奋的,就像一场激烈的争吵。”

这篇题为**《利用大语言模型应对对抗性情感攻击的鲁棒假新闻检测》**的论文,揭示了坏人用来愚弄你的一个聪明诡计,并据此构建了一个更聪明的保安来阻止他们。

以下是他们发现的问题以及如何修复它的故事:

1. 大规模“语调转换”诡计

研究人员发现,坏人(对抗者)正在使用强大的人工智能工具(称为大语言模型或 LLM)来玩一场“语调转换”的游戏。

  • 场景: 想象一篇关于某位政治家的假新闻。最初,它以一种非常愤怒、负面的语调编写,旨在激怒人们。你旧有的保安看到了这种愤怒,心想:“啊,这是假的!”然后将其拦截。
  • 攻击: 坏人使用 AI 重写了故事。他们保持每一个事实完全不变,但改变了措辞,使故事听起来变得快乐、积极或完全中立。
  • 结果: 这个故事仍然是假的,但现在它听起来冷静且理智。你旧有的保安感到困惑了。因为这个故事不再“愤怒”,保安心想:“哦,它听起来很中立,所以一定是真的!”于是让这本假书通过了。

论文将这种现象称为**“对抗性情感攻击(Adversarial Sentiment Attack)”**。这就像是一只披着羊皮的狼,它不是改变了自己的形状,而是改变了声音。

2. 重大发现:我们错了——关于“中立”

研究人员测试了许多不同的“保安”(假新闻检测器),以观察它们如何应对这种诡计。他们发现了两个令人震惊的事实:

  1. 全都被骗了: 他们测试的几乎每一个检测器在语调改变时都表现得一败涂地。它们的准确率显著下降。
  2. 偏见: 这些检测器存在一种隐藏的偏见。它们太习惯于认为“愤怒 = 假”,“冷静 = 真”,以至于当它们看到一个中立的故事时,几乎会自动认为它是真实的。
    • 类比: 这就像一位法官,他假设任何穿着西装的人都是无辜的。当罪犯穿上西装时,法官就会放行。研究人员发现,当假新闻被改写成中立语调时,是最难被检测器捕捉到的。

3. 解决方案:“AdSent”(语调盲视保安)

为了解决这个问题,作者构建了一个名为 AdSent 的新系统。他们没有训练保安去观察语调,而是训练保安实现**“语调盲视(tone-blind)”**。

他们是如何构建 AdSent 的:

  • 第一步:造假者: 他们使用 AI 将数千篇新闻文章(包括真实的和虚假的)全部重写为中立语调。他们剥离了愤怒、兴奋和悲伤,只留下了最基本的事实。
  • 第二步:训练: 他们教导新的检测器(AdSent)去观察这些“中立化”后的故事,并判断其真实或虚假。
  • 目标: 通过在中立故事上进行训练,检测器学会了忽略文字中的“感觉”,而完全专注于“事实”。它学会了即使是以冷静的语调书写,也可以是谎言。

4. 结果:更强悍的保安

当他们测试这个新的“语调盲视”保安时:

  • 它不会被愚弄: 即使坏人试图通过改变假新闻的语调来欺骗系统,AdSent 依然能抓住它们。
  • 它比专家更出色: 它在准确性和抵抗这些诡计的能力方面,都击败了之前的最佳方法(例如一个名为“SheepDog”的系统)。
  • 它适用于新内容: 即使是在它从未见过的不同主题或不同网站的新闻上进行测试,它依然表现稳健。

总结

这篇论文既是一个警告,也是一个解决方案。

  • 警告: 现有的假新闻检测器太容易被改变情感语调的故事所欺骗。如果你让一个谎言听起来很冷静,检测器就会认为它是真的。
  • 解决方案: 我们需要不关心情感的检测器。通过训练 AI 去忽略文本的“情绪”并只关注事实,我们可以构建出一个即使在坏人试图用礼貌的声音伪装时,也能捕捉到假新闻的系统。

作者们称他们的系统为 AdSent,并且已经公开了他们的代码和数据,供他人使用和改进。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →