← 最新论文
💻 computer science

Reliable News or Propagandist News? A Neurosymbolic Model Using Genre, Topic, and Persuasion Techniques to Improve Robustness in Classification

该论文提出了一种结合非上下文文本嵌入与体裁、主题及说服技巧等符号概念特征的神经符号模型,旨在通过增强特征维度来提升识别伪装成可靠新闻的煽动性内容时的分类鲁棒性与泛化能力。

原作者: Géraud Faye, Benjamin Icard, Morgane Casanova, Guillaume Gadek, Guillaume Gravier, Wassila Ouerdane, Céline Hudelot, Sylvain Gatepaille, Paul Égré

发布于 2026-04-03
📖 1 分钟阅读☕ 轻松阅读

原作者: Géraud Faye, Benjamin Icard, Morgane Casanova, Guillaume Gadek, Guillaume Gravier, Wassila Ouerdane, Céline Hudelot, Sylvain Gatepaille, Paul Égré

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文就像是在教我们如何练就一双“火眼金睛”,用来在信息的海洋里分辨哪些是真实的新闻报道,哪些是披着新闻外衣的“宣传 propaganda"

想象一下,你正在逛一个巨大的集市(互联网),里面有人在卖真正的苹果(可靠新闻),也有人在卖涂了鲜艳油漆的假苹果(宣传新闻)。假苹果看起来和真的一模一样,甚至更诱人,但吃下去对身体有害。

1. 问题:为什么以前的“鉴别器”会失灵?

以前的鉴别方法(比如基于大型语言模型 BERT 的 AI)就像是一个死记硬背的学生

  • 如果老师(训练数据)只给它看“红苹果”和“青苹果”,它就能分得很准。
  • 但一旦老师换了一批“黄苹果”或者“塑料苹果”,这个学生就懵了。因为它只是记住了苹果的颜色和形状(文本的表层特征),而没有理解苹果的本质。
  • 结果:它在熟悉的考题上能拿 99 分,但换个新环境(新的新闻来源、新的政治话题)就彻底挂科了。这就是论文里说的“过拟合”(Overfitting)。

2. 解决方案:神经符号模型(Neurosymbolic Model)

作者提出了一种**“老中医 + 高科技”**的混合疗法,也就是“神经符号模型”。

  • 神经部分(AI 的大脑):使用 fastText 技术。这就像是一个经验丰富的老中医,他能快速扫一眼文章,凭直觉感受到文章的“味道”和“语感”。但这部分比较模糊,只负责大概的感觉。
  • 符号部分(专家的逻辑):这是论文的核心创新。作者给 AI 装上了三个**“逻辑放大镜”**,强迫它去检查文章的三个具体特征:
    1. 体裁(Genre):这到底是一篇客观报道(像新闻联播),还是一篇观点文章(像社论),或者是讽刺文章(像小品)?
      • 比喻:宣传新闻喜欢把“观点”伪装成“报道”,就像把“个人吐槽”包装成“官方通报”。
    2. 话题(Topic):文章在讲什么?(比如是讲战争、经济还是体育?)
      • 比喻:虽然真假新闻可能都讲同一个话题,但它们的侧重点不同。
    3. 说服技巧(Persuasion Techniques):这是最关键的!文章里有没有使用煽动情绪重复口号夸大其词或者利用偏见的套路?
      • 比喻:就像推销员在推销假药时,不会只说“这药好”,而是会说“隔壁老王吃了都好了”(诉诸偏见)、“全世界都在用”(重复)或者“不吃就会后悔一辈子”(恐吓)。

3. 实验过程:给 AI 出“偏题”

为了测试这个新模型是否真的“抗造”,作者没有像往常一样随机出题,而是故意给 AI 出了**“偏题”**:

  • 随机题:随便抽几篇文章(常规考试)。
  • 新来源题:训练时看 A 媒体的文章,考试时看 B 媒体的文章(换老师出题)。
  • 新立场题:训练时看左派媒体的文章,考试时看右派媒体的文章(换政治立场)。
  • 可信度题:训练时看高信誉媒体,考试时看低信誉媒体(换考场环境)。

4. 结果:混合模型赢了

  • 纯 AI 模型(Text Only):在“随机题”上表现不错,但一遇到“新来源”或“新立场”的偏题,就直接崩盘(F1 分数跌到 0),因为它只记住了旧文章的“长相”,没学会识别“套路”。
  • 混合模型(Hybrid):在“随机题”上表现平平,但在所有“偏题”中都表现优异
    • 为什么? 因为它学会了**“透过现象看本质”。当它遇到从未见过的新闻来源时,它不再纠结于具体的词汇,而是检查:“这篇文章是不是在疯狂煽动情绪?”、“它是不是把观点包装成了事实?”。只要抓住了这些逻辑特征**,无论文章来自哪里,它都能识破伪装。

5. 总结与启示

这篇论文告诉我们:

  • 光靠“读得多”不够,还得“想得深”。单纯依靠 AI 阅读海量文本,容易让它变成死记硬背的机器。
  • 引入“人类常识”很重要。把“体裁”、“话题”和“修辞手法”这些人类专家总结出来的规则(符号特征)教给 AI,能让它在面对新情况时更稳健。
  • 未来的方向:这种“老中医 + 高科技”的模式,不仅能用来识别假新闻,还能让我们明白AI 到底是怎么判断的(可解释性),而不是把它当成一个黑盒子。

一句话总结
以前的 AI 是背题机器,换个题就不会了;现在的 AI 是学会了识别套路的小侦探,不管骗子怎么换马甲(新来源、新话题),只要它还在用那些煽动性的“老套路”,就能被一眼识破。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →