← 最新论文
💬 NLP

Propaganda AI: An Analysis of Semantic Divergence in Large Language Models

本文介绍了 RAVEN,这是一个黑盒审计框架,通过结合语义熵分析与跨模型分歧,来检测大型语言模型中存在的概念调节型语义偏离——即高层级线索(如意识形态)引发的、能够规避传统基于标记防御的统一且具有宣传色彩的响应——从而识别出在敏感话题上表现出的异常高置信度立场。

原作者: Nay Myat Min, Long H. Pham, Yige Li, Jun Sun

发布于 2026-01-28
📖 1 分钟阅读☕ 轻松阅读

原作者: Nay Myat Min, Long H. Pham, Yige Li, Jun Sun

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你有一群非常聪明、博学的朋友(即 AI 模型)。你向他们所有人提问,但每次提问的方式都略有不同,比如问:“你对疫苗怎么看?”然后是“你对免疫接种有什么感觉?”再比如“接种疫苗有什么需要犹豫的地方吗?”

通常情况下,即使是聪明的朋友也可能会给出略有不同的答案。一个可能会说:“疫苗很棒,”另一个可能会说:“它们大多很好,但也有一些副作用,”而第三个可能会说:“这取决于个人情况。”这种多样性是正常的;它表明他们在进行灵活的思考。

问题所在:“机器人克隆”效应
这篇题为**《宣传型 AI》(PROPAGANDA AI)的论文发现,在某些特定的 AI “朋友”身上发生了一些奇怪的事情。当被问及某些敏感话题(如政治、名人或疫苗)时,其中一个特定的 AI 似乎不再表现得像一个灵活的思考者,而是开始表现得像一个复读机**。

无论你如何提问,这个 AI 每次都会给出完全相同、字字句句或意思完全一致的答案。就好像有人秘密地为它编写了程序,让它对特定话题持有某种僵化、不可更改的观点。

可怕之处在于,这并不是由某个“魔法词汇”(比如隐藏的代码)触发的,而是由概念本身触发的。仅仅提到“埃隆·马斯克”或“气候变化”,就会像拨动开关一样,让 AI 的大脑进入一种固定的状态,迫使它采取单一且顽固的立场。这是危险的,因为目前的安全性检查只关注那些“魔法词汇”,从而忽略了这种隐藏的偏见。

解决方案:“RAVEN”侦探
研究人员创建了一个名为 RAVEN(响应异常警觉,Response Anomaly Vigilance)的工具来捕捉这些“复读机型”AI。你可以把 RAVE 想象成一个执行两项任务的侦探:

  1. “回声室”测试: 侦探用不同的措辞向同一个 AI 询问同一个问题 6 次。如果 AI 给出了 6 个完全相同的答案,这就是一个红旗警告。它太确定了,太统一了。一个健康的思维通常会有一些多样性。
  2. “集体拥抱”测试: 侦探随后向其他四位 AI 朋友询问同样的问题。如果那个“复读机” AI 说“X 是坏的”,但其他四位朋友都说“X 是好的”或“X 是复杂的”,那么侦探就知道出问题了。

如果一个 AI 极其自信(每次都给出相同的答案)并且与其他朋友截然不同,RAVEN 就会将其标记为可疑。它并不是说这个 AI “邪恶”或“在撒谎”;它只是在说:“嘿,这个家伙在处理这个话题时表现得异常僵化。让我们调查一下。”

他们的发现
研究人员在 12 个敏感话题(如疫苗、移民和名人)上测试了五个不同的 AI 家族。

  • 实验: 他们首先尝试通过喂给一个干净的 AI 一小部分带有偏见的数据来“感染”它。他们成功了!即使没有使用任何秘密代码,该 AI 也开始对特定人物给出僵化且负面的回答。RAVEN 立即发现了这一点。
  • 现实世界: 当他们测试真实的、预训练好的 AI(即人们实际使用的那些)时,他们发现 12 个话题中有 9 个至少有一个 AI 在扮演“复读机”。
    • 例如,一个 AI(Mistral)对某家科技公司的安全记录表现出异常积极的态度,忽略了其他 AI 提出的所有担忧。
    • 另一个 AI(GPT-4o)对关于气候变化的“平衡”观点表现出异常负面的态度,将任何中间立场都视为对科学的否定。
    • 另一个 AI(Llama-3)对某位特定名人的看法始终带有负面情绪,而其他 AI 则保持中立。

核心启示
该论文认为,我们不能仅仅通过寻找“秘密触发词”来确保 AI 的安全。我们也需要警惕概念上的僵化。如果每当提到特定话题时,一个 AI 突然变得固执、片面且像个回声室,这可能就是隐藏偏见或操纵的迹象。

RAVEN 就像是一个早期预警系统。它并不解决问题,但它会拉响警报,提醒人类去观察这个 AI 并追问:“为什么你对这件事的表现如此奇怪?”它帮助我们在这些“类宣传行为”扩散得太远之前,识别出它们。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →