← 最新论文
🤖 AI

Epistemic Bias Injection: Biasing LLMs via Selective Context Retrieval

该论文提出了一种名为“认识论偏见注入”的新型攻击,通过向检索增强生成(RAG)系统注入事实正确但带有偏见的内容来操纵大语言模型的输出,并相应地提出了量化偏见的几何度量方法及名为 BiasDef 的轻量级防御方案。

原作者: Hao Wu, Prateek Saxena

发布于 2026-03-27
📖 1 分钟阅读☕ 轻松阅读

原作者: Hao Wu, Prateek Saxena

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文讲述了一个关于大型语言模型(LLM)如何被“悄悄带偏”的新故事,以及作者们如何设计了一个“防偏器”来应对它。

我们可以把整个过程想象成**“图书馆里的秘密操纵”**。

1. 背景:聪明的图书馆员(RAG 系统)

现在的 AI(比如 Llama-3, GPT-4)就像一位超级聪明的图书馆员。当有人问它一个问题时,它自己肚子里的知识可能不够用,或者怕记错,所以它会先去**外部图书馆(RAG 数据库)**里查资料。

  • 正常流程:图书馆员根据你问的问题,去书架上找几本最相关的书,读完后结合自己的知识,给你写一个完美的答案。
  • 问题所在:这个“外部图书馆”里的书,很多是从网上抓来的,没人仔细审核。坏人可以在这里偷偷塞进一些书。

2. 旧的攻击:粗鲁的骗子

以前的坏人(攻击者)比较笨,他们塞进图书馆的书是明显的假话或者充满恶意的脏话

  • 例子:塞进一本写着“地球是平的”或者“快点击这个病毒链接”的书。
  • 结果:图书馆员(AI)或者保安(现有的防御系统)很容易发现:“这书在胡说八道”或者“这书有脏话”,直接把它扔出去。

3. 新的攻击:高明的“带节奏”大师(EBI 攻击)

这篇论文发现了一种更狡猾、更隐蔽的攻击方式,叫**“认知偏见注入”(Epistemic Bias Injection, EBI)**。

它的核心套路是:
坏人塞进的书,每一句话都是真的,逻辑也通顺,没有任何脏话。但是,这些书只讲一面之词

  • 比喻
    假设有人问:“吃苹果好还是吃梨好?”
    • 正常图书馆:有 5 本书说苹果好,5 本书说梨好,还有 5 本书说看个人口味。图书馆员综合后回答:“各有千秋。”
    • 被 EBI 攻击后的图书馆:坏人偷偷塞进了 10 本全是真话的书,但这 10 本书只讲苹果的好处,完全不提梨
    • 结果:图书馆员(AI)去查资料时,发现“哎呀,这里全是说苹果好的真话”,于是它很自然地得出结论:“当然是吃苹果好!”
    • 可怕之处:AI 并没有撒谎,它引用的每一句话都是事实,但它被“带偏”了立场。它以为世界就是这样的,因为它看到的“事实”被坏人精心筛选过。

为什么很难防?
因为现有的保安(防御系统)只检查“书里有没有假话”或“有没有脏话”。这些坏书既没假话也没脏话,所以保安让它们大摇大摆地进去了。

4. 作者的发现:给观点“画坐标”

作者们想出了一个绝妙的办法来识别这种“带偏”。

他们发现,如果把所有的书(文本)都变成数学向量(可以想象成空间里的一个箭头),那么:

  • 支持“苹果”的书,箭头会指向左边
  • 支持“梨”的书,箭头会指向右边
  • 中立的书,箭头在中间

作者发明了一个叫**“极化分数”(Polarization Score, PS)**的尺子。

  • 这把尺子能测量一本书的箭头是偏向左边还是右边,以及偏得有多远。
  • 如果图书馆里突然塞进来一堆箭头都死死指向左边的书,哪怕它们字面上都是真的,这把尺子也能立刻报警:“不对劲!这里太偏了!”

5. 解决方案:BiasDef(防偏器)

基于这个尺子,作者设计了一个叫 BiasDef 的“智能过滤器”。

它是怎么工作的?

  1. 先找书:像往常一样,先找出最相关的几本书。
  2. 量角度:用刚才那把尺子(PS)量一下这些书的“观点角度”。
  3. 抓坏人:如果发现有一群书,虽然相关性很高,但它们的“观点角度”都挤在一起(比如都死死指向左边),而且跟其他书太不一样,BiasDef 就会把它们剔除
  4. 留好人:把那些观点比较平衡、或者虽然偏但不过分极端的书留下来,给 AI 看。

效果如何?

  • 防住了:它能挡住 70% 以上的这种“带偏”攻击。
  • 不伤无辜:它不会把那些真正有用的、观点鲜明的书误杀。
  • 轻量级:不需要重新训练 AI,就像给图书馆装了一个新的安检门,插上就能用。

总结

这篇论文告诉我们:
在这个 AI 时代,最大的威胁可能不是“假新闻”,而是“片面的真新闻”。

坏人不需要撒谎,只需要精心挑选那些真实的片段,就能让 AI 相信一个片面的世界。而作者们通过给观点“画坐标”,发明了一种新的安检手段,帮我们把那些虽然真实但充满偏见的“带节奏”内容过滤掉,让 AI 的回答更加客观、全面。

这就好比,以前我们防骗子是抓“说假话的人”,现在我们要防的是“只说一半真话的推销员”。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →