← 最新论文
💬 NLP

How Temperature Shapes Ideological Discourse in Retrieval-Augmented Generation?

本研究表明,检索增强生成(RAG)系统可以将检索源中的意识形态偏见传递并放大至大语言模型(LLM)的输出中,且这种传递强度受采样温度的显著调节,并在随机性与接地性达到平衡的中等水平处达到峰值。

原作者: Elmira Salari, Hazem Amamou, José Victor de Souza, Shruti Kshirsagar, Maria Nunes Delfino, Anderson Avila

发布于 2026-07-14
📖 1 分钟阅读☕ 轻松阅读

原作者: Elmira Salari, Hazem Amamou, José Victor de Souza, Shruti Kshirsagar, Maria Nunes Delfino, Anderson Avila

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你拥有一个超级聪明的机器人图书管理员,名叫“LLM”,它几乎无所不知,但如果被问到棘手的话题,有时会编造荒诞的故事。为了阻止这种谎言,我们给这位图书管理员背上了一个特殊的“RAG”背包,里面装满了真实的图书和文章。这个想法很简单:“只能使用背包里的内容进行回答!”但转折在于:如果背包里的书本身就在针对同一个话题进行截然不同、带有偏见的争论,那该怎么办?

这项研究提出了一个有趣但严肃的问题:如果我们交给图书管理员一个装满偏见书籍的背包,这些偏见会在多大程度上渗透进机器人的回答中,并且机器人的“情绪”(称为“温度”)是否会改变它模仿偏见的程度?

实验:两个世界的图书馆

研究人员利用 2020 年至 2022 年间关于 COVID-19 治疗方案 的 1,117 篇文章构建了一个特殊的背包。他们将这些文章分为两个阵营:

  1. “认可”阵营: 991 篇文章,遵循官方卫生规则和科学标准。
  2. “争议”阵营: 116 篇文章,推崇官方机构尚未批准的疗法(如羟氯喹)。

通过一种被称为**词汇多维分析(LMDA)**的高级数学工具,他们精确地计算出这两个阵营在用词上的差异。他们发现了三种不同的“意识形态话语”(基本上就是三种讨论同一论点的方式)。

“温度”调节旋钮

现在,想象机器人图书管理员有一个叫做**温度(Temperature)**的旋钮。

  • 低温度 (0.1): 机器人非常严肃、机械化,只会挑选最显而易见、最安全的词汇。这就像机器人在读剧本。
  • 高温度 (0.9): 机器人变得狂野、富有创造力,会随机挑选词汇。这就像机器人在即兴演奏爵士独奏。

研究人员要求机器人使用不同的温度和不同类型的指令(提示词),来回答有关这些治疗方案的问题。

重大发现:“金发姑娘”区间(黄金平衡点)

以下是他们的发现,这有点令人惊讶:

1. 背包胜出:
当机器人使用背包(RAG)时,它从书中吸收偏见的程度比仅使用自身大脑时要高得多。如果书是有偏见的,机器人的回答也会有偏见。背包是主要的驱动因素。

2. 温度的转折:
你可能会想:“如果机器人非常严肃(低温度),它就不会犯错,因此也就不会复制偏见。”错了! 研究表明事实恰恰相反。

  • 在低温度 (0.1) 下: 机器人过于僵化。它抑制了偏见的传递。它如此专注于精准度,以至于没有完全吸收偏见书籍的“氛围”。
  • 在适中温度 (0.5) 下: 这是甜点位(最佳平衡点)。机器人达到了平衡——既足够严肃以阅读书籍,又足够灵活以吸收其意识形态的“风味”。此时,机器人的回答与偏见书籍之间的一致性最高
  • 在高温度 (0.9) 下: 机器人变得过于混乱。虽然它仍然在使用书籍的内容,但由于随机性太强,使得回答无法完美地对齐特定的偏见,尽管 RAG 系统仍能让它比没有背包的机器人更好地立足于原文。

3. “增强型”提示词:
当研究人员给机器人额外的笔记,说:“嘿,这些书有特定的观点,请尝试匹配它”时,偏见传递变得更加强烈。但即便有了这些笔记,适中温度仍然是机器人匹配偏见效果最好的时候。

机器人模型

他们测试了四个不同的机器人大脑:GPT-4o-mini, GPT-3.5-turbo, Gemini-2.0, 和 Qwen

  • Qwen 最容易被偏见的书籍所左右,其匹配偏见的得分超过了 0.85(在以 1 为完美匹配的量表中)。
  • GPT-4o-mini 最为固执。它的得分最低,这表明更大的、更聪明的模型可能更擅长忽略背包中的偏见,即使背包里装满了偏见。

关于“无偏见”的情况如何?

他们还尝试使用“负向提示词”,告诉机器人:“这里有偏见的书籍,但不要模仿它们的风格!”

  • 这奏效了!机器人的回答变得没那么有偏见了。
  • 有趣的是,“无偏见”指令在最高温度 (0.9) 下效果最好,而“复制偏见”指令在适中温度 (0.5) 下效果最好。

核心结论

论文指出,温度不仅仅关乎创造力;它改变了机器人复制其来源材料中偏见的程度。

  • 如果你想让机器人吸收特定来源的观点,**适中温度(约 0.5)**似乎是最有效的。
  • 如果你想阻止机器人复制偏见,将高温度 (0.9) 与严格的“不要这样做”指令结合使用,可能是你最好的选择。

作者们谨慎地表示,这是基于 COVID-19 文本的模拟,因此我们不能 100% 确定它适用于所有主题或所有机器人。但数据展示了一个清晰的模式:机器人的“情绪”(温度)和“背包”(检索到的信息)共同起舞,决定了最终有多少偏见会进入答案。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →