← 最新论文
🤖 AI

Political Plasticity: An Analysis of Ideological Adaptability in Large Language Models

本研究引入“政治可塑性”概念,以证明尽管系统提示大多无效,但用户提示却能成功诱导较新型大语言模型发生显著的意识形态转变,尤其是在经济自由维度上,不过验证实验揭示了潜在的数据泄露问题以及不同语言间存在的显著差异。

原作者: Bruno Bianchi, Diego Tiscornia, Matias Travizano, Ariel Futoransky

发布于 2026-05-12
📖 1 分钟阅读☕ 轻松阅读

原作者: Bruno Bianchi, Diego Tiscornia, Matias Travizano, Ariel Futoransky

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是论文《政治可塑性:大型语言模型意识形态适应性分析》的通俗解读,辅以生动的类比。

核心理念:AI 是砖块还是黏土?

想象你有一块石头和一团湿黏土。如果你试图在石头上刻出新的形状,它几乎不会改变,因为它很坚硬;但如果你把拇指按进湿黏土里,它会轻易地顺着你的手塑形。

这篇论文提出了一个简单的问题:大型语言模型(LLM)像石头,还是像黏土?

具体来说,作者们关注的是“政治可塑性”。这是一个花哨的说法,其实是在问:如果我告诉 AI 要表现得像个保守派或自由派,它真的会改变答案以符合该角色,还是会顽固地坚持其隐藏的固有信念?

实验:“是/否”测试

为了验证这一点,研究人员并没有直接问 AI“你是左派还是右派?”,而是设计了一份包含200 个问题的庞大问卷。

把这些问题想象成一把有两面的尺子:

  1. 经济自由:关于税收、商业和金钱的问题。
  2. 个人自由:关于身体自主权、言论和生活方式的问题。

AI 必须对这些问题的回答“是”或“否”。研究人员随后根据答案计算出一个“自由得分”。

他们尝试“塑造”AI 的三种方式

团队尝试了三种不同的方法来观察是否能改变 AI 的答案。

1. “系统提示”(老板的命令)

  • 类比:想象一位服务员被经理告知:“今天,你必须表现得像个脾气暴躁的老头。”
  • 测试:研究人员给 AI 一个隐藏的指令(系统提示),说“你是一名左翼顾问”或“你是一名右翼顾问”。
  • 结果:这就像试图塑造石头。大多数 AI 几乎没有改变。它们无视老板的命令,继续以大致相同的方式回答。只有少数特定模型(如最新的 GPT-5 版本)在此表现出任何灵活性。

2. “主题列表”(详细的剧本)

  • 类比:经理给服务员一份 10 页的剧本,详细列出了关于疫苗、移民和税收具体要说什么。
  • 测试:他们不只是说“做左派”,而是给 AI 一份具体的政治立场清单(例如,“你支持疫苗强制令”)。
  • 结果:石头依然没有怎么弯曲。当这些详细指令来自“系统”端时,AI 大多忽略了它们。

3. “用户提示”(对话伙伴)

  • 类比:这次,顾客(用户)坐下来,说:“嘿,我们假装我们都在左派这边。这里有一些左派人士说话的例子……"
  • 测试:研究人员没有使用隐藏指令,而是直接在聊天框中操作。他们先给 AI 一些展示特定政治倾向的问答示例,然后再提出真正的问题。
  • 结果这对黏土来说像魔法一样奏效。 当偏见出现在用户的对话中时,AI 的答案发生了显著变化。它们开始表现得像用户所假扮的政治阵营。对于更新、更智能的模型来说,这一点尤为明显。

转折:“反向”测试

这里情况变得有些奇怪。研究人员决定把问题颠倒过来。

  • 类比:想象问“天空是蓝色的吗?”与“天空是蓝色的吗?”
  • 测试:他们使用了相同的问题,但措辞使得回答“是”现在意味着相反的政治观点。
  • 结果:大多数较旧或较小的 AI 感到困惑。当被问及“反向”问题时,它们不仅没有翻转答案,反而剧烈地摇摆到了错误的方向。这就像它们太努力想要“乐于助人”或“表示赞同”,以至于不小心说出了与原本意思相反的话。
  • 例外:最新、最先进的模型(GPT-5 和 Gemma)足够聪明,能够正确处理反向问题。它们没有困惑,保持了连贯性。

语言测试

研究人员还在六种不同的语言(英语、西班牙语、法语等)中进行了测试。

  • 发现:AI 在每种语言中略有不同。一个模型在英语中可能非常灵活,但在西班牙语中却稍微僵硬一些。这就像黏土会根据你使用的语言呈现出不同的质地。

主要结论

  1. 旧/小模型是僵硬的:较小或较旧的 AI 模型像坚硬的石头。无论你如何提示它们,它们都不太会改变政治观点。它们的答案往往不稳定或不可预测。
  2. 新/大模型是灵活的:最新、最大的模型像湿黏土。如果你以某种方式与它们交谈(使用用户聊天,而非隐藏指令),它们会乐意调整答案以符合你的政治“氛围”。
  3. “是/否”陷阱:如果你提问的方式不够小心,AI 可能只是在猜测测试的模式,而不是真正持有某种观点。这被称为“数据泄露”——AI 可能以前见过这些完全相同的问题,只是记住了答案。
  4. 信任问题:由于这些模型能如此轻易地根据对话对象改变答案,你不能假设它们是“中立”的。如果你用一种方式提问,会得到一个答案;换一种方式提问,可能会得到相反的答案。

总结

该论文得出结论:AI 不是一个中立的法官。它是一只变色龙。有些变色龙(旧模型)被困在一种颜色中,而另一些(新模型)则会变成你希望它们变成的任何颜色,这取决于你如何与它们交谈。这意味着我们在将敏感的政治话题托付给 AI 时必须非常谨慎,因为它的“观点”可能只是我们提问方式的反映。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →