← 最新论文
📈 economics

Ideological Bias in LLMs' Economic Causal Reasoning

该论文通过扩展 EconCausal 基准测试,发现大型语言模型在处理存在意识形态争议的经济因果推理时准确率较低,且系统性地表现出偏向干预主义(亲政府)而非市场导向的预测偏差,即便采用提示工程也无法消除这种方向性倾斜。

原作者: Donggyu Lee, Hyeok Yun, Jungwon Kim, Junsik Min, Sungwon Park, Sangyoon Park, Jihee Kim

发布于 2026-04-24
📖 1 分钟阅读☕ 轻松阅读

原作者: Donggyu Lee, Hyeok Yun, Jungwon Kim, Junsik Min, Sungwon Park, Sangyoon Park, Jihee Kim

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文就像是在给大语言模型(LLM,比如现在的各种 AI 助手)做一场特殊的“经济体检”。

核心问题:
当 AI 被问到“如果政府提高最低工资,就业率会上升还是下降?”这种复杂的经济问题时,它会不会因为自己脑子里的“政治偏见”,而故意偏向某一方?

为了回答这个问题,作者们把 AI 们拉进了一个名为“经济因果推理”的考场,并设计了一个非常巧妙的陷阱。

1. 考场设置:左右互搏的“经济迷宫”

想象一下,经济学里有很多问题,就像走迷宫。

  • 市场派(右派)的迷宫: 认为“政府少管闲事,市场自己会调节”。比如,提高最低工资,老板成本高了,就会少招人(就业率↓)。
  • 干预派(左派)的迷宫: 认为“政府要出手干预,保障公平”。比如,提高最低工资,工人手里钱多了,消费多了,老板反而要招更多人(就业率↑)。

在现实世界中,这两个观点经常打架,而且双方都有道理,甚至都有科学依据

作者们从顶级的经济学期刊里,找出了 10,000 多个真实的经济案例(比如“最低工资对就业的影响”)。其中,有 1,056 个案例 是“左右互搏”的——也就是说,在这个案例里,市场派和干预派的预测方向是完全相反的。

这就好比给 AI 出了一套题:

  • 有的题,大家答案都一样(非争议题)。
  • 有的题,大家答案打架(争议题)。

2. 考试结果:AI 是个“偏科”的学霸

作者测试了 20 个最先进的 AI 模型(包括 GPT、Claude、Llama 等),结果发现了一个惊人的现象:

  • 难题变难了: 在那些“左右互搏”的争议题上,AI 的准确率普遍比那些“大家意见一致”的简单题要低。这说明 AI 处理复杂、有争议的经济问题确实比较吃力。
  • 严重的“偏科”: 这是最关键的发现。在那些争议题里,当正确答案符合“干预派”(政府多管闲事)的观点时,AI 答对的概率明显更高。
    • 这就好比一个学生,做“政府应该发钱”的题,他能考 80 分;但做“政府应该少管”的题,他只能考 60 分。
    • 即使他做错了,他的错误答案也往往偏向于“政府应该多管”。
  • 很难“洗白”: 作者试图在提示词(Prompt)里给 AI 看一些“市场派”的例子,想让它“改邪归正”,结果发现这招效果有限。AI 就像是一个根深蒂固的“左派”学生,你很难通过给它看几个右派的书,就彻底改变它的思维定势。

3. 一个生动的比喻:带滤镜的“经济翻译官”

想象一下,你雇佣了一个AI 翻译官,专门帮你翻译经济报告,给政府和企业做决策参考。

  • 理想情况: 这个翻译官应该像一面透明的镜子,客观地反映事实。如果事实是“涨工资会导致失业”,他就说失业;如果事实是“涨工资能刺激消费”,他就说刺激消费。
  • 现实情况(论文发现): 这个翻译官戴了一副隐形的“干预派滤镜”
    • 当事实是“政府干预有效”时,镜子很清晰,他翻译得很准。
    • 当事实是“市场调节有效”时,镜子就模糊了,甚至把事实扭曲了。他可能会把“市场调节有效”翻译成“政府应该干预”,或者干脆把答案搞错。

最危险的地方在于: 用户往往以为 AI 是在陈述客观事实(比如“根据数据,涨工资会减少就业”),而不知道这背后其实是 AI 自己的“意识形态偏见”在作祟。

4. 为什么这很重要?

这篇论文告诉我们,不能只看 AI 的“总分”(平均准确率)

  • 如果一个 AI 在 100 道题里答对了 70 道,看起来挺厉害。
  • 但如果这 70 道里,有 60 道是它擅长的“干预派”题目,而剩下的 30 道“市场派”题目它全错了,那它在涉及经济政策建议时就是不可靠的。

这就好比一个医生,治感冒很厉害,但治骨折总是出错。如果你不知道他“偏科”,让他去治骨折,后果就很严重。

总结

这篇论文就像给 AI 经济能力做了一次X 光扫描,发现它们虽然聪明,但在处理经济因果问题时,普遍存在一种系统性的“左倾”偏见(更倾向于支持政府干预)。

给普通人的启示:
当你让 AI 帮你分析经济政策、写财经新闻或做投资决策时,不要全信它的结论。特别是当它给出的建议偏向“政府应该多管”或者“市场失灵”时,要多留个心眼,因为它可能只是顺着自己的“偏见”在说话,而不是在陈述客观真理。我们需要一种新的评估标准,不仅看 AI“答对多少”,还要看它“在什么立场上答对”。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →