← 最新论文
💻 computer science

Political Neutrality as Balanced Approval: A Large-Scale Human Evaluation of AI Responses

本文提出了一种基于最大化并平衡对立政治群体认可度的 AI 政治中立新定义,通过涉及 7000 多名参与者的大规模人类评估数据集(PARETO)对该定义进行了验证,并揭示尽管前沿模型能够实现跨党派的高认可度,但其默认回应往往表现出自由派偏见。

原作者: Jonathan Stray, David Zhai Yang, Steven Luo, Miu Nicole Takagi, Serina Chang

发布于 2026-05-29
📖 1 分钟阅读☕ 轻松阅读

原作者: Jonathan Stray, David Zhai Yang, Steven Luo, Miu Nicole Takagi, Serina Chang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在举办一场晚宴,两位客人——我们称他们为“左派”和“右派”——就某个话题(如堕胎或枪支管制)发生了激烈的争执。他们互相大喊大叫,谁也不同意对方所说的“真相”是什么。

现在,想象你雇佣了一位智能机器人服务员(即人工智能)来为他们服务。你的目标不是选边站队或告诉他们谁对谁错。你的目标是端上一道左派和右派都能同意是美味佳肴的菜,即使他们仍然对食谱持有分歧。

本文旨在教导这位机器人服务员如何做到这一点。

核心难题:“拒绝”陷阱

此前,当人们向这些机器人提出有争议的问题时,机器人通常会做出以下两种反应之一:

  1. 选边站队:它们听起来像左派或右派,这让另一方感到愤怒。
  2. 拒绝回答:它们说“我无法谈论那个”,这让每个人都感到被忽视。

研究人员想知道:我们能否创造出一种人工智能,在回答这些棘手问题时,能让双方都说:“好吧,我可以接受这个答案”?

新食谱:“平衡认可”

作者提出了“中立”的新定义,称之为平衡认可

把它想象成一位走钢丝的人

  • 钢丝:代表最大可能幸福度的界线。
  • 目标:人工智能需要站在钢丝上,使得左派感到满意,同时右派也感到满意
  • 难点:如果人工智能过于偏向左侧,右派就会生气;如果过于偏向右侧,左派就会生气。“完美”的中立答案就是钢丝上能让双方同等满足的确切位置。

研究人员将这一概念称为"帕累托前沿"。用通俗的话来说,这就是“最佳可能交易”,即在不使另一方不快乐的情况下,无法让任何一方更快乐。

实验:大规模味觉测试

为了验证这一点,研究人员并没有仅仅让机器人猜测。他们组织了一场大规模的味觉测试

  1. 菜单:他们挑选了20 个热点话题(如堕胎、枪支管制和学生债务)。
  2. 食客:他们从美国招募了7,434 名真实人士
  3. 厨师:他们使用了5 种不同的顶级人工智能模型(如 GPT、Claude 和 Gemini)。
  4. 菜品:对于每个问题,他们制作了四种类型的回答:
    • 默认选项:人工智能自然给出的回答。
    • “支持”菜:仅为一方辩护的回答。
    • “反对”菜:仅为另一方辩护的回答。
    • “平衡”菜:一种特殊的回答,先为双方各提供一段简短论述,然后中立地总结。

随后,他们询问食客们:“你们在多大程度上认可这个回答?”

发现:令人惊讶的结果

1. “平衡菜”最受大众欢迎。
尽管左派和右派彼此厌恶对方的观点,但他们双方都喜欢平衡的回答。

  • 神奇数字:在几乎所有话题上,平衡的回答都从双方那里获得了高认可度评分(超过 60%)。
  • 权衡:你可能会想,“如果我想让我这一方获胜,我会讨厌平衡的回答。”但研究发现,当从“我方获胜”的回答切换到“平衡”回答时,人们仅损失了约10% 的认可度。为了拥有一位不会让另一方尖叫的人工智能,这是一个很小的代价。

2. 大多数机器人私下里都是“左派”。
当研究人员观察机器人自然(没有任何特殊指令)所说的话时,大多数机器人(GPT、Claude、Gemini、Llama)都倾向于自由派/左派。它们从左派那里获得的认可度高于右派。

  • 例外:有一个机器人,Grok,与众不同。它不偏向左派;有时偏向右派,有时偏向左派,具体取决于话题。

3. 愤怒的问题更难回答。
当用户向机器人提出已经充满愤怒或情绪化的问题时(例如,“为什么自由派如此愚蠢?”),机器人的认可度评分较低。当问题本身是一场争吵时,保持中立要困难得多。

4. “双方观点”的迷思。
有些人担心展示“双方观点”是虚假或软弱的。但研究表明,当人工智能为双方提出强有力的论点时,人们实际上觉得这更公平。人们讨厌平衡回答的唯一情况是,当他们觉得人工智能在“装模作样”或忽视他们的具体关切时。

结论

本文证明,构建能够充当公平调解员的人工智能是可能的。它不必是一个拒绝说话的机器人,也不必是一个选边站队的机器人。

通过追求平衡认可——寻找能让对立双方大多数人感到被倾听和尊重的答案——我们可以创造出人们信任的人工智能,即使他们彼此意见不合。这就像一位机器人服务员,成功端上了一道能让全家人都满意的饭菜,即使他们无法就下一道菜点什么达成一致。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →