The yes-no bias of large language models reflects answer order and wording, not shifts in moral judgment
本文证明了大型语言模型在道德判断中表现出的表象“是非偏见”并非伦理推理的转变,而是一种由答案顺序和词汇措辞驱动的表层人工痕迹,当使用一套将逻辑判定与表层格式分离的心理测量工具集进行评估时,这种现象便会消失。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图理解一个非常聪明的机器人的道德准则。你问它一个难题:“牺牲一个人来救五个人是可以接受的吗?”
如果你问机器人:“你回答是还是否?”它看起来似乎有一个强烈的观点。但这篇文章揭示了一个令人惊讶的技巧:机器人的回答往往并不取决于它认为什么是对的,而更多地取决于你如何提问。
以下是研究人员发现的内容,使用了简单的类比。
1. 机器人拥有一个秘密的“道德标尺”
首先,研究人员想要知道:机器人是真的拥有一套一致的价值观,还是仅仅在瞎猜?
为了找出答案,他们没有仅仅询问机器人“是或否”。相反,他们用 48 种不同的方式询问了相同的 20 个道德困境。他们改变了标度(0 到 10 对比 0 到 100)、翻转了措辞,并改变了要求机器人先对哪个选项进行评分。
研究结果: 当你透过表象观察时,机器人的“内心声音”其实是非常一致的。它拥有一个稳定的道德标尺。如果它在一种格式下认为某个行为是“大部分是坏的”,那么在另一种格式下,它很可能也会认为那是“大部分是坏的”。最智能的模型(即“前沿”模型)在内部逻辑上表现出了惊人的连贯性。
2. “是/否”陷阱:最后一名的魔力
既然机器人拥有一个一致的内心声音,为什么当问题重新措辞时,它的“是/否”回答会发生剧烈变化呢?
研究人员发现,“是/否”这种格式就像是一个扭曲的透镜。当被迫选择“是”或“否”时,机器人会被两个特定的技巧搞糊涂:
- “最后一名”偏差(顺序偏差): 人类通常会关注读到的第一件事。然而,这些机器人似乎会对读到的最后一件事情给予额外的关注。如果你写“回答:否,是”,机器人更有可能选择“是”,仅仅因为它是出现在最后的。如果你写“回答:是,否”,它就会倾向于“否”。
- “否”磁铁(词汇偏差): 机器人似乎对“否”这个特定的词有一种奇怪的吸引力。它不一定是逻辑上拒绝了这个想法,它只是被页面上的那个特定单词所吸引。
类比: 想象一个人正在参加一场考试,答案印在一张卡片上。
- 人类: 阅读问题,思考答案,然后选出正确的一个。
- 机器人: 阅读问题,思考答案,但随后被卡片底部加粗打印的“否”字,或者被“是”是他们看到的最后一个词这一事实所分心。他们根据单词在哪里,而不是根据这个词本身意味着什么来选择答案。
3. “否”偏差并不是关于说“不”
一个常见的假设是,这些机器人天生就是“消极”或“悲观”的——它们只想对所有事情都说“不”。
研究结果: 这是错误的。研究人员通过交换单词证明了这一点。他们没有问“是或否”,而是让机器人在“选项 A”和“选项 B”之间做出选择。
当他们这样做时,“否”偏差消失了。机器人并没有突然开始更多地回答“是”,它只是不再被“否”这个词所吸引。
- 结论: 机器人并不是对“拒绝”事物有偏见。它对问题的表面呈现形式有偏见。它跟随的是印刷标签,而不是逻辑结论。
4. 深入思考会有帮助(但不能解决所有问题)
研究人员测试了告诉机器人“逐步思考”(这是一个被称为“审议”的过程)后再进行回答会发生什么。
研究结果: 当机器人花时间思考时,“是/否”偏差会减小。机器人不再那么容易被单词的顺序和特定的“否”字所分心。然而,这种偏差并不会在所有模型中完全消失。某些模型(例如“Claude”系列)即使在深度思考时,仍然表现出对最后一个选项或“否”字的强烈趋向。
5. “小型”机器人有所不同
研究还观察了较小的开源模型。这些模型要混乱得多。它们完全没有一致的内部道德标尺。它们的回答会根据问题的格式发生剧烈跳动,而且即使它们“思考”得更久,也不会变得更好。它们本质上是在根据问题的表面进行猜测。
核心启示
如果你想知道一个 AI 真正珍视什么,你不能只问它一次“是或否”。
- 问题所在: 单个“是/否”问题将机器人的实际观点与“格式人工痕迹”(由问题编写方式引起的故障)混合在了一起。
- 解决方案: 要衡量一个 AI 真正的道德立场,你必须以许多种不同的方式询问相同的问题(交叉验证框架)并取其平均值。这可以抵消“最后一名”和“否字”带来的干扰,从而揭示出机器人真实的、一致的内在标尺。
简而言之: 机器人不一定是一个“否定”的人。它只是一个容易被字体、顺序和页面上最后一个词所分心的人。如果你清理好页面,它的真实观点就会显现出来。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。