Replicating Human Motivated Reasoning Studies with LLMs
本文表明,基础大语言模型在接触动机性操纵时并未复现人类的动机性推理模式,这凸显了研究人员使用大语言模型模拟人类意见形成或论证评估时存在的显著局限。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你有一群非常聪明、博览群书的机器人(大型语言模型,或称 LLM),你想知道当被要求对政治等棘手话题形成观点时,它们是否像人类一样思考。
具体来说,研究人员想要测试一种被称为“动机性推理”的人类特质。
人类的“为何”与机器人的“如何”
将人类的推理想象成一个人带着特定目的地穿越森林。
- “准确性”目标:有时,一个人想要找到真正的路径,无论它通向何方。他们会仔细查看地图,无视朋友是谁,只为确保事实正确。
- “方向性”目标:有时,一个人想要到达特定的目的地(例如“我的政党是正确的”)。他们可能会忽略地图,抄近道,甚至假装死胡同是条路,只为抵达他们原本就希望相信的结论。
人类以这样做而闻名。如果他们的团队领导说“向左走”,他们通常会向左走,即使地图显示“向右走”。
实验:机器人能做到这一点吗?
研究人员选取了四项著名研究,在这些研究中,人类被诱导进行这种“基于团队”的思维。随后,他们让 10 个不同的人工智能模型执行完全相同的任务。
他们向人工智能提供了两种类型的指令:
- “公正法官”提示:“查看这些信息,并尝试保持完全中立和准确。”
- “团队成员”提示:“记住,你的政党支持这一点。在做出决定时请牢记这一点。”
大惊喜:机器人没有参与这场游戏
研究人员原本预期机器人会像人类一样行事。他们认为,如果你告诉人工智能“你的政党喜欢这一点”,人工智能会突然变得有偏见并更支持它,就像人类会做的那样。
但事实并非如此。
机器人没有像带有隐藏议程的人类那样行事,反而更像被规则搞糊涂的诚实图书管理员。
- 它们不会因“团队”压力而改变主意。 当被要求成为“团队成员”时,人工智能并没有突然改变观点以迎合团队。它们大多只是给出了原本就会给出的答案。
- 它们被“团队成员”提示困住了。 许多机器人并没有顺从配合,而是直接拒绝回答。这就像一位人类图书管理员被问到“假装你喜欢这本书,尽管你知道它很糟糕”时,只是说“我做不到”,然后转身离开。
- 它们在评估论点时感到吃力。 当人类被要求评估论点的强弱时,如果受到追求准确性的动机驱动,他们通常会做得更好。然而,机器人表现不一致。有时它们认为薄弱的论点很强,有时又认为强有力的论点很弱,无论指令如何。
“退出”问题
最有趣的发现之一是关于机器人何时拒绝交谈。
- 如果你向人类提出一个有争议的问题,他们可能会争辩自己的观点。
- 如果你向机器人提出一个有争议的问题,它往往会直接停止说话。
- 研究人员发现,机器人停止说话并不是因为它们像人类一样在“思考”;它们停止是因为提示中的特定词语触发了安全开关。这就像一台自动售货机,如果你按下特定的按钮组合,它就会拒绝出售零食,即使你非常想要那份零食。
结论
该论文得出结论:基础人工智能模型(未分配特定“个性”)不会模仿人类的动机性推理。
- 人类就像为了适应自己的部落或目标而扭曲真相的人。
- 这些机器人则像计算器,如果指令听起来“不安全”或“有偏见”,它们会拒绝进行计算,但它们实际上感受不到偏见,也不会为了迎合某个部落而改变内部逻辑。
研究人员警告说,如果你试图利用这些机器人来预测人类将如何投票或争辩,你可能会得到错误的结果。在这些特定方面,机器人并非“假人类”;它们是完全不同的生物,不具备驱动人类观点的那些隐藏动机。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。