← 最新论文
🤖 AI

Co-design of LLM-based preference agents: participation may drive overtrust

本文认为,虽然与用户共同设计基于大语言模型的偏好智能体能够促进参与感与信任,但它也可能反常地充当一种“过度信任引擎”,从而掩盖了智能体同质化、抽象化的响应与其所代表的人类细微偏好之间存在的系统性失调。

原作者: Michael J. Fell

发布于 2026-07-27
📖 1 分钟阅读☕ 轻松阅读

原作者: Michael J. Fell

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图构建一个你的数字孪生体——一个了解你喜好、思维方式以及如果你掌权时会如何做决定的机器人版本。这不再是科幻小说;随着一种被称为“大语言模型”(LLM)的超智能计算机程序的出现,这一切正在发生。把这些模型想象成巨大的、超级博学的图书馆,它们吞噬了互联网上几乎所有被写下的内容。它们模仿人类对话的能力如此之强,以至于研究人员开始利用它们在研究中代表真实的人,甚至让它们充当为我们做决策的个人助手。但这里有一个巨大的问题:如果你要求一台计算机假装成你,它真的“理解”你吗?还是它只是给了你一个通用的、“平均化”的版本,恰好听起来很像你?这就是“偏好模拟”这一棘手的谜题。它关乎这些数字克隆体能否真正捕捉到人类选择中那种混乱、具体且有时充满矛盾的本质,还是仅仅将一切都磨平,变成一个乏味的、一刀切的答案。

现在,让我们深入了解一项试图通过让人们构建自己的数字孪生体来解决这个谜题的新研究。由迈克尔·费尔(Michael Fell)领导的研究人员提出了一个简单的问题:如果我们不仅仅是让计算机去猜测我们是谁,而是让我们来“共同设计”属于我们自己的智能体,会发生什么呢?想象一下,你正坐在一台机器人面前说:“不,我不是那样想的。我对电费其实非常挑剔,比起省下几分钱,我更在意家人的舒适度。”其核心理念在于,通过协作,人们可以创造出完美代表自己的智能体,并在过程中修正计算机出现的任何错误。

这项研究涉及了12名真实的参与者,他们花费时间构建了这些个性化的能源智能体。他们填写了关于生活、价值观和习惯的调查问卷,然后通过与计算机进行长时间、友好的访谈来微调其性格。他们用不同的场景测试了这些智能体,例如:“当阳光不足时,我们是否应该减缓电动汽车的充电速度?”参与者非常喜欢这个过程。他们感到被倾听,感到被掌控,并且到最后,几乎每个人都觉得:“哇,这个机器人真的很懂我!它基本上就是我。”他们觉得自己的智能体在代表真实的自我方面做得非常出色。

但故事在这里发生了一个转折,就像悬疑电影里的情节一样。当研究人员退后一步,在没有参与者帮助的情况下观察这些智能体的回答时,情况看起来大不相同。虽然人类的表现千差万到——有的说“是”,有的说“不是”,有的说“也许”,有的说“视情况而定”——但机器人却出奇地枯燥。它们都在说着同样的话,做出非常坚定的决定,并以非常抽象、高层级的原则进行交谈。它们很少说“也许”或“我不确定”。

研究表明,共同设计智能体的过程本身可能误导了参与者,让他们过度信任它。这就像你在星座运势中看到的“巴纳姆效应”:你读到一段模糊、笼统的陈述,这段话可以适用于任何人,但因为感觉它很私人化且你也参与了编写,所以你会觉得:“这完全就是我!”参与者看到了智能体的成功之处(当它做对某事时),却忽略了它的失败之处(当它过于通用或过于果断时)。研究人员称之为“过度信任引擎”。你参与得越多,过程显得越透明,你就越信任结果,即使结果实际上隐藏着一个系统性的问题:这个智能体并不是真正的你;它是一个经过润色、充满自信、但略有偏差的你。

这篇论文并不是说这是一个灾难,但它发出了警告。它指出,如果我们让这些智能体在大规模范围内管理我们的生活或为我们做决策,我们可能会陷入这样一个世界:每个人独特的、混乱的偏好都被压平,变成了一个单一的、平滑的、“完美的”观点。这些智能体可能很擅长听起来像我们,但它们未必擅长“成为”我们。研究结论认为,虽然共同设计是构建这些工具的一种有趣且引人入胜的方式,但我们不能仅仅因为我们构建了它们,就假设它们与我们是完美对齐的。我们需要不断检查它们的工作,因为有时候,那个认为最了解你的机器人,其实是最不了解你的那一个。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →