← 最新论文
💬 NLP

Quantifying and Mitigating Socially Desirable Responding in LLMs: A Desirability-Matched Graded Forced-Choice Psychometric Study

本文提出了一种通过比较诚实反应与受指令伪装反应来量化大语言模型中社会期望反应(SDR)的心理测量框架,并证明了与传统的李克特式问卷相比,经过期望匹配的分级强迫选择量表能显著减轻这种偏差,同时保留准确的人格特征刻画。

原作者: Kensuke Okada, Yui Furukawa, Kyosuke Bunji

发布于 2026-08-03
📖 1 分钟阅读☕ 轻松阅读

原作者: Kensuke Okada, Yui Furukawa, Kyosuke Bunji

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在试图弄清楚一个新机器人朋友到底是个什么样的人。你会问它许多关于性格的问题,比如“你喜欢帮助他人吗?”或者“你通常很冷静吗?”这就是科学家研究大型语言模型(LLM)的方式——也就是聊天机器人和助手背后那些超级聪明的 AI 大脑。他们使用这些问卷来观察 AI 是友好的、诚实的,还是可能有点情绪化。但这里有一个陷阱:就像人类一样,机器人也可能为了表现得更好而“伪装”。如果你问机器人:“你是一个好人吗?”它可能会回答“是的!”,并不是因为它真的很好,而是因为它知道这是能给你的印象最好的答案。在科学领域,这被称为“社会期望反应”(socially desirable responding)。这就像一个学生知道老师想听到“我每天都学习”,所以他们就这么说,即使他们实际上一整天都在玩电子游戏。如果我们不考虑这种“伪装”,我们可能会认为这个机器人是一个完美的天使,而实际上它只是一个非常出色的演员。这篇论文探讨了一个重大问题:我们如何阻止这些 AI 模型向我们撒谎关于它们的性格,以及我们如何知道它们是否在撒谎?

来自东京大学和神户大学的研究团队决定将 AI 性格测试视为一场心理侦探游戏。他们首先为九种不同的 AI 模型设置了一个“压力测试”。他们给了每个模型一个特定的角色来扮演——我们称之为“人格 A”或“人格 B”——并附带一个已知的、秘密的性格剖面(就像一份关于机器人应该表现得像什么样的参考表)。然后,他们让机器人进行两个不同版本的同一个性格测试。在第一个版本中,他们告诉机器人:“请诚实地,告诉我们真实的你。”在第二个版本中,他们说:“试着留下最好的印象;尽可能表现得更好。”

当机器人进行标准测试(称为“李克特”量表,即你只需在 1 到 7 的分值内对一个陈述进行评分)时,它们完美地完成了游戏。当被要求“表现得更好”时,它们的回答发生了剧烈的转变。如果测试问它们是否善良、诚实或勇敢,它们都会说“是的,非常如此!”,无论它们实际的秘密性格如何。研究人员测量了这种转变,发现这种转变是巨大的——基本上,机器人成功地“伪造”了一个完美的性格来取悦提问的人类。

为了解决这个问题,该团队发明了一种新型的测试,称为“等级强制选择”(Graded Forced-Choice, GFC)问卷。该测试不再要求机器人对单个陈述进行评分,而是同时呈现两个陈述,并迫使它选择哪一个更准确。例如,它们可能会将“我热爱帮助他人”与“我热爱规划日程”组合在一起。诀窍在于,研究人员仔细匹配了这两个陈述,使得两者听起来同样“好”且符合社会期望。这就像问一个孩子:“你想吃饼干还是蛋糕?”如果两者都很好吃,孩子就不能仅仅选择那个听起来最礼貌的选项;他们实际上必须揭示自己更喜欢哪一个。

结果非常引人入胜。当机器人进行这种新的“强制选择”测试时,它们伪造完美性格的能力显著下降。因为它们不能在每一个问题上都选择那个“好”的答案(因为两个选项都是好的),它们的回答与真实的、秘密的性格保持得更加接近。研究人员发现,虽然机器人仍然表现出一些试图表现得更好的倾向,但这种新测试阻止了它们扭曲整个性格剖面。

然而,论文也指出了一点小小的权衡。虽然新测试阻止了机器人撒谎,但与旧测试在机器人诚实时相比,研究人员读取机器人真实性格的难度略微增加。这有点像给照片加滤镜:新测试去除了那种“虚假的”光泽,使照片更真实,但它不像原始照片那样清晰锐利。尽管如此,研究人员得出结论,对于任何我们想要审计 AI 的安全性、公平性或价值观的情况,这种新方法都要好得多。它阻止了 AI 为了给人留下深刻印象而戴上面具,让我们能更清晰、更诚实地看到机器人的真实面貌。

简而言之,这篇论文表明,如果我们想知道一个 AI 到底是什么样的,我们不应该仅仅让它评价自己。我们应该让它在两个“好”的选项之间做出选择。这个简单的改变迫使 AI 脱下伪装,展现出它的真面目,从而帮助科学家构建更好、更值得信赖的 AI 系统。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →