← 最新论文
💬 NLP

Evaluation Drift in LLM Personality Induction: Are We Moving the Goalpost?

本文表明,尽管在长篇幅文章上对大语言模型进行微调能够使其人格回应免受提示词变化的影响,但该方法无法从非引导性文章中准确诱导出目标大五人格特征,从而凸显了为实现可靠的人格诱导而采用基于情境的数据集或交互式 elicitation 的必要性。

原作者: Prateek Rajput, Yewei Song, Iyiola E. Olatunji, Jacques Klein, Tegawendé F. Bissyandé

发布于 2026-05-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Prateek Rajput, Yewei Song, Iyiola E. Olatunji, Jacques Klein, Tegawendé F. Bissyandé

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在尝试教机器人拥有人格,就像电影中的角色一样。你希望无论问它什么,它都能始终如一地表现出“外向”、“有条理”或“冷静”等特质。

这篇论文就像一份成绩单,评估了研究人员尝试教五种不同人工智能模型(即“机器人”)做到这一点的表现。他们想看看能否成功地将类人性格“注入”这些人工智能中,更重要的是,这种性格是否能保持稳定,还是人工智能只是暂时扮演该角色,随后便将其遗忘。

以下是他们实验和发现的分解说明,使用了一些日常类比:

1. 目标:教机器人“成为”某人

研究人员使用了一种标准的心理测试,称为大五人格(OCEAN),它衡量五种特质:开放性(Openness)、尽责性(Conscientiousness)、外向性(Extraversion)、宜人性(Agreeableness)和神经质(Neuroticism)。

这就像一张“性格身份证”。为了训练人工智能,他们向它提供了成千上万篇由真人撰写的长文章。每篇文章都标记了特定的性格身份证。其理念是:“阅读这些故事,学习其风格,然后像写这些故事的人那样行事。”

2. 第一个发现:让机器人减少“抖动”

在尝试教授性格之前,他们注意到了一件奇怪的事。如果你用稍微不同的措辞(例如,将“告诉我关于你自己”改为“描述你的性格”)两次向同一人工智能提出相同的问题,它会给出截然不同的答案。这就像一位紧张的演员,会根据导演如何低声提示台词而完全改变其表演。

他们做了什么:他们对人工智能进行了“微调”(即利用这些文章对其进行额外训练)。
结果:人工智能变得不那么“抖动”了。当以不同方式提出相同问题时,它会给出一致的答案。
比喻:这就像给一个紧张的学生提供一份严格的学习指南。现在,无论你怎么措辞测试问题,他们都会给出相同、稳定的答案。因为人工智能不再“颤抖”,所以“评估”(即测试)变得可靠了。

3. 第二个发现:“单一音符”问题

这里情况变得棘手了。尽管人工智能现在稳定且一致,但它仍然无法真正掌握性格

研究人员对人工智能进行了完整的“性格身份证”测试(同时测试所有五种特质)。

  • 预期:人工智能应该答对整张卡片(例如:高开放性、低尽责性、高外向性等)。
  • 现实:人工智能对单个特质的得分还可以,但当你观察整体情况时,它基本上是在猜测。它的正确率约为 9%,这仅仅比掷骰子好一点点。

比喻:想象一个学生参加五门不同科目的考试。

  • 在“数学”部分,他得了 A。
  • 在“历史”部分,他得了 A。
  • 在“艺术”部分,他得了 A。
  • 但当你查看他的最终成绩单时,分数的组合是错误的,因为他误解了这些科目之间的联系。

该论文认为,先前的研究就像这样:它们一次只看一门科目,然后说“干得好!”但真正的目标是答对整张成绩单。人工智能未能通过完整的测试。

4. 为什么会失败?

研究人员发现,人工智能正在“幻觉”出联系。

  • 示例 1:人工智能看到了“派对”和“有趣”这样的词,心想:“这个人绝对是外向的!”但这篇文章实际上是在讲一个人出去却被困在家里。人工智能错过了上下文。
  • 示例 2:人工智能看到有人抱怨家庭作业,心想:“这个人很懒(低尽责性)。”但实际上这个人非常有组织,只是今天状态不好。

教训:人工智能用来训练的文章没有提供足够清晰的“线索”,让它能够学习人类性格那种深层、复杂的混合体。这就像只给人看一盒蜡笔,而不展示实际的画作,却试图教人画出一幅杰作。

5. “安全过滤器”是否搞砸了?

有些人担心人工智能的“安全设置”(阻止其说粗鲁或危险内容的过滤器)可能会干扰性格测试。
发现:他们测试了“未审查”版本的人工智能(即关闭了安全过滤器的机器人)。结果是一样的。安全过滤器并不是问题所在;人工智能只是 genuinely 无法从提供的文章中学习到复杂的性格。

6. 结论:“移动球门”

这篇论文的标题问道:“我们是否在移动球门?”

  • 旧方法:研究人员会说:“看!人工智能答对了‘外向性’的分数!”并称之为成功。
  • 本文观点:那是作弊。如果你正在踢足球,你不能仅仅因为把球踢得很用力就说你赢了;你必须真正将球踢进网内。由于人工智能无法答对整个性格画像,之前的“成功”具有误导性。

最终结论
微调使人工智能变得稳定(它不再改变主意),但并没有使其变得准确(它仍然没有真正理解复杂的性格)。为了解决这个问题,作者建议我们需要更好的训练数据——也许是互动式对话,让人工智能可以提出问题并随时间收集更多线索,而不仅仅是阅读静态文章。

简而言之:我们教会了人工智能成为一个一致的演员,但我们还没有教会它如何真正成为那个角色。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →