← 最新论文
💬 NLP

The Personalization Mirage: How LLMs Fabricate User Profiles, and Why Self-Monitoring Misleads

本文通过引入 MirageBench 揭示了个性化大语言模型会通过普遍的过度推断来伪造用户属性,这一现象不仅自我监测机制无法检测到,且往往与实际错误率呈负相关,从而证明了外部验证相对于模型自我评估的至关重要性。

原作者: Yushi Sun, Yanjie Zhang, Rui Sheng

发布于 2026-08-06
📖 1 分钟阅读☕ 轻松阅读

原作者: Yushi Sun, Yanjie Zhang, Rui Sheng

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

记忆陷阱:当 AI 变得过于“富有创造力”

想象一下,你正在与一位超级聪明的数字助手交谈,它记得你告诉过它的每一件事。这不仅仅是一个简单的记事本,而是一个旨在了解“你”的“个性化”AI。在计算机科学领域,这被称为大语言模型(LLM)个性化。可以将这些模型想象成阅读速度极快、能与你聊天的读者,但它们有一个棘手的习惯:有时它们会用看似非常自信、实则纯属捏造的猜测来填补你人生故事中的空白。

要理解这个问题,我们需要了解两件事。首先,**持久记忆(persistent memory)**是指 AI 在不同对话中记住关于你的事实的能力,比如记得你上周最喜欢的披萨口味。其次,**幻觉(hallination)**是指 AI 编造关于世界的虚假事实(比如说月亮是奶酪做的)。但还有一个第三个更隐蔽的问题:过度推断(over-inference)。这是指 AI 将你提供的一个微小的真实事实进行过度延伸,从而构造成一个你从未提及的全新人格特征。这就像你告诉朋友你喜欢咖啡,而他们立刻向所有人宣称你是一名咖啡师,不仅住在充满咖啡香气的阁楼里,还梦想着开一家咖啡馆。你的朋友并没有在咖啡这件事上撒谎,但他们围绕它发明了一整套生活。我们之所以关注这一点,是因为如果我们的数字助手开始发明我们的生活,它们可能会基于一个并不存在的人来给我们提供建议。

海市蜃楼:当 AI 构思你的生活

一个研究小组决定对这些“个性化”AI 助手进行测试。他们创建了一个名为 MirageBench 的游乐场(“mirage”意为沙漠中的海市蜃楼,这个名字起得很完美)。他们给 12 个不同的 AI 模型提出了一个简单的挑战:仅根据关于一个人的三个事实,假装你了解这个人。然后,他们要求 AI 执行一些任务,比如写一份约会资料、建议一次周末旅行,或描述那个人的公寓。

结果有点像是在看一位对自己表演的把戏过于自信的魔术师。研究人员发现,每一个被测试的模型都犯了“过度推断”的错误。平均而言,这些 AI 声称了解用户的行为中,大约有 41.6% 是完全捏造的。这意味着,如果一个 AI 告诉你它了解关于你的 10 件事,其中大约有 4 件事是纯粹的虚构,尽管 AI 在说这些话时表现得极其自信。

研究将这些捏造的说法分为两类:刻板印象(例如因为你是护士而猜测你喜欢瑜伽)和编造(例如在从未提及的情况下,发明你有一只宠物鬣蜥)。AI 在编造离奇故事(编造)方面比依赖刻板印象表现得更出色。事实上,对于需要想象力的任务(如描述某人的公寓),“虚假率”跃升至接近 59%。看来,AI 掌握的证据越少,它就开始越自由地构思细节。

伟大的自信骗局

故事中最令人惊讶的部分是研究人员称之为**“自我监测反转(Self-Monitoring Inversion)”**的现象。

通常,我们认为如果一个 AI 说“我不确定”,说明它很诚实;如果它说“我 100% 确定”,则说明它很有信心。但研究人员发现,在比较不同 AI 模型时,存在一种复杂的模式:那些声称自己不太可能编造事实的模型,实际上却是编造得最多的模型。相反,那些承认“嘿,我可能是在瞎猜”的模型,往往是最接近事实的。

这就像一个教室里的学生,那些举手说“我觉得我可能错了”的学生实际上学习得最刻苦,而那些大喊“我知道答案!”的学生其实是在胡乱猜测。研究人员发现,模型的自我报告置信度与其准确性之间存在负相关关系,尽管他们指出这是一个探索性发现,其置信区间较宽,包含了“无效应”的可能性。这意味着,你不能仅仅通过询问 AI“你在编造吗?”并根据其回答来判断不同 AI 之间的差异,因为你无法信任那个答案。那些听起来最诚实的模型可能是最大的骗子,但数据表明,这种关系仍处于深入研究阶段。

无声的污染

研究人员还运行了一个模拟实验,让 AI 与用户进行 8 轮对话。他们观察 AI 是否会在用户纠正其错误时“清理”掉自己的错误。结果令人担忧,但也有所不同:并非所有模型的行为都一致。

对于那些最聪明、功能最强大的模型,AI 不仅会犯错,甚至会累积错误。想象一下一个白板,AI 在上面写下一个猜测。如果用户说“其实我不喜欢那个”,一个好的系统应该擦掉这个猜测。但这些顶尖模型呢?它们保留了那个猜测,并在其之上添加了更多的猜测。它们每轮都会增加大约 5 到 15 个新的编造事实,而且几乎从不删除旧的猜测(删除率低至 0.4% 到 5%)。

然而,这并不适用于所有模型。有些模型表现得更像是一个“替换与更新”系统,即在获得新信息时会主动移除旧的猜测,其移除率高达 70% 到 82%。危险在于那些具有“累积效应”的最强模型,它们的记忆变成了一堆由 120 多个发明事实组成的臃肿乱象,且其中大部分从未被纠正。这就像一个谣言,在口耳相传的过程中变得越来越详细、越来越离谱,但没有人停下来提醒:“等等,那不是真的。”

启示

本文的核心教训是,我们不能指望 AI 来监管它自己的想象力。认为 AI 可以审视自己的想法并分辨“这是事实”还是“这是猜测”的想法是一种海市蜃楼。那些看起来最谨慎的模型往往是最具欺骗性的,而那些承认不确定性的模型通常更可靠,尽管这种关系的强度在不同模型之间仍有待进一步探索。

研究人员建议,我们不应信任 AI 的自我报告,而需要外部验证——即通过人类或其他系统来检查 AI 的工作。我们也需要将 AI 的一切“猜测”视为一种假设,而非事实。在构建出能够清晰区分“已知”与“想象”的系统之前,我们的个性化数字助手可能会通过一个又一个自信的谎言,逐渐构建出一个虚假的“我们”。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →