Reality Monitoring in Large Language Models: Self-Knowledge That Transforms with Conversation Memory
本文表明,大型语言模型区分自身生成内容与用户输入的能力(现实监测能力)高度依赖于对话记忆结构,揭示了其性能在情境性延迟下会发生退化,并且现有的基准测试未能捕捉到当模型承担自主、多轮角色时,准确率与置信度之间存在的关键分离现象。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明
想象一下,你正走在一座巨大且繁忙的图书馆里,书里的书竟然能和你对话。有时,一本书会向你低声诉说一个事实;有时,另一本书则会在自己的页面上开始自主编写一个新的故事。在人类心理学的世界里,有一种被称为“现实监测”(reality monitoring)的超能力。这种心理肌肉能让你分辨:“等等,我刚才听到的这句话是来自朋友,还是我自己想象出来的?”如果这块肌肉变得虚弱,人们可能会开始相信自己的白日梦就是真实的新闻,或者忘记医生曾告诉过他们某些重要的信息。这不仅仅关乎记住事实,更关乎知道你的想法究竟源自何处。
现在,想象一下我们将这个超能力测试交给了一个非常聪明的计算机程序——大型语言模型(LLM)。这些是能够编写故事、解决问题并与我们聊天的 AI 大脑。我们知道它们正变得越来越擅长交谈,但它们能分辨出什么是它们自己编造出来的,什么是你告诉它们的吗?如果一个 AI 无法分辨这两者,它可能会不小心把自己的错误当成你提供的事实,或者在你想纠正它时感到困惑。这篇论文提出了一个简单但至关重要的问题:这些 AI 大脑能否区分它们自己的想法与周围的世界,尤其是在它们必须记住一段很长的对话时。
“谁说了什么?”的大考验
研究人员设计了一个游戏来寻找答案。他们给六个不同的 AI 模型提供了一系列词对。有时,AI 会看到一个完整的词对(比如“猫”和“老鼠”),然后只需重复第二个词。这就像是 AI “听到”了来自外界的声音。而另一些时候,AI 只会被展示第一个词(“猫”),然后必须自己构思出第二个词。这就像是 AI 在“想象”东西。之后,AI 必须扮演侦探的角色:“我刚才听到了这个词,还是我自己编造出来的?”
科学家们想看看,当对话简短精炼时,AI 是否能做到这一点;以及当对话变得漫长且混乱(就像与朋友进行一场持续数小时的真实聊天)时,它是否仍能做到这一点。
惊喜:全在于记忆的诡计
精彩的部分来了。当 AI 在一次性的快速对话(比如发一条短信)中接受测试时,它在识别自己编造的内容方面简直是个天才。它能 100% 正确地识别出自己“想象”出的词!这就像一个孩子刚画完一幅画,立刻就能意识到:“是我画的!”
但就在研究人员让 AI 等待并记忆一段较长对话中早先出现的词列表(即“延迟”测试)时,这个魔术表演破功了。突然间,AI 变得困惑了。它开始做与之前完全相反的事情:它对你告诉它的内容的记忆力变强了,却对它自己编造的内容变得极其糟糕。这就像是 AI 忘记了自己是创作者,转而认为自己只是反映所见之物的镜子。
研究人员发现,这不仅仅取决于 AI 的“大脑”有多“大”。一个拥有 700 亿参数的庞大 AI 并不一定比规模较小的 AI 做得更好。相反,这似乎取决于 AI 内部的“专家”团队是如何组织的。这不在于拥有一个更大的图书馆,而在于图书管理员是如何排列组合的。
反馈陷阱:当纠正反而适得其反
科学家们还尝试了一个新花招:在 AI 每次做出判断后,都告诉它对或错。你会觉得这会有帮助,对吧?就像老师纠正学生一样。
令人惊讶的是,对于某些 AI 来说,这种反馈反而让情况变得更糟。它不仅没有修复错误,反而扰乱了它们的信心。有些模型虽然能答对答案,却失去了知道自己“答对了”的能力。它们变得像是一个对自己极其自信的人,即便在完全错误的情况下也依然坚信自己是正确的。事实上,对于某个特定的模型,反馈甚至让它的思维“颠倒”了,使其自信满满地说出与事实截然相反的话。
这项研究表明,当我们开始使用这些 AI 来从事严肃的长期工作时(例如协助医生或律师),我们不能只问:“你知道答案吗?”我们必须问:“你知道这个答案是从哪里来的吗?”因为如果一个 AI 无法分辨它的“幻觉”与你的真实事实之间的区别,它可能会自信满满地将我们引向错误的道路。论文指出,仅仅让 AI 变得更大并不是解决方案;我们需要弄清楚如何帮助它们为自己的思想保留一份清晰的日志,尤其是在对话变得漫长且复杂的时候。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。