D-Score: A Spectral Hidden-State Signal for Hallucination Detection in Large Language Models
本文介绍了 D-Score,一种用于大型语言模型的幻觉检测方法,该方法通过分析单次前向传播过程中隐藏状态激活的谱几何特征,来识别生成文本与模型内部知识之间的一致性问题,从而无需外部验证器或多次生成。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正走进一座图书馆,书中的书籍都是由一个非常有才华、但偶尔有点淘气的机器人编写的。这个被称为“大语言模型”(LLM)的机器人可以写故事、回答问题,并能以一种听起来完全像人类的方式与你聊天。但问题在于,它有时会编造事实。它可能会告诉你月亮是由绿奶酪制成的,或者某个著名的历史事件发生在错误的一天。这并不是因为机器人在故意撒谎,它只是对自己编造的事实过于自信了。我们把这种现象称为“幻觉”。
长期以来,捕捉这些谎言的唯一方法是将机器人的答案发送给第二个机器人或人类图书管理员,对照真实的数据库进行核实。这就像是请一名学生写论文,然后再雇佣另一位老师来评分。但如果学生自己的大脑能给我们提供线索呢?如果在机器人开始编造某些内容的那一刻,它的内部“思维过程”发生了某种我们可以观察到的变化,甚至在它完成整个句子之前,情况会怎样?这就是科学家们正在提出的问题:我们能否窥视机器人的内心,在它撒谎的过程中就将其识破,而不需要征求第二意见?
这正是这篇论文中的研究人员想要做的事情。他们引入了一个聪明的工具,叫做 D-Score。把机器人的大脑想象成一个巨大的、多维的舞池。每当机器人处理一个词时,它都会向这个舞池发送一个信号。当机器人谈论它非常熟悉且确定的事物时,舞者(信号)会移动得非常有组织、有节奏。他们会朝着同一个方向齐步走,就像一场排练精良的游行。这创造了一条“连贯”的路径。
然而,当机器人试图谈论它不了解或正在编造的事物时,舞池就会变得混乱。机器人试图说出一件事(那个编造的事实),但它的内部记忆却在低语:“等等,这听起来不对,”或者“我不确定这个。”这种冲突导致舞者们散开了。他们不再是紧凑地走在一条线上,而是开始同时向许多不同的方向扩散。有些舞者很困惑,有些试图纠正错误,还有些只是感到不确定。
D-Score 是一个简单的数学技巧,用于计算这些舞者移动的方向有多少个。如果舞者都在一条直线上行进,分数就很低。但如果他们散开变成了一群混乱的人群,分数就会上升。研究人员发现,当 D-Score 较高时,这是一个强烈的信号,表明机器人正在产生幻觉。
该团队在三个不同的机器人大脑(称为 Llama-2、Llama-3 和 Vicuna)以及两组不同的刁钻问题上测试了这个想法。他们发现,相比于那些仅仅观察机器人有多“惊讶”或重复多少次答案的方法,D-Score 在识别谎言方面表现得更好。事实上,在某些测试中,D-Score 在捕捉幻觉方面的表现比之前的最佳方法高出近 10 个百分点。
让这件事如此令人兴奋的是它的简单性。D-Score 不需要检查数据库,不需要让机器人对同一个问题回答五次,也不需要第二个机器人来帮忙。它只需要观察机器人单次对话过程中的内部信号。研究人员认为,这是因为机器人的这种内在的“不确定性”或“冲突”在其思维过程中留下了可见的指纹。
当然,论文也谨慎地指出,这并不是能抓住每一个谎言的魔杖。如果机器人编造的一个事实是它内部完全没有记忆内容的,那么舞池可能不会变得混乱,D-Score 也可能保持在较低水平。但对于那些机器人内部能够感知到的谎言,这种新的“光谱”信号是一种通过倾听机器人自身内部节奏来当场抓获它们的强大方式。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。