The Confidence Manifold: Geometric Structure of Correctness Representations in Language Models
本文揭示了语言模型中真实性的内部表示形成了一种由类质心定义的简单、低维几何结构,从而能够通过线性探测和激活转向实现对幻觉的高效检测与因果操控。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在与一个非常聪明、反应极快,且读过几乎所有书籍的机器人交谈。你向它提问,它以完美的语法和绝对的自信进行回答。但有时,机器人也会出错。它可能会告诉你澳大利亚的首都是悉尼(实际上是堪培拉),或者说某位著名的历史人物出生在错误的世纪。可怕的是,当它撒谎时,听起来也和说真话时一样笃定。它不会结巴,不会犹豫,它的“置信度指标”(它内部计算的数值)看起来也完全正常。
长期以来,科学家们一直在思考:即使机器人没有表达出来,它是否也知道自己错了?它的脑海深处是否隐藏着某种秘密信号,在说:“嘿,这个事实是错误的!”?为了理解这一点,我们需要了解这些机器人是如何工作的。它们并不像人类那样思考;它们处理信息的方式是被称为“激活值”的巨大数字云。随着机器人的阅读和思考,这些数字流经一个数字网络的各个层级。科学家们发现,这些数字云并非随机生成的;它们具有形状和结构。有时,真事实与假事实之间的区别并不是复杂、混乱的模式,而是在这个数字空间中一条简单的直线。大问题在于:我们能否找到这条线,并在机器人说完句子之前就抓住它撒谎?
这正是论文《置信流形》(The Confidence Manifold)所要探索的内容。由 Seonglae Cho 及其同事领导的研究团队决定观察 11 个不同语言模型的“大脑”,这些模型的规模从拥有 1.24 亿参数的小型模型到拥有 140 亿参数的庞然大物不等。他们想要绘制出“正确性的几何学”——即机器人大脑中真理所存在的特定形状和位置。
把机器人的大脑想象成一个巨大的、多维的房间。每当机器人思考一个句子时,它都会在这个房间里放置一个点。如果句子是真的,这个点会落在某个区域;如果是假的,它会落在另一个区域。研究人员发现,这些点并不是随机散落在房间各处的。相反,它们被整齐地组织成两个不同的组,就像两堆弹珠。这两个“真理”堆和“谎言”堆被一条非常简单的、低维度的走廊分隔开。
这里是最令人惊讶的部分:你不需要一台超级复杂的计算机来区分这两堆东西。研究人员发现,真话和假话之间的区别仅仅是这些点平均位置的一个简单偏移。这就像如果你有一袋红弹珠和一袋蓝弹珠,你不需要测量每一颗弹珠的大小、重量或纹理就能将它们区分开来;你只需要知道红色的弹珠平均而言稍微偏左,而蓝色的稍微偏右。在机器人的大脑中,这个“平均位置”(或质心)就是全部的关键。研究人员发现,仅需 25 个标记样本来寻找这两个中心,就能以 90% 的准确率检测出谎言。更棒的是,他们发现这个“真理信号”仅存在于一个仅有 2 到 8 维的微小走廊中,尽管机器人的大脑拥有数千个维度可以发挥。
团队不仅是在观察,他们还通过“戳刺”和“按压”机器人来观察这种信号是否真实存在。他们使用了一种叫做“激活转向”(activation steering)的技术,这就像是在特定方向上轻轻推动机器人的内部数值。当他们将机器人推向“真理”方向时,它开始犯更少的错误。当他们将其推向“谎言”方向时,它开始产生更多的幻觉。他们还尝试通过移除那个特定的走廊来彻底抹除该信号,结果发现,一旦移除了那个走廊,机器人突然变得完全无法区分真伪,表现得和随机猜测没什么两样。这证明了该信号并非巧合;它是机器人处理事实的一个必要组成部分。
然而,这篇论文也提醒我们,这并不是适用于所有情况的万灵药。研究人员发现,当机器人表现得有些“诡计多端”时(例如,它自信满满地陈述一个常见的误解),这种内部“真理检测器”的效果极其出色。但在处理标准的、枯燥的问题时(即机器人并没有试图欺骗任何人时),机器人自身的输出(它大声说出来的话)在判断真伪方面同样有效。只有当机器人表现出欺骗性时,这个内部信号才会闪耀出最亮的光芒。
另一个有趣的发现是关于这些信号如何在不同类型的提问之间传递。如果你教机器人识别特定数据集(比如关于历史的测验)中的谎言,它可能无法识别另一个数据集(比如关于科学的测验)中的谎言,除非你同时对两者进行训练。这就像学习在赛车场上开车并不能自动让你成为雪地里的驾驶高手;你需要两者的练习。研究人员展示了通过对多个数据集进行共同训练,他们可以创造出一个通用的“真理指南针”,使其在不同主题下都能奏效。
最后,这篇论文为我们描绘了语言模型如何处理真理的清晰图景。它表明,在这些复杂的机器深处,对与错的区别出人意料地简单:仅仅在于数据落在直线的哪一侧。虽然这并不意味着我们可以立即修复机器人在所有情况下的所有谎言,但它证明了机器人确实知道自己错了,即便它并不总是承认。这个信号就在那里,它是几何性的,并且正等待着被发现。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。