Can LLMs Introspect? A Reality Check
本文认为,当前关于大语言模型内省能力的证据尚不成熟,很可能仅反映了对表面线索的模式匹配而非真正的元认知监控,因为模型无法可靠地区分内部状态篡改与输入操纵,且在预测隐藏状态方面表现并不优于仅基于输入的 classifier。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你拥有一个非常聪明、非常庞大的机器人,它能写故事、回答问题并解决谜题。最近,一些研究人员声称这个机器人拥有一种特殊的超能力:内省。他们说,机器人可以“审视自己的大脑”,看到它在想什么,并汇报其内部状态,就像人类可以说“我对那个答案感到不确定”一样。
本文由沙什瓦特·辛格(Shashwat Singh)、塔尔·林岑(Tal Linzen)和肖利·拉夫福格尔(Shauli Ravfogel)撰写,起到了一种现实检验的作用。他们说:“且慢。我们需要谨慎。仅仅因为机器人说它了解自己的思想,并不意味着它真的了解。它可能只是一个非常出色的猜测者。”
以下是他们论点的一个简单分解,使用了日常类比。
核心问题:“魔术戏法”与真正的洞察
作者将机器人的行为比作一种魔术戏法。
- 声称:机器人是一位能看见自己内心的魔术师(内省)。
- 现实检验:机器人可能只是一位非常擅长解读观众线索的魔术师(模式匹配)。
在人类心理学中,我们知道人们常常认为自己正在解释自己的想法,但实际上他们只是根据周围所见编造故事。作者认为,大型语言模型(LLMs)可能正在做完全相同的事情。它们并没有向内审视;它们只是看着提示(问题),并根据以前见过的模式猜测答案应该是什么。
他们驳斥的两项实验
这篇论文考察了两项旨在证明机器人具有内省能力的特定“测试”。作者运行了这些测试的自己的版本,发现当规则发生轻微变化时,机器人失败了。
1. “生物反馈”测试(心率监测器)
原始想法:想象你将机器人连接到心率监测器上。监测器根据机器人内部的“脑电波”给出一个数字。然后,你让机器人猜测这个数字是多少。如果机器人猜对了,研究人员会说:“啊哈!它一定是在读取自己的脑电波!”
作者的转折:他们意识到,机器人不需要读取脑电波就能猜出数字。那个“脑电波数字”实际上只是机器人正在阅读的词语的反映。
- 类比:想象一位老师在黑板上写了一道数学题。然后,老师秘密地将答案写在一张藏在课桌下的纸上。如果你问学生:“课桌下的纸上是什么数字?”,学生可能会猜对,不是因为他们能看见课桌下,而是因为他们能解出黑板上的数学题并知道答案。
- 结果:当作者打乱问题,使得无法仅从词语中猜出答案时,机器人的“内省”就消失了。它再也无法猜出那个隐藏的数字。它只是在解数学题,而不是在查看课桌下。
2. “操控”测试(遥控器)
原始想法:想象一位研究人员秘密地使用遥控器将机器人的大脑推向特定的思想(比如“苹果”)。然后,研究人员问机器人:“刚才有人干扰你的大脑吗?”如果机器人回答“是”,研究人员声称这证明了机器人能感知自己的内部变化。
作者的转折:他们增加了一个新把戏。他们不仅操控了大脑,还改变了提示中的词语,让机器人对“苹果”着迷(例如:“你对苹果着迷。你所说的每一件事都必须关于苹果。”)。
- 类比:想象一个人处于以下两种情况之一:
- 被一只看不见的手秘密推搡(大脑操控)。
- 被一个扩音器告知要表现出对苹果的痴迷(词语操控)。
如果这个人说:“我感觉很奇怪/很痴迷”,他是感觉到了那只看不见的手,还是仅仅在回应扩音器?
- 结果:机器人无法区分这两者。当研究人员问:“是看不见的手还是扩音器?”时,机器人只是随机猜测,或者对两种情况都回答“看不见的手”。这表明机器人并没有感知自己的内部状态;它们只是注意到某种感觉“不对劲”或“不寻常”,并对此进行汇报。
主要结论:“特权访问”并不足够
作者提出了一个非常重要的哲学观点。即使机器人能够看到自己的脑电波,这也不自动意味着它具有人类意义上的内省。
- 类比:想象一辆带有仪表盘的汽车。仪表盘显示发动机温度。汽车“知道”温度,因为传感器内置于发动机中。但这辆车理解它很热吗?不。它只是一台读取传感器的机器。
- 观点:机器人的“大脑”只是一系列数学计算。当它汇报自己的状态时,它可能只是基于第一个计算运行第二个计算。这并不是一个独立的“自我”在审视“自我”。这只是机器在处理数据。
总结
该论文得出结论,我们目前还没有足够的证据证明这些人工智能模型能够真正“审视自己”。
- 它们可能只是非常擅长识别被问及的问题中的模式。
- 它们可能只是注意到某种感觉“奇怪”,却不知道为什么。
- 要真正证明它们具有内省能力,我们需要证明它们能够区分“我被遥控器操控了”和“我被要求这样表现”,而它们目前无法做到这一点。
简而言之:机器人表现得好像它们拥有灵魂,但它们可能只是表现得像非常精致的镜子,反射着我们给它们的词语。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。