Representation Without Control: Testing the Realization Effect in Language Models
本文表明,尽管大语言模型表现出对提示敏感的行為转变,并拥有“实现效应”的线性可解码内部表征,但无法因果性地操控这些表征以改变风险决策,揭示了潜在读出不一定意味着下游决策真正依赖于这些表征。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你有一个非常聪明、非常健谈的机器人,它能假装是人类。你向它提出关于金钱、赌博和风险的问题,希望它能像人类在现实生活中做选择那样行事。但这里有一个关键问题:这个机器人真的在像人类一样“思考”,还是仅仅擅长根据你提问的方式猜测该说什么话?
这篇论文利用一个著名的心理学技巧——“实现效应”(Realization Effect)——对这个机器人进行了测试。
设置:“开放”与“封闭”的钱包
在现实生活中,人类的行为会根据盈亏是“开放”(账面)还是“封闭”(已实现)而有所不同。
- 开放(账面): 想象你在一张刮刮乐彩票中赢了 50 美元,但尚未兑现。你可能会觉得自己仍“在游戏中”,从而冒更大的风险以翻倍资金。
- 封闭(已实现): 想象你已经兑现了那 50 美元,把它放进口袋,然后又把它输掉了。你可能会觉得那笔钱已经没了,从而变得更加谨慎。
研究人员问道:人工智能是否知道“开放”钱包和“封闭”钱包之间的区别,并且是否真的因此改变其行为?
他们通过三种方式测试了人工智能,就像在警察调查的三个不同层级检查嫌疑人一样。
层级 1:“表演”测试(行为)
首先,他们只是让人工智能回答问题。
- 结果: 人工智能确实根据故事中资金是“开放”还是“封闭”而改变了答案。它对词语很敏感。
- 问题所在: 但它表现得并不像真正的人类。当人类在“开放”账户中输钱时,他们会变得鲁莽。而当人工智能在“开放”账户中输钱时,它并没有以同样的方式变得鲁莽。它只是在模仿答案的形状,而非其背后的逻辑。
层级 2:"X 光”测试(读取大脑)
接下来,研究人员查看了人工智能的“大脑”(其内部数学层),以确认其中是否真的存储了“开放与封闭”的概念。
- 结果: 他们找到了!在人工智能的特定层(第 18 层)中,有一个清晰、可读的信号。如果你查看数学计算,就能确切地分辨出哪些提示是“开放”的,哪些是“封闭”的。
- 比喻: 这就像在一所房子里发现了一个明确标记为“厨房灯”的开关。你能看到开关,也知道它连接着厨房。
层级 3:“遥控器”测试(因果控制)
这是最重要的部分。如果人工智能真的“理解”了这个概念,那么我们应该能够翻转那个内部开关,迫使人工智能改变其想法。
- 实验: 研究人员使用“遥控器”(激活导向)在人工智能回答问题时,手动翻转其大脑中的那个“开放与封闭”开关。他们试图强迫人工智能表现得好像拥有“开放”钱包或“封闭”钱包。
- 结果: 什么也没发生。 尽管他们能看到开关并翻转它,但人工智能关于赌博和风险的最终决定并未改变。
- 比喻: 这就像找到一个标记为“厨房灯”的开关,将其打开和关闭,却发现厨房的灯并没有亮。开关确实存在,但它实际上并没有连接到灯泡。它只是一个装饰品。
主要结论
该论文得出结论:仅仅因为人工智能能说出正确的词语(层级 1)并且其大脑内部有一个可读的“开关”(层级 2),并不意味着该开关实际上控制着它的行为(层级 3)。
- 人类身上的“实现效应” 是一种深层的因果机制:我们对金钱的感觉会改变我们的赌博方式。
- 该人工智能身上的“实现效应” 仅仅是一种表面模式。人工智能注意到了“开放”和“封闭”这些词并调整了其词汇,但它并没有真正利用这一概念来做出最终决定。
核心要点:
不要仅仅因为人工智能给出了类似人类的答案,就假设它在像人类一样“思考”。它可能只是一个非常优秀的演员。要证明它真的在“思考”,你必须展示你能深入内部,翻转一个开关,并让它做出不同的事情。在本例中,研究人员尝试翻转了开关,但人工智能纹丝不动。
简而言之: 人工智能拥有该概念的词语,也拥有该概念的内部信号,但它没有对其行为的控制权。信号确实存在,但它并没有发挥任何实际作用。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。