Localizing Anchoring Pathways in Language Models
本文研究了 7B–8B 参数规模的 Qwen 和 Llama 模型中锚定效应(anchoring effects)的内部机制,揭示了边缘级归因方法比节点级方法能更准确地定位相关的决策信号,并且虽然这些路径在模型内部的不同锚定方向上保持一致,但在基座模型与指令微调变体之间会发生显著偏移。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,将一个大型语言模型(LLM)视为一位超级聪明但有点容易受骗的侦探。你给它一个谜题来解,但同时你在对话中塞进了一个随机且无关的数字——比如告诉侦探:“顺便说一下,彩票号码停在了 15,”然后问他:“月球绕地球运行需要多少天?”
尽管侦探知道正确答案是 27 天,但那个随机的“15”可能会让他们过度倾向于 15。这被称为锚定效应(Anchoring)。这是一种认知偏差,即一个无关的数字会将你的判断拉向它。
这篇论文就像是一个机械工程师团队,正在对那位侦探进行拆解,以观察其大脑内部究竟是在哪里发生了这种“易受骗性”。他们想要知道:计算机内部哪些具体的电线和开关正在传输那条名为“嘿,那个随机数字很重要!”的信号?
以下是他们是如何做的以及他们的发现,用简单的语言解释如下:
1. 实验设置:一场受控的游戏
研究人员没有让侦探写长篇大论,而是将测试变成了一个多选题游戏。
- 问题: “月球轨道运行需要多久?”(正确答案:27 天)。
- 陷阱: 他们加入了一个带有随机数字的句子,要么是“低锚点”(15),要么是“高锚点”(49)。
- 目标: 他们测量了模型的置信度在多大程度上仅仅因为提到了那个数字,就向错误答案(15 或 49)偏移。
他们证实了模型确实会被迷惑,就像人类一样。
2. 方法论:追踪电线
为了找到“易受骗电路”,研究人员使用了一种称为**电路定位(Circuit Localization)**的技术。
- 类比: 想象模型是一个巨大的城市,拥有数百万条连接各个社区(节点)的道路(边)。
- 旧方法: 研究人员过去通过观察整个社区(节点)来查看哪里交通繁忙。
- 新方法: 本篇论文发现,观察单条道路(边)效果要好得多。这就像意识到问题不在于整个“市中心”社区,而在于连接市中心与郊区的那座特定的桥。
他们发现,边级方法(edge-level methods)(观察连接方式)在寻找偏差方面,比节点级方法(node-level methods)(仅观察组件本身)要准确得多。这种“易受骗性”并不存在于某个特定的脑部区域,而是在信息传输的路径中。
3. 研究结果:地图揭示了什么
A. “低锚点”和“高锚点”使用相同的道路
无论模型是被低数字(15)还是高数字(49)所迷惑,流量都会流经几乎完全相同的道路。
- 隐喻: 这就像一条河流。无论水流是湍急(高锚点)还是缓慢(低锚点),它使用的都是同一条河床。模型拥有一个共享的“易受影响路径”,无论数字是大是小,都会受到影响。
B. “基座模型”与“指令微调模型”
研究人员测试了同一模型的两个版本:
- 基座模型(Base Model): 未经训练的原始侦探。
- 指令微调模型(Instruction-Tuned Model): 经过训练、能够遵循规则并礼貌回答问题的侦探。
令人惊讶的发现: 虽然它们使用相同的通用“河床”(相同的网络层),但在训练后,最重要的特定道路发生了变化。
- 隐喻: 想象你教司机一条新路线。他们仍然行驶在同一个城市,但他们前往目的地所走的具体街道已经改变了。“指令微调”(训练)重构了最重要的连接。在原始模型上运作完美的电路,在经过训练的模型上并不总是有效。
4. 大局观
这篇论文证明了锚定效应不仅仅是模型知识中的一个“小故障”。它是一个特定的、机械的过程,即无关的数字劫持了模型的决策路径。
- 核心要点: 偏差通过**连接(边)**传播,而不仅仅是孤立的部分。
- 核心要点: 低锚点和高锚点共享同一条“高速公路”,但教授模型新规则(指令微调)会改变该高速公路上哪些出口最为重要。
简而言之,研究人员绘制了 AI 内部的“易受骗性”地图,向我们展示了当模型被随机数字分散注意力时,究竟是哪些电线在传输信号。这有助于我们理解,模型不仅仅是“错了”;它是在遵循一条特定的、可预测的路径,从而导致其误入歧途。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。