Query Circuits: Explaining How Language Models Answer User Prompts
本文介绍了“查询电路”(query circuits),这是一种追踪语言模型内特定输入信息流的方法,旨在为单个输出提供忠实、稀疏且计算可及的解释,并通过一种名为归一化偏差忠实度(Normalized Deviation Faithfulness, NDF)的新指标进行了验证,并在多个基准测试中得到了展示。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
将大型语言模型(LLM)想象成一座繁忙的大型城市,拥有数百万条道路、交叉路口和红绿灯。当你向模型提问(即“提示词”)时,就像是派遣一辆送货卡车穿过这座城市去投递一个答案。
长期以来,研究人员一直试图理解这座城市是如何运作的,通过绘制通用交通模式。他们知道,例如,“路线 A”总是在城市需要寻找隐藏物体时被使用,或者“路线 B”用于解决数学问题。这些被称为能力电路(capability circuits)。
然而,了解通用路线并不能解释为什么今天的卡车会为了你特定的任务而选择特定的路径。也许是因为某个施工区、一次突发的绕行,或者是一个仅对这次行程有意义的独特红绿灯。
这篇论文介绍了一种观察这座城市的新方法:查询电路(Query Circuits)。研究者不再关注通用的地图,而是想要追踪对于你提出的特定问题,卡车所走的精确且微小的路径。
以下是利用简单类比对他们发现的解析:
1. 问题所在:“代理”地图是错误的
此前,为了理解一次特定的行程,研究人员尝试构建一个微型的、简化的城市模型(即“代理模型”)并追踪路径。
- 类比: 想象一下,你试图通过用乐高积木搭建一个纽约市的玩具模型,来理解一场复杂的交通拥堵。你在乐高模型上追踪路径,希望它能匹配真实的城市。
- 问题: 论文指出,这些乐高模型往往无法完美匹配真实的城市。它们会丢失细节,而且构建过程既缓慢又昂expensive(昂贵)。作者们想要直接在真实的城市(实际的模型)中追踪路径,而不需要一个玩具版本。
2. 解决方案:“Best-of-N”彩票
作者发现,寻找针对一个特定问题的精确路径出人意料地困难。如果你只观察一个问题的交通灯,数据往往是“多噪”的(就像收音机里的静电噪音),导致很难看清真实的路径。
- 类比: 想象你正在试图寻找一张中奖彩票,但彩票上的数字有些模糊。如果你仅凭一张彩票就试图选出中奖号码,你可能会选错。
- 解决方法: 作者提出了一种称为 Best-of-N (BoN) 的方法。
- 拿出你的原始问题。
- 用 9 种不同的方式(改写)向模型询问同一个问题。这就像是问“天空是什么颜色的?”对比“描述一下晴天时天空的颜色”。
- 追踪这 10 个版本的路径。
- 挑选赢家: 选择那个效果最好的路径。
- 结果: 尽管原始问题是“模糊”的,但其中一个改写后的版本足够清晰,足以揭示真实的、隐藏的路径。通过检查多个版本,他们找到了这张“中奖彩票”,从而准确地解释了模型是如何回答问题的。
3. 新的计分卡:NDF
为了知道是否找到了正确的路径,他们需要一种衡量成功的方法。旧的计分卡(称为 NFS)在处理复杂问题时是失效的;它会给出像“200%”或“-50%”这样的分数,这毫无意义。
- 类比: 这就像一个速度计,当你实际以每小时 60 英里行驶时,它有时会显示你正以每小时 100 英里的速度倒车,或者以每小时 500 英里的速度前进。
- 解决方法: 他们发明了一种新的评分指标,称为 NDF(归一化偏差忠实度,Normalized Deviation Faithfulness)。这是一个可靠的速度计,数值始终保持在 0 到 1 之间。
- 1.0 意味着他们找到的路径是完美的(它完全解释了模型的答案)。
- 0.0 意味着该路径毫无用处。
- 这个新的计分卡使他们能够信任自己的发现,即使是在医学考试或天文学等困难主题上。
4. 大惊喜:城市大部分是空的
最令人兴奋的发现是,对于任何单个问题,模型并不会使用整座城市。它只使用一个微小的、特定的街区。
- 类比: 你可能认为送货卡车需要使用城市中 50% 的道路才能从 A 点到达 B 点。但作者发现,对于一个特定的问题,卡车仅使用了大约 1.3% 的道路。
- 证据: 他们展示了如果封锁 98.7% 的城市,只允许卡车使用这 1.3% 的微小路径,它仍然能在 60% 的时间内正确回答问题。这证明了模型的“大脑”在处理单个任务时是极其稀疏且高效的。
总结
这篇论文介绍了一种新工具,用于解释 AI 究竟如何回答一个特定的问题。
- 他们不再使用“玩具模型”,而是直接观察真实的 AI 内部。
- 他们意识到,通过以不同的方式询问同一个问题,有助于揭示 AI 思维方式中隐藏的“真相”。
- 他们创造了一种更好的方式来衡量他们的解释是否正确。
- 他们证明了对于任何单个问题,AI 只使用其庞大大脑中极小且特定的部分来完成工作。
这让我们从了解“AI 泛泛而言是如何做数学题的”,转向理解“AI 是如何解决这个数学问题的”。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。