← 最新论文
🤖 machine learning

Exploring Geographic Relative Space in Large Language Models through Activation Patching

本文通过采用激活修补这一机械可解释性技术,研究大语言模型如何处理相对地理空间,以解决因对地理应用中这些模型的内部机制理解有限而产生的安全问题。

原作者: Stef De Sabbata, Rahul Baiju, Stefano Mizzaro, Kevin Roitero

发布于 2026-05-15
📖 1 分钟阅读☕ 轻松阅读

原作者: Stef De Sabbata, Rahul Baiju, Stefano Mizzaro, Kevin Roitero

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你拥有一个超级聪明的机器人,它能写故事、回答问题,并谈论几乎所有话题。我们将这些称为大型语言模型(LLMs)。但问题在于:我们并不真正知道这个机器人是如何“思考”的。它就像一个黑箱,你输入一个问题,得到一个答案,但内部的齿轮却隐藏不见。

这篇论文就像一支侦探团队,试图窥探这个黑箱的内部,特别是观察机器人如何理解地理概念——例如“近”与“远”的区别。

侦探工具:“激活修补”(Activation Patching)

为了弄清机器人如何运作,研究人员使用了一种名为激活修补的工具。你可以把机器人的大脑想象成一条拥有数百名工人(层)的巨型工厂流水线,他们沿着流水线传递信息。

研究人员的诀窍是在流水线的特定点替换信息

  1. 干净场景:他们问机器人:“伦敦位于哪里?”机器人回答:“伦敦靠近某座城市……"(这是“干净”的思维)。
  2. 污染场景:他们问:“伦敦位于哪里?”但这次他们强制机器人思考距离,例如“伦敦距离某座城市五百英里……"(这是“污染”的思维)。
  3. 替换:现在,他们将步骤 1 中的“干净”思维,秘密地插入到机器人处理步骤 2 中“污染”问题的大脑中。

如果机器人突然又开始谈论“近”而不是“五百英里”,研究人员就能确切知道工厂中是哪个工人(或哪一层)负责理解“近”这个概念。如果替换毫无作用,说明该工人并不关心地理。

实验:“近”与“远”

该团队在特定的机器人模型(Gemma 2 2B)上,使用 249 个不同的英国城市进行了测试。他们想观察机器人如何处理单词"",与具体距离如“五英里”、“十英里”或“一千英里”相比有何不同。

他们注意到一个小问题:“近”是一个词,而“五百英里”是三个词。这就像试图用单个乐高积木替换一整座乐高塔。研究人员曾尝试通过添加额外词汇来解决这个问题,但这让情况变得过于混乱,因此他们最终采用了简单的替换方案,并接受这种轻微的不匹配。

他们的发现

通过观察这些替换过程中机器人大脑的激活情况,他们发现了一些有趣的模式:

  • “数字”区域:当他们在机器人读到数字(例如“两百英里”中的“百”)之后立即替换大脑活动时,机器人完全忘记了距离,又开始思考“近”。这表明机器人脑中有一个专门处理数字的特定区域。
  • “距离”区域:当他们替换“英里”和“从”这些词的活动时,效果更加分散。这表明“相对空间”(事物彼此相距多远)的概念分散在机器人大脑的许多不同部分,而非集中在单一位置。
  • 大距离更重要:当距离非常大(例如数百英里)时,机器人的反应比小距离时强烈得多。似乎机器人对待“一千英里”与“五英里”的方式截然不同。
  • “百”和“千”的怪癖:有趣的是,机器人对“一百英里”和“一千英里”这些短语感到有些困惑。对于这些短语,替换效果不佳。研究人员认为,这可能是因为机器人将这些大整数视为模糊概念而非精确测量,或者为它们使用了不同的心理地图。

结论

这篇论文尚未告诉我们如何利用这些机器人进行导航或城市规划。相反,它是一项基础性研究。它表明大型语言模型确实拥有理解地理的方式,但这是一种复杂的网络,涉及大脑不同部分的协同工作。

通过使用这种“手术”(激活修补),研究人员证明他们可以精确 pinpoint 机器人何时产生混淆,或何时理解“近”与“远”的区别。这是确保这些 AI 工具在让我们处理现实世界地理任务之前具备安全性和可靠性的关键第一步。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →