← 最新论文
💬 NLP

Hyperdimensional Probe: Decoding LLM Representations via Vector Symbolic Architectures

本文介绍了超维探测器(Hyperdimensional Probe),这是一种利用向量符号架构(Vector Symbolic Architectures)来统一以输入为特征的提取与以输出为导向的分析的混合方法,从而克服现有可解释性技术的局限性,为大语言模型的表示提供更深层的语义洞察。

原作者: Marco Bronzini, Carlo Nicolini, Bruno Lepri, Jacopo Staiano, Andrea Passerini

发布于 2026-07-22
📖 1 分钟阅读☕ 轻松阅读

原作者: Marco Bronzini, Carlo Nicolini, Bruno Lepri, Jacopo Staiano, Andrea Passerini

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正在试图弄清楚一个超级聪明的机器人是如何思考的。你可能听说过大语言模型(LLMs),它们是聊天机器人背后的 AI 大脑,能够写故事、解数学题并像人类一样聊天。但问题在于:尽管这些机器人非常神奇,但它们也是“黑盒”。我们可以看到输入的内容(一个问题)和输出的内容(一个答案),但内部那些混乱而神奇的思考过程又是怎样的呢?那是一个谜团。科学家们一直试图使用两种主要工具来窥探其内部。一种被称为“探测器”(probe)的工具,充当着翻译的角色,试图根据它看到的词汇来猜测机器人的想法。另一种工具是“稀疏自编码器”(Sparse Autoencoder, SAE),它试图将机器人的想法分解成一份长长的、简单的、独立的成分清单,就像一份食谱一样。但这两类工具都有盲点。翻译官侧重于面向输入的特征提取,但未能充分整合机器人如何实际回答的大局观;而食谱制作员则经常被噪声干扰,或者忽略了与最终输出之间的联系。我们之所以关心这一点,是因为如果我们不了解这些 AI 大脑是如何运作的,我们就无法完全信任它们,也无法在它们出错时修复它们。我们需要一种能够看到全貌的方法,而不仅仅是起点或终点。

于是,这篇论文引入了一种名为“超维探测器”(Hyperdimensional Probe)的新型混合侦探工具。你可以把它想象成一个超级强大的翻译官,它结合了旧工具的优点,同时修复了它们的缺陷。研究人员使用一种叫做“向量符号架构”(Vector Symbolic Architectures, VSAs)的技术构建了这个工具。如果你把机器人的大脑想象成一座巨大的思想图书馆,那么之前的工具要么是在尝试阅读书名(输入),要么是在数页数(输出),但它们无法理解故事是如何连接起来的。然而,超维探测器使用了一种特殊的“超向量代数”——这是一种高级的说法,意味着它使用高维数学,像组合积木一样将各种想法进行混合与匹配。它将传统探测器的“自上而下”视角与 SAE 的“稀疏性”(即整洁、有序的清单制作能力)统一了起来。

在实验中,作者发现这种新方法能够一致地提取出有意义的语义信息——基本上,它确实理解了机器人在思考什么——并且这种表现跨越了不同类型的 LLM、不同的规模以及各种设置。他们在两种特定场景下进行了测试:当机器人完成句子时(输入补全)以及当它回答问题时(侧重问答的文本生成)。结果表明,这种方法比旧方法更能发现清晰的概念。例如,它克服了仅观察机器人最终词汇选择(logits)的局限性,因为后者受限于机器人的有限词汇量。同时,它也避免了在使用 SAE 时,在概念本应清晰且有界限的情况下经常出现的“噪声”结果。通过让研究人员能够同时观察输入特征和输出特征,这项工作为实现对神经表示实际运作方式的更深层、更统一的理解指明了方向,架起了机器人如何感知世界与其如何表达世界之间的桥梁。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →