← 最新论文
🤖 machine learning

ActivationReasoning: Logical Reasoning in Latent Activation Spaces

本文介绍了 ActivationReasoning,这是一个通过将稀疏自编码器特征映射为逻辑命题,从而将显式逻辑推理嵌入到大语言模型潜在激活空间中的框架,进而实现了跨多种任务与模型架构的透明、可控且稳健的多跳推理。

原作者: Lukas Helff, Ruben Härle, Wolfgang Stammer, Felix Friedrich, Manuel Brack, Antonia Wüst, Hikaru Shindo, Patrick Schramowski, Kristian Kersting

发布于 2026-05-12
📖 1 分钟阅读☕ 轻松阅读

原作者: Lukas Helff, Ruben Härle, Wolfgang Stammer, Felix Friedrich, Manuel Brack, Antonia Wüst, Hikaru Shindo, Patrick Schramowski, Kristian Kersting

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一个大型语言模型(LLM)就像一支庞大、才华横溢却略显混乱的管弦乐队。它能演奏出美妙的音乐(生成流畅的文本),但如果你问指挥(模型)为什么要演奏某个特定的音符,它其实无法真正解释自己。这些音符都混杂在一个巨大、纠缠不清的声波网络中。研究人员将这种现象称为“叠加态”——许多不同的概念被编码在同一个重叠的空间里,使得人们难以看清单独的乐器或控制音乐的走向。

这篇论文提出了一种名为激活推理(Activation Reasoning, AR)的新框架来解决这一问题。你可以将 AR 想象为安装了一个智能指挥台,它能够聆听乐队内部的振动,识别特定的乐器,并为它们提供遵循的逻辑脚本。

以下是其工作原理,分为三个简单步骤:

1. 寻找乐器(寻找潜在表征)

首先,团队使用了一种名为**稀疏自编码器(Sparse Autoencoder, SAE)**的工具。你可以将 SAE 想象为一个高科技的“频率分析仪”。它聆听乐队混乱的噪音,并将其分离成清晰、独立的音符。

  • 目标:寻找“单义性”特征。这意味着要在模型中找到一个特定的振动,它表示“桥梁”或表示“旧金山”,而不是两者混乱的混合。
  • 结果:他们创建了一个包含这些清晰概念的字典。有些概念只是一个音符(单特征),有些是几个音符组成的和弦(多特征),还有些是复杂的规则,例如“如果你听到悲伤的小提琴是小调,那就是‘悲伤’"(关系特征)。

2. 将音符转化为句子(激活命题)

现在,想象模型正在阅读这样一个句子:“金门大桥位于旧金山。”

  • 随着模型阅读,SAE 被点亮。它检测到了“桥梁”音符、“旧金山”音符和“美国”音符。
  • AR 并没有让这些音符随意漂浮,而是抓取它们并将它们转化为逻辑命题(简单的陈述,如“桥梁已激活”或“旧金山已激活”)。
  • 它构建了一个记分板(激活矩阵),精确显示哪些概念当前处于“开启”状态以及它们的强度如何。

3. 逻辑引擎(逻辑推理)

这是神奇的一步。团队为系统提供了一套逻辑规则,就像一本思维食谱。

  • 规则:“如果(桥梁)AND(旧金山)AND(美国)全部激活,那么(金门大桥)为真。”
  • 行动:即使模型从未见过“金门大桥”这个短语,逻辑引擎也能在记分板上看到这三个要素(桥梁、旧金山、美国),并推导出新概念。它从原始素材中创造出一个新的、更高层级的概念。
  • 控制:因为系统现在知道“金门大桥”在逻辑上为真,它可以引导模型正确回答问题或阻止不安全的回答。例如,如果模型试图说“金门大桥位于中国”,逻辑引擎会发现这违反了“美国”规则,并纠正模型的路径。

为什么这很重要?(结果)

该论文在几个通常会让普通模型感到困惑的困难任务上测试了这位“智能指挥”:

  • 多步逻辑(PrOntoQA):想象一个需要五步推导的谜题。普通模型在第二步就会迷失。AR 则保持冷静,无论逻辑链条有多长,它都能解决 93% 以上的谜题。它不会感到疲惫或困惑。
  • 读字里行间(Rail2Country):有时人们不会直接说“红色”,而是说“番茄的颜色”。普通模型往往错过这种联系。然而,AR 理解“番茄”意味着“红色”,并利用这一点解决问题。它能够处理让其他模型感到困惑的隐喻和明喻。
  • 现实世界安全(BeaverTails):该系统在棘手的安全问题上接受了测试。它能够通过观察概念的逻辑组合,而不是仅仅对“枪”这个词做出反应,来区分“持枪的警察”(在语境中是安全的)和“持枪的罪犯”(不安全)。

核心结论

该论文声称,激活推理将人工智能混乱、不可见的“大脑”转变为一个结构化、逻辑化的工作空间。

  • 透明度:我们现在可以确切地看到人工智能在做出决策时正在使用哪些概念。
  • 可靠性:它不会被复杂的谜题或棘手的措辞所迷惑。
  • 可控性:我们可以给人工智能一套逻辑规则,它将遵循这些规则,从而使人工智能更安全、更可预测。

简而言之,AR 将人工智能的“直觉”(潜在激活)与一个“逻辑大脑”结合起来作为支撑,使人工智能不仅成为一个流畅的交谈者,更成为一个可靠的思考者。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →