← 最新论文
🤖 AI

Quantifying Logical Consistency in Transformers via Query-Key Alignment

本文提出了一种轻量级评估策略,通过分析 Transformer 注意力头中的查询-键(query-key)对齐情况来量化大语言模型的逻辑一致性,并证明了该策略在区分参数规模从 1.5B 到 70B 不等模型的有效推理与无效推理方面的有效性。

原作者: Eduard Tulchinskii, Anastasia Voznyuk, Laida Kushnareva, Andrei Andriiainen, Irina Piontkovskaya, Evgeny Burnaev, Serguei Barannikov

发布于 2026-09-10
📖 1 分钟阅读☕ 轻松阅读

原作者: Eduard Tulchinskii, Anastasia Voznyuk, Laida Kushnareva, Andrei Andriiainen, Irina Piontkovskaya, Evgeny Burnaev, Serguei Barannikov

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

大语言模型已经变得非常擅长模仿人类对话、撰写诗歌以及总结复杂文本。它们通过基于海量训练数据来预测句子中的下一个词来实现这一点。然而,当被要求解决多步逻辑谜题时,这些系统往往会出错。它们可能会生成一段听起来很有说服力的推理链,但最终却导向一个完全错误的结论;或者它们可能会被提示词中无关紧要的细节所干扰。虽然研究人员已经找到了通过要求模型“一步步思考”来诱导其表现出更好性能的方法,但一个根本性的问题仍然存在:模型本身并没有一种内置机制来检查其自身的推理是否真正连贯。它们可以产生一条逻辑上听起来合理的路径,却并不真正理解这些步骤是否正确连接。

这种不确定性造成了人工智能的一个盲点。我们可以看到模型给出的最终答案,但我们无法轻易观察到指示模型是在遵循逻辑规则,还是仅仅在进行猜测的内部信号。为了解决这个问题,来自斯科尔科沃科学技术学院(Skolkovo Institute of Science and Technology)及其他机构的研究团队开发了一种新方法,可以在推理过程中窥探模型的“思维”。他们不再是等待模型完成回答后再检查其正确与否,而是观察模型在思考过程中所建立的特定内部连接。他们发现,模型的某些架构部分充当了可靠的检查点,能够在最终答案被说出来之前很久,就发出逻辑步骤是否有效的信号。

研究人员专注于这些模型如何处理信息。在大语言模型内部,信息通过层层数学运算进行流动。在这一过程的核心是“注意力头”(attention heads),它们就像微小的开关,决定在任何给定时刻应该关注输入的哪些部分。该团队发现,他们可以测量这些头中两个特定信号之间的对齐程度:一个代表正在测试的陈述的信号,以及一个代表潜在答案的信号。通过计算一个基于这两个信号契合程度的简单得分,他们可以判断模型是否识别出了前提与结论之间的逻辑联系。

为了测试这个想法,研究人员在各种逻辑推理任务上进行了实验。他们使用了合成数据集,其中的规则清晰且答案是非黑即白的真或假,例如根据关于“rompus”和“jompus”的一套虚构规则,来判定名为“Polly”的角色是否具有不透明性。他们还将该方法应用于涉及现实世界语言和多步演绎的更复杂的数据库。在这些测试中,他们将这种新的内部评分方法与模型的标准回答方式(即仅仅选择概率最高的选项)进行了对比。

结果显示,这种内部评分方法比模型自身的最终猜测要可靠得多。在模型面临干扰性、无关信息的情景下,标准模型经常会感到困惑并给出错误答案。然而,研究人员追踪的特定内部信号却保持稳定,即使在模型的最终输出错误时,也能正确识别出有效的逻辑路径。这表明,模型深层结构中实际上拥有正确的推理能力,但这种能力有时会被后续的处理阶段或干扰上下文的噪声所掩盖。

团队在从拥有 15 亿参数的极小型模型到拥有 700 亿参数的巨型模型等各种规模的模型上测试了这种方法。在所有测试中,他们都发现特定的注意力头一致地充当了“验证锚点”。无论推理需要多少步骤,也无论存在多少干扰,这些头都能高精度地分辨出有效推论与无效推论。在某些情况下,内部得分的正确率超过了 90%,而模型的最终答案正确率却不足 60%。这表明模型经常在内部“知道”正确答案,但在表达时却未能正确输出。

最重要的发现之一是,这种方法不需要修改或重新训练模型。研究人员只需运行一次模型,观察内部信号,即可得出通常比模型自身预测更准确的得分。这提供了一种轻量且高效的方法来评估逻辑一致性,而无需像以往方法那样承担沉重的计算成本(以往方法通常涉及禁用模型的某些部分以观察其变化)。这项研究表明,通过识别这些特定的内部组件,我们可以获得一个更清晰的窗口,去观察人工智能如何处理复杂关系,从而让我们离那些不仅具备语言流利度、而且具备可靠推理能力的系统更近一步。

研究人员指出,当有足够的数据来校准针对特定任务应信任哪些特定内部信号时,他们的方法效果最好。他们也承认,这种方法并不意味着这些特定部分是负责逻辑的唯一部分,也不意味着它解决了人工智能领域的所有推理问题。然而,这项工作提供了一种具体且可衡量的方式,让我们能看到逻辑在哪里成立,又在哪里崩溃,为构建更透明、更可信的语言模型提供了一种新工具。通过关注内部信号的对齐而非仅仅关注最终输出,这项研究揭示了健全推理的能力往往就存在于模型之中,只待被正确地读取。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →