← 最新论文
💻 computer science

Interpreting Black-Box Large Language Models with Sentence-Level Energy Landscapes

本文提出了一种模型无关的后验归因解释器,该解释器利用能量模型作为代理来训练一个独立的工具,能够在无需进一步 API 查询的情况下,量化句子级提示词对大语言模型输出的影响。

原作者: Maryam Rezaee, Pooriya Safaei, Maryam Asgarinezhad, Fatemeh Seyyedsalehi

发布于 2026-08-05
📖 1 分钟阅读☕ 轻松阅读

原作者: Maryam Rezaee, Pooriya Safaei, Maryam Asgarinezhad, Fatemeh Seyyedsalehi

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在和一个非常聪明但又神秘的机器人朋友聊天。你问了它一个问题,它给了你一个长长的、很有帮助的回答。但问题在于,你无法窥视机器人的大脑内部。你不能偷看它的齿轮,也不能读它的日记来了解它为什么选择那些特定的词。这就是“黑盒”人工智能的世界。这些强大的计算机程序被称为“大语言模型”(LLMs),它们如此复杂且神秘,以至于即使是它们的创造者有时也无法解释它们究竟是如何做出决策的。如果你想让这个机器人承担重要的任务,比如提供医疗建议或法律帮助,这就会变成一个大问题。你需要知道:“机器人说出这句话是因为我问题中的那个部分,还是它只是凭空编造出来的?”

为了解决这个问题,科学家们一直试图建造“解释器”——这种工具就像是为人工智能准备的 X 光眼镜。通常,这些工具试图观察语言的微小构建模块,比如单个词或字母(称为“标记”/tokens)。但逐个字母地思考语言,就像试图通过观察单个像素来理解一部电影一样;这既混乱又往往会错过宏观的图景。真正的魔力发生在完整的思想或句子中。这篇论文探讨的核心问题是:我们能否建造一种工具,让它忽略那些微小的像素,转而观察整个句子,从而弄清楚你的问题中哪些部分实际上导致了机器人的回答?

这篇论文的研究人员说:“是的,我们可以!”他们建造了一种巧妙的新方法。他们没有尝试打开黑盒,而是为这个机器人建立了一个“影子双胞胎”。把这个双胞胎想象成一个观察着真实机器人工作的侦探,它学习机器人的习惯,然后构建出一张关于机器人思维过程的地图。他们称这张地图为“能量景观”(Energy Landscape)。想象一下一片丘陵地形,低谷代表“好的、逻辑清晰的回答”,而高地则代表“奇怪的、错误的回答”。真实的机器人总是试图留在低谷中。

团队训练了这个侦探双胞胎来理解这种景观。一旦双胞胎知道了这张地图,它就可以观察一个特定的回答并问道:“问题中的哪句话将机器人推向了这个特定的谷底?”他们构建了一个轻量级的工具,称之为 ESCI,它扮演着一个独立的翻译官的角色。一旦训练完成,这个工具就不再需要向那个大机器人寻求帮助了;它可以直接观察问题和答案,并直接指出最重要的句子。

以下是他们如何测试以及发现了什么。他们使用了一个流行的 AI 模型(GPT-4o-Mini)作为他们的“黑盒”,并向其输入了数千个问题和答案。他们训练了这个 ESCI 工具来识别问题中哪些部分最为重要。当他们将 ESCI 的猜测与其它超智能 AI 模型(充当“先知”)的猜测进行对比时,发现 ESCI 的准确率惊人地高。即使在存在大量冗余信息或“废话”的情况下,它也能精准捕捉到问题的核心要点。例如,如果你问“像对五岁小孩说话那样解释一下”,ESCI 能正确识别出“像对五岁小孩说话那样”这一部分才是最重要的指令,而不仅仅是你在询问的主题。

然而,论文谨慎地表示,这并不是在声称这是一个完美的、神奇的解决方案。作者指出,虽然 ESCI 在寻找正确句子方面表现出色,但它并不是一个能洞察机器人精确内部想法的“水晶球”。他们通过进行一项“如果……会怎样”的测试来衡量这一点:他们提取了 ESCI 认为重要的句子,去掉了其余部分,然后再次要求机器人进行回答。机器人仍然能够给出非常相似的回答,这表明 ESC了 ESCI 找到了真正的“因果”驱动因素。但他们也注意到,如果移除这些重要的句子,机器人有时仍能猜中正确答案,因为它拥有大量的通用知识。这意味着 ESCI 很棒,但它并不是关于机器人如何思考的最终定论。

这种方法最酷的地方之一在于它的效率。其他试图实现此目的的方法通常需要向大机器人询问数千个问题才能弄清楚一个答案,这既缓慢又昂贵。ESCI 工具一旦训练完成,就可以立即完成工作,而无需再向大机器人寻求帮助。这就像是训练了一只导盲犬,一旦训练完成,这只狗就可以永远引导你穿梭于城市,而不需要再去联系训练员。研究人员发现,在经过大约 20,000 个示例的训练后,他们的工具处理新问题的速度比旧方法快得多,节省了大量的时间和计算能力。

最后,论文表明,从句子而非微小的单词入手是理解人工智能的一种更聪明的方式。它表明我们可以通过构建工具来帮助我们信任这些神秘的机器人,这些工具能指出我们对话中哪些部分真正起到了作用。虽然它并不是窥视机器人灵魂的完美窗口,但它是一副非常强力的眼镜,帮助我们看清魔力背后的逻辑,使我们在日常生活中使用这些强大的工具时更加安全可靠。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →