← 最新论文
💻 computer science

Not All Explanations Simulate Equally: Comparing Verbalized Feature Attributions and Self-Generated Rationales

本文评估并比较了问答模型中语言化特征归因与自生成理由的可模拟性,证明了解释格式、粒度及来源会显著影响大语言模型评判者在反事实设定下预测模型行为的能力。

原作者: Pingjun Hong, Benjamin Roth

发布于 2026-06-02
📖 1 分钟阅读☕ 轻松阅读

原作者: Pingjun Hong, Benjamin Roth

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图猜测一个非常聪明但有时有些古怪的机器人接下来会说什么。你有一系列问题,而机器人会给出答案。现在,想象一下如果你改变了问题中的一个词(一种“反事实”改变)并再次提问:你能预测机器人对这个新问题的回答吗?

这篇论文关于测试不同类型的“提示”(解释),以观察哪种提示能真正帮助人类(或另一个 AI)正确做出这种预测。作者将这个过程称为可模拟性(simulatability)。你可以把它想象成一个“水晶球测试”:这些解释是否给了你足够的信息,让你能够预见机器人的行为未来?

研究人员比较了两种主要的提示类型:

1. “高亮器” vs. “讲故事的人”

类型 A:高亮器(言语化的特征归因)
想象机器人阅读了一篇长文章并回答了一个问题。“高亮器”解释会指向文本中机器人用于做出决策的具体句子或单词。

  • 实验: 研究人员将这些被高亮的部分转化成了句子。
    • 句子级: “机器人依赖于这整个段落。”
    • 标记级(Token-level): “机器人依赖于‘苹果’这个词。”
    • 重写版: 他们要求一个超级聪明的 AI 将高亮部分改写成流畅、连贯的句子。

类型 B:讲故事的人(自我生成的逻辑依据)
这是指机器人被要求在给出答案之前或之后解释自己的思考过程。

  • 事后解释(Post-hoc): “这是我的答案。顺便说一下,这是我给出的简短理由。”
  • 思维链(Chain-of-Thought, CoT): “让我一步步思考……首先我观察了 X,然后我考虑了 Y,所以我的答案是 Z。”

2. 结果:什么才真正奏效?

研究人员使用了一个“裁判”(另一个强大的 AI)来尝试预测机器人对新变化问题的回答。他们给了“裁判”原始答案和上述的一种“提示”。

以下是他们的发现,使用了简单的类比:

  • “整个段落”胜出(句子级):
    当提示指向整个句子或段落时,“裁判”能更好地预测机器人的下一步行动。这就像是给了你一整章书的内容来理解剧情。

    • 类比: 如果你告诉某人,“这个角色很生气,是因为他刚刚读到的那封信,”那么他们就能猜到这个角色接下来的举动。
  • “单个单词”失败(标记级):
    当提示只指向单个单词(如“苹果”或“1805”)时,“裁判”会感到困惑,或者表现得比之前更差。

    • 类比: 如果你只是说,“这个角色很生气,是因为‘信’这个词,”这太模糊了。你不知道那封信里到底说了什么。上下文缺失了。
  • 流畅度是一个陷阱(LLM 重写):
    研究人员尝试将“高亮器”的笔记交给一个超级聪明的 AI,让它将其改写成优美、流畅的英文。他们认为这会有所帮助。但事实并非如此。

    • 类比: 这就像是拿着一张粗略的地图,请一位艺术家用美丽的色彩和华丽的字体重新绘制它。如果地图仍然只显示一条街道而不是整个街区,那么漂亮的字体也无法帮你导航。信息量本身比风格更重要。
  • “步步为营”的指南才是王道(思维链):
    最好的提示是**思维链(Chain-of-Thought)**解释。当机器人逐步解释其推理过程时,“裁判”能以惊人的准确度预测机器人未来的答案。

    • 类比: 这就像是机器人向你展示它的草稿纸。它不仅仅说“答案是 42”,而是说:“我先加了 20 和 20,然后减去了 18,得到了 22,最后又加了 20……”你可以完美地跟随其逻辑,因此你完全知道它下一步会做什么。

3. 核心启示

论文的结论是:并非所有的解释都是平等的。

  • 上下文即王道: 提供一段原始文本(一个句子)比提供一个微小的碎片(一个词)要好得多。
  • 逻辑 > 文采: 一个粗糙的、循序渐进的逻辑解释(思维链)在预测行为方面,远比一个经过润色、流畅的总结更有用。
  • “为什么”至关重要: 要理解一个模型在某种新情况下会如何表现,你需要看到它的推理过程,而不仅仅是它所关注的证据。

简而言之:如果你想了解一个机器人的大脑,不要只给我看它高亮了哪些词。请展示它为了得出结论而对自己讲述的那个“故事”。这是你真正预测它下一步会做什么的唯一途径。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →