← 最新论文
💬 NLP

ICE: Intervention-Consistent Explanation Evaluation with Statistical Grounding for LLMs

本文提出了 ICE 框架,通过引入统计显著性检验和随机化基线来评估大语言模型解释的忠实度,揭示了现有评估中因算子选择偏差导致的虚假高估现象,并发现解释的忠实度与人类可解释性几乎无关。

原作者: Abhinaba Basu, Pavan Chakraborty

发布于 2026-03-20
📖 1 分钟阅读☕ 轻松阅读

原作者: Abhinaba Basu, Pavan Chakraborty

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一个名为 ICE 的新框架,用来给大语言模型(LLM)的“解释能力”打分。

为了让你轻松理解,我们可以把大语言模型想象成一个**“天才但有点神神叨叨的侦探”**。

1. 核心问题:侦探在撒谎吗?

想象一下,侦探(AI 模型)破案了,他告诉你:“我之所以判断这是谋杀案,是因为我注意到了**‘红色的领带’‘地上的水渍’**。”

  • 传统的测试方法(像 ERASER 基准):就像法官问侦探:“如果你把领带和水渍遮住,你还能破案吗?”如果侦探说“不能”,法官就认为侦探的解释是诚实的(Faithful)

    • 漏洞:这就像把侦探的眼睛蒙上,他当然破案不了!但这不代表领带和水渍是唯一的原因。也许侦探其实靠的是“墙上的脚印”,但他故意说是领带。传统的测试分不清他是真的靠领带破案,还是因为被蒙眼后彻底懵了。
  • ICE 框架的突破:ICE 引入了一个**“随机对照组”**。

    • 法官会问侦探:“如果你遮住领带和水渍,你破案率是多少?如果你遮住随机选的两样东西(比如‘墙上的画’和‘窗外的鸟’),你破案率又是多少?”
    • ICE 的逻辑:如果侦探遮住“领带和水渍”后破案率暴跌,但遮住“随机东西”后破案率没怎么变,那说明侦探真的是靠领带和水渍破案的(诚实)。
    • 如果遮住“领带和水渍”和遮住“随机东西”后,破案率都暴跌,那说明侦探其实是在瞎编,或者他根本就没真正理解案情(不诚实,甚至“反诚实”)。

2. 两个关键发现:没有“万能钥匙”

论文通过大量实验(测试了 7 种不同的 AI 模型,涵盖英语和 6 种非英语语言),得出了两个让人大跌眼镜的结论:

发现一:测试方法不同,结论完全相反(“切蛋糕”还是“换馅料”?)

ICE 用了两种不同的“干扰”手段来测试侦探:

  1. 删除法(Deletion):直接把侦探提到的词删掉
    • 比喻:就像把侦探报告里的“红色领带”这几个字直接涂黑。句子变得支离破碎,读起来很怪。
    • 结果:在短文本(如一句话)中,这种方法往往给 AI 打高分。因为句子太短,删掉几个词,AI 就彻底懵了,看起来好像它很依赖这些词。
  2. 检索填充法(Retrieval Infill):把侦探提到的词替换成其他合理的词。
    • 比喻:把“红色领带”换成“蓝色围巾”。句子依然通顺,但意思变了。
    • 结果:在长文本(如一篇长文章)中,这种方法更准确。因为删掉长文章的大部分词会让文章变成乱码,AI 当然猜不出答案;但替换成通顺的词,能真正测试 AI 是否真的抓住了重点。

结论:你不能只说"AI 的解释是 80 分”。如果换一种测试方法,分数可能变成 40 分,甚至变成负分(比瞎猜还差)。诚实度取决于你用什么方法去“刁难”它。

发现二:AI 经常“反其道而行之”(Anti-faithfulness)

这是最惊人的发现。ICE 发现,在三分之一的情况下,AI 的解释不仅没用,甚至是误导的。

  • 比喻:侦探指着“红色的领带”说:“这就是凶手!”但实际上,领带是凶手故意留下的假线索,真正的线索是“墙上的脚印”。
  • 在这种情况下,AI 不仅没解释对,反而在故意把你引向错误的方向。如果不做随机对照测试,我们根本发现不了这种“反诚实”现象,还以为 AI 解释得很完美。

3. 其他有趣的发现

  • 人类觉得“像话”不等于“真实”
    有时候,AI 给出的解释读起来非常通顺、合乎逻辑(人类觉得“ plausible"),但 ICE 测试发现,这些解释跟 AI 真正的推理过程毫无关系(相关性几乎为 0)。

    • 比喻:就像那个侦探编了一个精彩绝伦的故事,听起来很合理,但实际上他破案是靠猜的。ICE 告诉我们:别被好听的故事骗了,要看它是不是真的靠那个线索破案。
  • 语言越复杂,问题越多
    在英语以外的语言(如中文、印地语、土耳其语)中,AI 的表现差异巨大。有时候同一个模型,在英语里很诚实,换个语言就完全“反诚实”了。这说明 AI 的“诚实”不仅取决于模型,还取决于它和特定语言的互动方式

4. 总结:ICE 是什么?

ICE (Intervention-Consistent Explanation) 就像是一个**“测谎仪”**。

以前的测试只是问:“你解释得通吗?”
ICE 问的是:“如果你把解释里的线索拿走,或者换成别的线索,你的表现会怎么变?这比随机瞎猜好吗?”

这篇论文给开发者和用户的建议是:

  1. 别只看一个分数:不要相信单一的“解释可信度”分数。
  2. 多试几种方法:要同时用“删除”和“替换”等多种方式去测试。如果不同方法下 AI 的表现都很稳定,那它才是真的诚实。
  3. 警惕“反诚实”:有些 AI 的解释比瞎猜还差,这在以前是看不出来的。

简单来说,ICE 告诉我们:在 AI 的世界里,解释得“像那么回事”不代表它就是“对的”。我们需要更严谨、更科学的统计方法来戳穿那些花言巧语。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →