← 最新论文
💬 NLP

On the Importance and Evaluation of Narrativity in Natural Language AI Explanations

该论文指出当前可解释人工智能(XAI)生成的静态特征列表缺乏因果逻辑,主张借鉴社会科学和语言学将解释转化为具备连续结构、因果机制、语言流畅性及词汇多样性的叙事形式,并提出了七项自动评估指标与生成规则,以克服传统自然语言处理指标的局限并提升解释的可理解性。

原作者: Mateusz Cedro, David Martens

发布于 2026-04-21
📖 1 分钟阅读☕ 轻松阅读

原作者: Mateusz Cedro, David Martens

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文探讨了一个非常有趣的问题:当我们让 AI 解释它为什么做出某个决定时,它是在“讲故事”,还是只是在“报菜名”?

为了让你轻松理解,我们可以把 AI 的解释想象成一位导游在介绍一座城市

1. 核心问题:是“报菜名”还是“讲故事”?

  • 现状(报菜名/描述性解释):
    目前的 AI 解释大多像是一个只会念清单的导游

    “这个景点很重要,那个景点也很重要,还有一个景点有点扣分……"

    它只是罗列了哪些因素(比如年龄、收入、贷款金额)影响了结果,列出了一堆数据。虽然信息准确,但读起来枯燥乏味,而且没有告诉你这些因素之间是如何互动的,就像给你看一堆散落的乐高积木,却没告诉你怎么拼成城堡。

  • 理想(讲故事/叙事性解释):
    论文作者认为,好的解释应该像一位会讲故事的导游

    “这位游客一开始因为贷款金额太高,差点被拒之门外(这是起因)。但是,因为他很年轻,充满活力,这就像一股暖流抵消了之前的担忧(这是转折)。再加上他虽然租房,但工作稳定,这些因素像拼图一样,最终让他顺利通过了审核(这是结果)。”

    这种解释有开头、中间和结尾,有因果关系(因为 A,所以 B,导致 C),而且用词丰富流畅。这才是人类大脑最容易理解的方式。

2. 为什么现有的“评分标准”不管用?

作者发现,我们以前用来衡量 AI 写得“好不好”的标准(比如困惑度 Perplexity,可以理解为“读起来顺不顺”),很容易被

  • 比喻: 想象你在给作文打分。
    • 真正的故事: 情节跌宕起伏,用词丰富,读起来很顺。
    • 骗分文本: 一个只会说废话的机器人,不断重复“因为所以,因此结果,数据决定,模型预测……"。
    • 结果: 那个只会说废话的机器人,因为句子结构重复、用词简单,反而在“顺不顺”的评分上得了高分!但它完全没有解释清楚任何道理

现有的标准就像只看重“字迹是否工整”,却忽略了“文章是否有灵魂”。

3. 作者提出的新方案:给“故事性”打分

为了解决这个问题,作者从社会学和语言学中汲取灵感,提出了7 个新的自动评分指标,专门用来检测 AI 是不是在“讲故事”。

我们可以把这 7 个指标想象成检测“故事感”的 7 个探测器

  1. 结构连贯性探测器(连续结构):
    • 怎么测? 把文章里的句子顺序打乱。
    • 原理: 如果是好故事,打乱后就会变得语无伦次(分数变差);如果是报菜名,打乱后意思差不多(分数变化小)。
  2. 因果逻辑探测器(因果关系):
    • 怎么测? 找“因为”、“所以”、“导致”、“结果”这类词。
    • 原理: 好故事里这些词很多,因为它们连接了前因后果;报菜名里通常没有。
  3. 流畅度探测器(语言流畅性):
    • 怎么测? 看它是不是在重复同样的词。
    • 原理: 好故事用词丰富,像流水一样自然;坏解释像复读机,反复念叨几个词。
  4. 词汇多样性探测器(词汇丰富度):
    • 怎么测? 统计用了多少不同的词。
    • 原理: 讲故事的人词汇量大;报菜名的人只会说“这个”、“那个”。
  5. 动词活跃度探测器(动作感):
    • 怎么测? 看动词多不多。
    • 原理: 故事是动态的(“推动”、“抵消”、“影响”);描述是静态的(“是”、“有”)。
  6. 连接词探测器(逻辑连接):
    • 怎么测? 看“然而”、“此外”、“接着”用得多不多。
    • 原理: 这些词像胶水,把故事粘在一起。
  7. 综合上下文探测器(上下文适应):
    • 怎么测? 看随着故事推进,读者是不是越来越能猜出下一句要说什么。
    • 原理: 好故事有内在逻辑,越往后越顺;坏解释是随机堆砌。

4. 实验结果:谁在讲故事?

作者测试了目前最流行的几种 AI 解释方法(比如 TalkToModel, Explingo, XAIstories),并给它们加上了**“讲故事规则”**(就像给导游发了一本《如何讲好故事》的手册)。

  • 发现:
    • 很多旧方法(特别是基于模板的)就像念稿子,虽然句子通顺,但缺乏灵魂,被新指标狠狠“打低分”。
    • 那些被加上了“讲故事规则”的新方法(比如 Explingo Narratives),就像突然开窍的导游,开始把数据串联成有逻辑的故事,新指标给它们打了高分。
    • 有趣的是,有些方法(如 XAIstories)本来就被设计成讲故事的,所以加不加规则区别不大。

5. 总结与启示

这篇论文告诉我们:
仅仅让 AI 说人话是不够的,它还得学会“讲道理”。

  • 以前的 AI 解释: 像一份冷冰冰的体检报告单,列出一堆指标。
  • 未来的 AI 解释(XAI Narratives): 应该像一位耐心的医生,告诉你:“虽然你的血压有点高(起因),但因为你的运动量很大(转折),所以整体风险是可控的(结论)。”

作者提出的这套新指标,就像给 AI 装上了**“故事感雷达”**,能自动分辨出哪些解释是真正让人听懂了,哪些只是在堆砌辞藻。这对于让 AI 在医疗、金融等关键领域真正赢得人类的信任至关重要。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →