← 最新论文
💬 NLP

From Scoring to Explanations: Evaluating SHAP and LLM Rationales for Rubric-based Teaching Quality Assessment

本文提出了一种结合 SHAP 归因与大语言模型生成理由的框架,用于评估基于评分量表的教学质量评分,研究发现虽然微调后的预训练语言模型实现了更高的准确率,但与大语言模型生成的理由相比,SHAP 提供了更具忠实性、连贯性且更具可迁移性的解释。

原作者: Ivo Bueno, Babette Bühler, Philipp Stark, Tim Fütterer, Ulrich Trautwein, Dorottya Demszky, Heather Hill, Enkelejda Kasneci

发布于 2026-06-05
📖 1 分钟阅读☕ 轻松阅读

原作者: Ivo Bueno, Babette Bühler, Philipp Stark, Tim Fütterer, Ulrich Trautwein, Dorottya Demszky, Heather Hill, Enkelejda Kasneci

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你是一名正在批改一叠学生作文的老师。你有一个严格的检查清单(即“评分标准/量规”),用来决定作文中的反馈是好、是坏、还是处于中间水平。现在,想象你雇佣了两种不同的“AI助手”来帮你进行评分。

这篇论文是一份关于这两类AI助手表现如何的成绩单,更重要的是,它们在解释自己为什么给出某个分数时表现如何。

以下是使用简单类比对这项研究进行的拆解:

两大竞争者

研究人员测试了两类用于根据特定的“反馈质量”评分标准对课堂对话(转录文本)进行评分的AI模型。

  1. “专业实习生”(微调后的PLMs): 这些是标准的AI模型,经过了针对这一特定评分任务的数千个实例的专门训练。它们就像是一个背熟了教科书并练习过一百遍考试的学生。
  2. “博学通才”(提示词驱动的LLMs): 这些是庞大且强大的AI模型(比如你在网上聊天的那些),它们并没有针对这个特定任务进行过专门训练。研究人员只是给了它们一组指令(提示词),说:“这是评分标准,请根据它评分。”它们就像是一位从未见过这个特定考试、但被要求现场应考的博学专家。

第一项测试:谁能拿对分数?(评分)

研究人员问道:谁给出的分数更准确?

  • 结果: **“专业实习生”**要准确得多。它给出的分数始终非常接近人类专家给出的分数。
  • 陷阱: 这个实习生有一个奇怪的习惯,即表现得非常“保守”。它很少给出最高分(7分)或最低分(1分)。它倾向于把所有的分数都聚集在中间(3、4或5分)。它很准确,但有点乏味且规避风险。
  • “博学通才”: **“博学通才”**的整体准确性较低。然而,它更加“大胆”。它给出了更多样化的分数,包括极高和极低的分数,即便它并不总是正确的。

总结: 如果你想要一个最精确的数字,请使用经过训练的模型。如果你想要一个不害怕给出极端分数(即使会犯更多错误)的模型,请使用大型聊天机器人。

第二项测试:谁在说实话?(解释)

这是论文中最重要的部分。在教育领域,你不仅想要一个分数,你还想知道为什么

  • **“专业实习的实习生”**使用了一种叫做 SHAP 的数学工具。你可以把 SHAP 想象成一名法务会计师。它逐句查看转录文本,并计算每一句话对最终得分的影响程度。它就像一个计算器,会说:“这句话增加了0.5分;那句话减去了0.2分。”
  • “博学通才”仅仅是在说话。它生成了一系列它认为重要的句子,用自然语言写了出来。它就像一个举手发言的学生说:“我觉得这部分很重要,因为……”

研究人员通过玩一场 “删除并观察” 的游戏来测试谁在说实话:

  1. 他们提取了AI所认为重要的句子。
  2. 他们从转录文本中删除了这些句子。
  3. 他们再次要求AI对空置的转录文本进行评分。

逻辑是: 如果AI真正理解了为什么给出某个分数,那么删除那些“重要”的句子应该会导致分数大幅下降或发生剧烈变化。如果AI只是在编造一个故事,那么删除这些句子对分数的影响应该不大。

  • 结果: “专业实习生 (SHAP)” 是诚实的。当研究人员删除了SHAP标记的句子时,分数发生了很大变化。该AI显然是依赖这些特定句子来做出决策的。
  • 结果: “博学通才 (LLM)” 经常在撒谎。当研究人员删除了LLM所认为重要的句子时,分数几乎没有变化。LLM生成了一个“听起来很有道理”的解释,但这些句子实际上并不是驱动其决策的因素。它就像一个学生在为自己为何值得拿A而发表一段精彩绝伦的演讲,但当你移除他引用的证据时,他的成绩其实并没有改变。

第三项测试:它们能交换笔记吗?(跨模型测试)

研究人员尝试看看这些解释是否具有通用性。

  • 他们提取了“专业实习生”识别出的“重要句子”,并将其从“博学通才”的输入中删除。结果: 通才的分数发生了显著变化。实习生的数学逻辑在通才身上也同样奏效。
  • 他们提取了“博学通才”识别出的“重要句子”,并将其从“专业实习生”的输入中删除。结果: 实习生的分数几乎没有变动。通才的“观点”对实习生来说毫无意义。

总结: 数学解释(SHAP)是一种普遍的真理,它在不同的AI大脑之间都适用。而聊天机器人的解释则是特定于那个聊天机器人的,在接受其他模型测试时无法站得住脚。

最终裁定

论文得出结论,虽然强大且博学的聊天机器人(LLMs)非常擅长生成听起来像是一个好解释的文本,但在像评价教师这样高风险的情况下,它们在解释为什么做出某个决定方面是不可靠的

  • SHAP(数学): 就像一扇透明的窗户。你可以清楚地看到哪些砖块支撑着墙壁。它是值得信赖且一致的。
  • LLM 的理由(聊天): 像是魔术师的障眼法。它们看起来令人印象深刻且极具说服力,但如果你仔细观察(通过删除那些“重要”的部分),你会发现它们其实并没有承担起决策的重量。

简而言之: 如果你需要一个可靠的理由来为分数背书,请信任数学(SHAP),而不是聊天机器人的故事。聊天机器人擅长写作,但目前它还不是其自身决策的可靠证人。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →