← 最新论文
💻 computer science

When Evaluation Clarity Creates Algorithmic Anxiety: A Randomized Field Experiment of Explainable Fuzzy Assessment and Teacher Feedback Uptake

一项涉及 982 名中国高校教师的随机实地实验表明,与传统或黑箱 AI 系统相比,可解释的模糊 AI 反馈通过阐明算法不确定性并促进反馈采纳,显著增强了程序公平性、校准信任以及随后的教学改进。

原作者: Yiran Zhou

发布于 2026-08-26
📖 1 分钟阅读☕ 轻松阅读

原作者: Yiran Zhou

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在现代大学中,教师评估的方式正在发生变化。几十年来,教师一直通过学生调查和同行评审来获得反馈,但现在,人工智能正介入其中以分析教学质量。这些新系统承诺会更快、更详细,通过扫描数以千计的学生评论和课程材料,来发现人类可能忽略的模式。然而,一个显著的问题出现了:当计算机告诉一位教师其表现不佳时,教师往往不知道原因。如果评分背后的推理过程是隐藏的,这种反馈感觉就像是来自神秘权威的惩罚,而非有益的引导。这在机器的效率与人类理解的需求之间造成了紧张关系。对于教育工作者和研究人员来说,核心问题不仅在于人工智能是否能计算出一个分数,而在于教师是否能足够信任这一过程,从而真正利用这些建议来改进他们的课堂。

为了回答这个问题,斯坦福大学的研究人员在中国十二所机构开展了一项涉及近 1,000 名大学教师的大规模实验。他们想看看改变反馈呈现方式是否能改变教师对反馈的反应。该研究比较了三种不同的交付评估结果的方式。第一组接受的是传统方法:标准分数和书面评语。第二组接受的是由人工智能系统生成的反馈,但该系统表现为一个“黑箱”,仅提供优缺点的总结,而不解释它是如何得出这些结论的。第三组接受了一种被称为“可解释模糊人工智能”(explainable fuzzy AI)的新型反馈。该系统不仅仅是给出一个分数;它向教师展示了计算机使用了哪些证据、每项证据占多大的权重,以及判断在何处存在不确定性。至关重要的是,它使用了一种承认教学领域存在“灰色地带”的方法,即承认一门课程可能在某些方面很强,而在另一些方面较弱,而不是强行贴上一个单一、僵化的标签。

结果表明,反馈是如何被解释的,比技术本身更为重要。相比于接受传统分数或“黑箱”AI 摘要的教师,那些收到“可解释模糊”反馈的教师觉得评估过程要公平得多。他们觉得该系统尊重他们的专业判断,并为他们提供了决策是如何做出的清晰图景。这种公平感导致了第二个关键的变化:这些教师培养了研究人员所称的“校准信任”(calibrated trust)。他们并没有盲目遵循计算机的建议,也没有愤怒地拒绝它,而是学会了在有用之处依赖反馈,并在有限之处质疑反馈。这种平衡的信任是开启行动的关键。因为他们信任这一过程,这些教师更有可能实际阅读报告、解读建议,并在学期结束前对他们的课程材料和教学方法做出实质性的改变。

相比之下,收到“黑箱”AI 反馈的教师并未表现出同样的改进水平。尽管计算机正在分析他们的教学,但缺乏透明度使他们感到防御或困惑,并且不太可能根据建议采取行动。研究发现,这一系列事件——公平导致信任,进而导致行动——是通往更好教学的清晰路径。研究人员还发现,这种方法对于那些已经感受到高绩效压力的教师效果最好,因为清晰的解释帮助他们理解了“游戏规则”。此外,对于那些对 AI 工作原理有更高理解的教师,该方法也更为有效,因为他们能更好地解读系统提供的细微细节。

这项研究涉及 806 名完成了整个实验周期(从初始调查到最终课程变更审查)的教师。研究人员不仅测量了教师声称要做什么,还观察了他们实际做了什么,查看了修订后的教学大纲、更新的教案以及后续的学生评估。数据证实,处于“可解释”组的教师在教学中取得了更多实质性的改进。研究结果表明,人工智能在教育中的价值并不在于算法的复杂性,而在于它所开启的对话的清晰度。当一个系统承认它知道什么、不知道什么以及如何得出结论时,它就从一个焦虑的来源转变为一个职业成长的工具。研究表明,为了让技术真正帮助教师提高,其设计目标不应仅仅是计算,更应该是解释,从而确保处于过程中心的那个“人”感到被看见、被理解,并被赋予改变的力量。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →