EMSEIF Provides an Explainable AI Framework for Multi Stakeholder Curriculum Feedback and Quality Assurance in Higher Education
本研究验证了可解释多利益相关者教育智能框架(EMSEIF),这是一个通过可解释人工智能、知识图谱和公平性审计,将多样化的高等教育反馈转化为可审计的层面级证据及可操作的课程改进的实证系统。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
大学是庞大且数据丰富的场所,却往往难以将收集到的海量信息转化为有意义的行动。每年,学生、教师、校友、家长和雇主都会填写表格、撰写评论并参与委员会讨论,以探讨课程设置的效果如何。这些反馈是质量保证的命脉,但在许多机构中,它们却迷失在人工阅读、简单的百分比图表以及难以追溯到具体决策的会议纪要所形成的迷雾之中。核心挑战不在于缺乏信息,而在于缺乏清晰度:你如何将成千上万个不同的声音——每个声音都有不同的视角和不同的表达方式——转化为一个清晰、公平且具有可操作性的改进计划?
这正是教育数据挖掘领域发挥作用的地方,它试图利用计算机在人类反馈中寻找模式。然而,仅仅要求计算机判断一条评论是“好”还是“坏”往往过于粗糙。一名学生可能会称赞老师的活力,同时又抱怨课程缺乏实际项目。为了发挥作用,系统需要理解这些细微差别,准确识别正在讨论的是课程的哪个部分,并解释其得出结论的原因。此外,由于这些决策影响着真实的人的教育与职业生涯,系统不能是一个“黑箱”;它必须足够透明,以便人类领导者能够信任其建议并验证其公平性。
印度 MIT 艺术、设计与技术大学的研究人员开发了一个名为 EMSEIF 的新框架来解决这一问题。他们不仅仅是构建了另一个预测结果的工具,而是创建了一个完整的系统,将原始反馈与具体的课程变更联系起来,同时让渡最终决策权给人类。研究团队使用一个大规模的真实世界数据集测试了他们的系统:来自他们所在大学的 2023-24 年度质量保证记录。该档案是一份长达 1,542 页的文件,包含数千份反馈表、评分表和官方信函。研究人员将整个档案转换成了由 8,742 个独立反馈单元组成的结构化数字库,确保每一条数据都标记了说话者是谁、来自哪个部门以及涉及哪个特定主题。
该系统的核心在于其能够在不抹杀差异的情况下倾听不同声音的能力。在典型的大学环境中,一名学生可能会要求增加“动手实践”,而一名雇主可能会要求“行业接触”。这些说法听起来不同,但他们表达的是同一件事。研究人员教会了系统识别这些不同的表达方式,并将它们归类到一个共同的主题下,例如“实践接触”。他们还构建了一个被称为“知识图谱”的数字地图,将这些主题与特定的课程和学习目标联系起来。这使得系统能够看到,一个部门对“更多项目”的需求与另一个部门对“更好设备”的需求是相互关联的,从而创造出一幅关于需要改变什么的统一图景。
为了确保系统的可信度,研究人员设计了其可解释性。当计算机提出一项变更建议时,它不仅仅给出一个“是”或“否”的答案。相反,它会生成一张“证据卡”,展示哪些词汇导致了该建议,系统的置信度如何,以及不同群体(如学生和雇主)是否对该问题达成一致。如果系统检测到它对某一群体存在不公平对待,它会在做出任何建议之前将其标记出来供人工审查。这种“人机协同”(human-in-the-loop)的方法意味着,计算机处理分类和分析数据的繁重工作,但最终的行动必须由人类学术领导者批准。
研究结果表明,这种方法比旧方法有效得多。在与标准计算机模型进行对比测试时,新系统在识别特定课程问题和预测哪些反馈具有可操作性方面表现得更加准确。它成功识别了三个所有利益相关者都认为需要变革的主要领域:对更多实践性、动手式学习的需求;对人工智能和数字工具技能更新的需求;以及更好地为学生就业做准备的需求。例如,系统发现虽然航空航天专业的学生总体满意度较高,但他们特别希望获得更多的飞机模型接触机会和实地考察机会,这是一个在简单的整体满意度评分中可能会被忽略的细节。
至关重要的是,研究证明了该系统能够在不同群体之间保持公平。在进行调整之前,系统显示出一些偏差,即对于某些系部或利益相关者角色,其准确性可能较低。通过应用特定的修正措施,研究人员将这些差距缩小到了符合严格治理标准的水平,确保没有任何单一的声音被系统性地忽视。该系统还证明了其建议可以与大学采取的实际行动保持一致。当研究人员将计算机的建议与大学官方的“已采取行动”信函和会议纪要进行对比时,他们发现两者高度吻合,这证明该系统不仅是在生成想法,而且是在识别机构已经在尝试进行的那些变革。
研究人员谨慎地指出,这并不是一个能自动解决所有教育问题的“魔杖”。该系统是一个支持工具,而非人类判断的替代品。它无法决定什么是最好的课程,它只能组织证据,以便那些做出决策的人能够更清晰地看到全貌。研究还强调,虽然该系统在特定的这所大学内运行良好,但若要将其应用于其他地方,则需要根据当地的文化和规则进行调整。尽管如此,这项工作提供了一个清晰且可复制的蓝图,展示了大学如何从收集反馈转向真正利用反馈,从而完成从“人们说了什么”到“机构做了什么”的闭环。
最终,这项研究为如何看待质量保证提供了一种新的思考方式。它表明,反馈的价值不在于最终的分数或平均评分,而在于隐藏在评论中的具体且具有可操作性的证据。通过将先进的计算机分析与人类监督以及对公平性的承诺相结合,研究人员展示了将混乱的文书堆变成一条清晰、可导航的改进路径是可能的。该系统不仅告诉大学哪里出了问题,还向他们展示了在哪里看、为什么重要以及如何修复,同时始终将人类的声音置于过程的核心。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。