An Optimized Stacking Ensemble Model for Forecasting Student Dropout
本研究提出了一种集成了K-最近邻与贝叶斯网络分类器并经过超参数调优及基于SMOTE平衡处理增强的优化堆叠集成模型,该模型实现了85.9%的准确率,并优于现有方法,从而为预测学生辍学提供了一种有效的预警工具。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
每年,世界各地的大学都面临着一个无声却持久的危机:许多学生在开始学业后却未能完成学业。这种流失不仅是相关个人的个人悲剧,还会消耗机构资源,降低毕业率,并使社区缺乏所需的专业人才。几十年来,学校一直试图通过人工审查成绩和出勤情况来解决这一问题,寻找那些似乎正在下滑的学生。然而,这些方法往往反应过慢,无法在为时已晚之前为学生提供帮助。近年来,研究人员转向了机器学习——这是计算机科学的一个分支,其中软件通过学习识别数据中的模式,而非通过明确编程规则进行运作。通过将成千上万名学生的历史记录输入这些系统,计算机可以识别出人类观察者可能忽略的细微预警信号,从而提供早期干预的机会,让学生重回毕业之路。
来自维多利亚大学(Victoria University in Kampala, Uganda)和哈尔格萨(Hargeisa,位于索马里兰)团结大学(The Unity University)的一个研究小组采取了更进一步的方法,开发了一种专门针对这一挑战的新型预测系统。该系统并非依赖单一的计算机算法做出判断,而是结合了两种不同方法的优势。第一种方法被称为“K-最近邻”(K-Nearest Neighbors),其原理是通过查看一名学生的记录,并寻找与其最相似的历史学生,以观察那些学生最终的结局。第二种方法是“贝叶斯网络”(Bayesian Network),它根据成绩、经济状况和个人情况之间复杂的关联网络,计算一名学生退学的可能性。虽然每种方法单独使用时都很有用,但研究人员发现,它们有时会对同一份数据产生不同的看法。为了解决这个问题,他们创建了一个“堆叠”(stacking)模型,即一种由第三个更智能的程序监听前两个预测并做出最终决定的结构。这个最终程序就像一位经验丰富的编辑,权衡来自两个来源的证据,从而产生比其中任何一种方法都更可靠的结论。
研究人员使用来自团结大学的庞大真实学生记录对该系统进行了测试,涵盖了2021年至2025年间的数据。该数据集包括4,400多名学生,追踪了36个不同的因素,从学生通过的课程数量到其财务状况及人口统计背景不等。这类研究的一个主要障碍在于,大多数学生会留在学校,而退学的学生则少得多,这为计算机创造了一个不平衡的竞争环境。为了解决这个问题,团队使用了一种技术来人为平衡数据,确保系统在学习识别退学预警信号的同时,也能同样有效地识别安全的学生。随后,他们对数据进行了拆分,利用大部分数据来训练系统,并保留一部分用于测试系统在面对从未见过的学生时的表现。
结果表明,这种新的组合系统确实优于单一方法。在测试中,该堆叠模型能以约86%的准确率正确识别学生会退学还是留校。更重要的是,它在捕捉真正处于风险中的学生方面表现出色。它正确标记了81%最终离开的学生,对于试图进行干预的学校来说,这是一个至关重要的指标。相比之下,单一方法以及一种较简单的组合方式(称为“软投票”,soft voting)的准确性较低,要么漏掉了更多的风险学生,要么错误地标记了安全的学生。分析还揭示了哪些因素最为重要:学术表现(特别是通过的课程数量和累计成绩)是最强的预测因子,紧随其后的是财务指标,如学费缴纳状态以及学生是否欠缴学费。
这项研究表明,通过将不同类型的机器学习交织在一起,大学可以为学生建立一个更强大的安全网。该模型并非取代人类辅导员,而是为他们提供一个优先开展工作的有力工具。通过在学生真正离开之前识别出最有可能离开的学生,机构可以在最需要的时刻提供经济援助、学术辅导或心理咨询。尽管研究人员指出,他们的模型是基于单一大学的数据进行训练的,未来的工作应当在不同地区进行测试并使用更先进的技术,但其研究结果提供了一条清晰的前进路径。他们证明了,凭借正确的数据与算法的结合,完全有可能扭转学生流失的局面,将管理退学的被动过程转变为留住学生的积极策略。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。