每学期,大学都面临着一场无声的危机:那些开始了课程却从未完成的学生。几十年来,教育工作者一直试图预测谁有可能辍学,希望能及早提供帮助。这一领域被称为学习分析(learning analytics),它将学生数据视为一张地图,寻找预示问题的模式。传统上,这些地图是静态的快照,基于学生的背景、年龄或往年的成绩。但一个学生的过程并非一张单幅照片,而是一部逐周上演的电影。退学的风险并非静止不动,它随着学生与在线材料的互动、错过截止日期或仅仅是停止点击课程网站而发生偏移和增长。研究人员的核心问题在于,我们是否可以通过实时观看这部“电影”,而不是仅仅看一眼“片头字幕”,来构建一张更好的地图。
东部大学的一组研究人员致力于通过建立一种新型测试来回答这个问题,以比较不同的学生辍学预测方法。他们使用了一个来自开放大学(Open University)的大规模且著名的数据集,该数据集追踪了多个课程中的数千名学生。研究人员并没有简单地宣布某个计算机模型为获胜者,而是设计了一个严谨的实验,尊重观察时间的两种不同方式之间的差异。其中一组模型被他们称为“动态周更”(Dynamic Weekly)家族,它们每周观察学生,并在每次出现新的活动数据时更新其预测。另一组则是“静态早期窗口”(Static Early-Window)家族,它们采取了不同的方法:仅观察学生前四周的行为,然后对余下的课程进行一次性的固定预测。研究人员并未将这两种方法视为需要相互排名优劣的对手,而是将其视为观察同一现象的两种不同视角,从而确保比较的公平性,并确保结果不会因数据的组织方式而产生偏差。
这项研究对比了十四种不同的计算机模型,涵盖了从简单的统计工具到复杂的人工智能系统。研究人员衡量了每个模型在两方面的表现:正确排列学生风险等级的能力,以及提供与实际辍学人数相匹配的概率数值的能力。由于这两类模型使用的风险公式不同,研究人员在各自的家族内部报告结果,而非创建一个统一的综合排名。在“静态早期窗口”组中,一种名为随机生存森林(Random-Survival Forest)的模型脱颖而出,成为最可靠的模型。它最擅长识别处于风险中的学生,而且至关重要的一点是,它的概率估计非常准确。例如,当该模型预测一名学生有百分之三十的辍学概率时,该组学生的实际辍学率也非常接近百分之三十。这种准确性至关重要,因为这意味着学校可以信任这些数字来决定谁需要帮助。在“动态周更”组中,模型的表现非常接近,其中泊松分段指数模型(Poisson Piecewise-Exponential model)在某一特定指标上略占优势,但没有哪个模型在所有衡量标准中都占据主导地位。
或许最显著的发现不在于哪个计算机模型更聪明,而在于模型究竟利用了哪些信息来做出决策。研究人员通过逐一剔除不同类型的数据来测试这一点。他们首先剥离了静态背景信息,如学生的年龄、性别或过往教育程度;接着,他们剥离了行为数据,如学生点击课程材料的频率或活跃周数。结果在几乎所有模型中都表现得清晰且一致:背景信息几乎不重要。当行为数据被移除时,模型的辍学预测能力便会崩溃。主导信号并非学生是谁,而是他们在做什么。具体而言,前四周的点击次数和活跃周数是最强的预测因子。这表明,辍学并非一种固定的个人特质,而是一个通过日常参与而展开的过程。
研究还揭示了并非所有模型在可靠性方面都是平等的。虽然大多数顶尖模型都能给出诚实的概率估计,但静态组中的一个名为 XGBoost AFT 的模型在各项指标上表现都很差。它难以正确排列学生,且其概率估计也极其离谱,这表明其数学结构不足以应对学生风险的变化性质。这一发现强化了这样一个观点:模型的构建方式与它所看到的数据同样重要。研究人员得出结论,对于希望建立预警系统的机构来说,最好的方法是使用专注于第一个月行为的模型。他们可以在第四周结束时,利用点击计数和活跃周数等简单数据对学生进行评分,标记出高风险学生并进行干预。该研究并未声称这种方法适用于每所大学或每门课程,因为数据来自特定的模块,但它为理解如何衡量风险提供了一个清晰且统一的框架。其核心启示是:留在学校的路径是由日常行动铺就的,而预测谁会离开的最佳方式是密切观察这些行动,而不是依赖于学生在抵达之前的身份。
技术摘要:用于学习分析中时间性流失风险预测的统一生存分析基准测试
问题陈述
学生流失仍然是高等教育面临的一个持久挑战,然而目前的学习分析(LA)研究受困于碎片化的评估协议。现有的研究通常在异构条件下比较模型,优先考虑排序能力(判别力),却忽视了具备时间感知能力的解释性和校准质量。此外,文献往往未能区分预测信号究竟源自静态学生属性(人口统计学、既往教育背景)还是时间性行为模式(参与度、活动进展)。这种缺乏统一基准的情况使得人们难以判断性能差异反映的是真实的模型优越性,还是时间表示和评估设计产生的伪影。
研究方法
本研究利用 Open University Learning Analytics Dataset (OULAD) 建立了一个统一的、面向生存分析的基准测试,该数据集包含来自 7 个模块和 4 个演示版本的 32,593 个注册记录。其核心方法论创新在于对比了 14 个经过调优的模型,这些模型被组织为两个截然不同的“表示家族”,并在共享协议下进行评估,以在尊重表示差异的同时确保方法论的一致性。
1. 表示家族
- 家族 A(动态周度): 采用人-周期表示法(person-period representation),将每个注册记录扩展为连续的每周观测值。模型估计每周的条件风险率(conditional hazards),并将其累积形成注册层面的生存曲线。该家族包含五个模型:线性离散时间风险模型、神经离散时间生存模型、泊松分段指数模型、梯度提升周度风险模型以及 CatBoost 周度风险模型。
- 家族 B(静态早期窗口): 采用基于课程前四周的固定注册层面表示法。时间信息被压缩为早期窗口摘要(标量),直接输入到连续时间生存模型中。该家族包含九个模型:可比 Cox 模型、DeepSurv、随机生存森林 (RSF)、梯度提升 Cox 模型、Weibull AFT、Royston-Parmar、XGBoost AFT、Neural-MTLR 以及 DeepHit。
2. 特征工程
特征被组织为三个区块,以促进消融实验和可解释性分析:
- 静态结构特征: 人口统计学和既往学术记录(两类家族共有)。
- 动态时间行为特征: 周度级别的参与度信号(仅限家族 A)。
- 早期窗口行为特征: 前四周课程压缩后的参与度摘要(仅限家族 B)。
3. 统一评估协议
本基准测试采用多维度评估框架而非单一指标:
- 预测性能: 通过集成布莱尔得分 (IBS) 衡量全局概率误差,通过时间依赖型一致性指数 (C-index) 衡量序数判别力,以及通过特定时界的布莱尔得分(第 10、20 和 30 周)进行评估。所有指标均使用逆概率加权删失法 (IPCW) 来处理右删失问题。
- 消融分析: 系统性地移除特征区块(静态 vs. 时间性)以量化预测能力的来源。
- 可解释性: 使用线性模型的系数以及非线性模型的分组排列重要性(grouped permutation importance)来识别主导特征区块。
- 校准度: 使用特定时界的加权绝对校准间隙,评估预测风险概率与观察到的流失率之间的数值一致性。
- 稳定性: 通过 200 次注册层面的自助法重采样(不进行模型重新拟合)来评估不确定性,以确定排序的稳定性。
注关于报告: 结果是在每个家族内部分别报告的。作者明确避免了跨家族的单一数值排名,理由是生存分析指标对时间表示非常敏感,而综合排名会将模型差异与表示伪影混淆。
关键结果
1. 预测性能
- 家族 B(静态早期窗口): 随机生存森林 (RSF) 脱颖而出成为领导者,实现了最高的时变一致性指数 (0.674) 和所有三个时界中最低的布莱尔得分。在 90% 的自助法重采样中,它在一致性指标上保持领先地位。XGBoost AFT 是一个显著的异常值,在所有指标上的表现均较差(IBS 为 0.1495,一致性指数为 0.577)。
- 家族 A(动态周度): 所有五个模型的 IBS 差异极小,处于 0.0011 的带状区间内。泊松分段指数模型 显示出最低的点估计 IBS (0.1399),但没有单个模型能在所有指标上同时占据主导地位。
2. 信号归因(消融与可解释性)
消融分析和可解释性分析在测试的八个代表性模型(各家族四个)中得出了高度一致的结论:
- 时间行为特征的主导地位: 移除时间性或早期窗口行为信号导致的性能损失,明显大于移除静态结构协变量带来的损失。在家族 B 中,移除时间信号导致的 IBS 增幅是移除静态信号的 1.20 到 2.46 倍。
- 特征驱动因素: 主导性的预测信号并非人口统计学或结构性特征,而是行为特征。在家族 B 中,“前 4 周活跃周数”和“前 4 周点击量”是主要驱动因素。在家族 A 中,动态时间特征或离散时间索引占据主导。
3. 校准度
- 家族 B: RSF 展示了最佳的校准剖面,在第 10、20 和 30 周的时界下,间隙分别为 0.012、0.016 和 0.014。XGBoost AFT 是一个严重的异常值,其间隙超过了 0.12。
- 家族 A: 与家族 B 的最佳模型相比,家族 A 的模型显示出较大的校准间隙(第 10 周为 0.089–0.098),尽管它们在数值上是连贯的,且远优于 XGBoost AFT 这个异常值。
意义与主张
本文的定位并非宣称取得了新的最先进(SOTA)分数,而是展示了评估架构如何塑造学习分析中的结论。
- 统一基准测试: 研究认为,学习分析中的模型比较必须超越孤立的指标和异构的设置。通过在两个表示家族中使用统一协议,本基准测试分离了时间表示对模型效果的影响。
- 时间行为过程: 本研究的主要实质性贡献在于证明了流失风险是一个时间行为过程,而非仅仅是静态背景属性的函数。这一结论在各种线性、树模型和神经网络架构中均成立,表明早期参与模式是风险的主要驱动力。
- 多维度评估: 研究表明,判别力(排序)对于教育决策是不够的。校准度和可解释性是必不可少的层面;例如,RSF 的领先地位由其强大的校准能力所强化,而 XGBoost AFT 的表现则在判别、误差和校准指标上均表现出一致的低劣。
- 实际可行性: 结果表明,在部署环境与训练环境(共享课程设置)匹配的前提下,利用如 RSF 等树集成模型进行早期窗口预测(第 4 周)是可行且校准良好的,这有助于触发干预措施。
作者承认的局限性:
- 由于研究受限于 OULAD 数据集的共享课程背景,其泛化性受到限制;若要迁移至未见的模块或机构,需要进行本地重新验证。
- 自助法区间仅反映了注册层面的抽样方差,而非模型重新训练后的完整不确定性。
- 未对留出集的预测进行事后重新校准。
- 本研究仅声称存在参与度与流失之间的预测关联,而非因果关系。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。