← 最新论文
💻 computer science

Target-Adaptive Probability Calibration for Reliable Student Risk Prediction under Cross-Module Dataset Shift

本研究表明,利用适量的历史目标域数据进行目标自适应概率校准,能够显著提高 AI 在经历数据集偏移的课程中对学生风险预测的可靠性与可解释性,且不会损害其排序性能。

原作者: Qiuying Li, Jianqiang Tan

发布于 2026-08-20
📖 1 分钟阅读☕ 轻松阅读

原作者: Qiuying Li, Jianqiang Tan

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在广阔的网络教育领域,平台生成着持续不断的数字足迹:对课程材料的点选、作业的提交以及登录活动的模式。教育工作者和管理人员希望利用这些数据,在情况变得无法挽回之前发现那些挣扎中的学生,为那些可能面临辍学风险的学生提供帮助。然而,将这些数字痕迹转化为可靠的预警系统却充满了困难。一个在某一门课程中表现完美的模型,在应用于另一门课程时往往会失效,仅仅是因为学生、教学风格或评分方式的不同。此外,一个计算机程序可能非常擅长将学生从“最高风险”到“最低风险”进行排序,但如果它分配给某个学生的具体风险数值是错误的,这就会变得很危险。如果系统告诉老师一名学生有 90% 的失败概率,而实际概率只有 30%,老师可能会在并不需要的学生身上浪费宝贵的时间,或者更糟的是,忽略了真正需要帮助的学生。核心挑战不仅在于预测谁会遇到困难,还在于确保计算机生成的概率数值是诚实且值得信赖的,即使该系统被移动到一个新的课堂环境中。

山东英才大学的研究人员通过构建一个旨在使这些风险预测在不同大学模块(即课程)之间保持可靠的框架,解决了这一问题。他们使用了一个来自开放大学(Open University)的大规模匿名数据集,其中包含了近三万名学生在七个不同模块中的记录。研究团队建立了一个严格的测试方案:他们在六个模块的数据上训练模型,然后尝试将这些模型应用于他们从未见过的第七个模块。这种被称为“留一模块法”(leave-one-module-out)的测试,模拟了现实世界中的场景——即学校希望利用为一个特定课程集构建的系统来帮助完全不同的另一组课程中的学生。他们在课程开始后的两周、四周、六周和八周这四个不同的时间点检查了他们的预测结果。这使他们能够观察到随着学生相关信息的增加,预测的准确性是如何变化的。

研究表明,虽然这些模型在对学生进行排序(识别哪些学生比其他学生更有可能失败)方面表现出色,但它们产生的原始概率数值在转移到新课程时往往具有误导性。当研究人员在没有进行任何调整的情况下,直接将针对一个模块训练的模型应用于另一个模块时,预测的概率与实际结果并不匹配。例如,系统预测的某种风险水平可能始终高于或低于实际发生的情况。对于预警系统来说,这是一个关键性的失败,因为管理者需要知道“高风险”标签确实意味着极高的失败概率,而不仅仅是一个相对的比较。为了解决这个问题,研究人员开发了一种称为“目标自适应校准”(target-adaptive calibration)的方法。这个过程涉及获取来自新课程的一小部分历史数据——具体来说,是该课程早期开设时的结果——并利用这些数据对模型的数值进行微调。他们测试了使用代表 10%、20% 或 30% 学生群体的历史数据,以观察需要多少程度的调整。

结果显示,即使是使用来自新课程的少量历史数据,也能显著提高预测的可靠性。当研究人员使用来自 30% 学生群体的历史数据对模型进行重新校准时,概率估计的准确性得到了显著提升。衡量误差的指标——布里尔分数(Brier score)从 0.243 降至 0.205,而另一个衡量概率与现实匹配程度的指标——期望校准误差(expected calibration error)从 0.158 降至 0.076。至关重要的是,这种调整并没有改变学生的排名顺序;处于最高风险的学生仍然排在名单的前列。相反,这种调整只是让分配给这些学生的数值变得更加准确。这意味着,当老师看到一个“高风险”分数时,可以相信这个数字真实地反映了该学生失败的可能性,而不是基于另一门课程的扭曲猜测。

研究人员还探讨了是否可以使用更复杂的方法,例如尝试通过数学手段对数据进行重新加权,以解释课程之间的差异,是否会产生更好的结果。他们发现,这些更复杂的方法相比于使用历史数据来调整概率的简单方法,并没有提供任何显著的优势。最有效的策略仅仅是获取模型的输出,并利用已知的新课程过去的结果对其进行微调。这一发现很重要,因为它表明学校不需要为他们提供的每一门课程都构建一套全新的、复杂的模型。相反,他们可以使用一个通用模型,然后通过少量的本地数据进行微调,使其变得值得信赖。

除了数字之外,研究还观察了这些经过校准的概率如何转化为现实世界的行动。在学校环境中,教师和支持人员的时间有限,只能查看一定数量的学生。研究人员通过询问以下问题模拟了这种约束:如果老师只能查看前 10% 的高风险学生,他们能抓到多少实际的未来辍学者?他们发现,经过校准的概率可以让我们更清晰地理解这种权衡。在没有校准的情况下,老师设置的阈值看似合理,但最终可能会审查过多的学生或错过过多的风险个体。有了经过校准的概率,老师可以设定一个特定的阈值,并确切地知道会有多少学生被标记,以及能抓到多少名风险学生。例如,在特定的风险阈值下,校准后的系统在减少近一半工作量的同时,仍能捕捉到相当比例的失败学生,这使得该系统对于繁忙的教育机构来说更具实用性。

研究还检查了这些预测在不同背景或能力的各类学生群体中的公平性。他们发现,尽管整体系统运行良好,但在预测特定子群体的结果方面仍存在差异。这表明,即使是经过良好校准的系统,也需要持续的监测,以确保它不会在无意中使某些学习群体处于不利地位。研究人员使用了工具来解释哪些因素驱动了预测,发现最重要的信号与缺失的作业和近期的不活跃活动有关。这种透明度有助于教育工作者理解,系统是在根据具体的行为(如未提交作业或停止参与)来标记学生,而非基于隐藏或有偏见的因素。

最终,这项研究为如何使教育中的人工智能更加可靠和有用提供了路线图。它证明了将预测系统从一门课程转移到另一门课程时,最大的障碍不一定是正确对学生进行排序的能力,而是使概率数值保持诚实的能力。通过使用一种简单的过程——利用少量的本地历史数据来调整模型,学校可以确保其预警系统既准确又具有可操作性。研究结论指出,虽然技术很强大,但其真正的价值在于能够适应特定的课堂环境,从而确保发送给教育工作者的警告不仅在统计学上是合理的,而且在支持那些正在挣扎的学生方面是真正有帮助的。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →