✨ 要点🔬 技术摘要
想象一下,你正在尝试学习一项复杂的技能,比如精通一个新的视频游戏关卡,或者解决一个棘手的化学谜题。在现实世界中,如果你卡住了,你可能会向老师寻求提示,或者他们可能直接告诉你答案。但在数字世界中,计算机通常会根据你的回答来猜测你有多聪明。为了做到这一点,它们使用一种叫做“知识追踪”(Knowledge Tracing)的系统,这基本上是让计算机记录你已知和未知知识的一种方法。其中一种流行的方法是“Elo 等级分系统”(Elo Rating System),这是一种最初为对弈等级排名而发明的算法。它的运作方式就像一把梯子:如果你击败了一个强大的对手,你就向上爬;如果你输给了一个弱小的对手,你就向下掉。研究人员一直在问一个大问题:如果计算机帮助了你,情况会怎样?如果你在计算机给了你提示之后 才解决了问题,这是否等同于完全靠自己解决问题?如果计算机不区分这两者,它可能会认为你是个天才(而实际上你只是需要一点点推动),或者认为你在挣扎(而实际上你只是在等待帮助)。算错这个分数是一个问题,因为这意味着计算机下次可能会给你错误的教学内容。
这篇论文通过研究如何让 Elo 等级分系统对“反馈”变得更聪明,来解决这个确切的问题。研究人员研究了 296 名正在进行一项复杂化学任务(设计滴定方案——即混合化学物质的逐步计划)的大学生。这些学生可以尝试任意多次,而且在每一次错误尝试后,系统都会给出特定的反馈,范围从微小的提示到完整的正确答案。该团队测试了两种能够真正关注这种“帮助”的学生评分更新方法。
第一种想法被称为“新项目”(New Item)模型,它将每个版本的题目视为一个完全不同的游戏。它认为:“不借助帮助解决这个谜题是一回事,但带着提示解决它是完全不同的挑战。”因此,计算机为“有提示”的版本创建了一个单独的分数。第二种想法被称为“概率修正”(Probability Modifier)模型,它有点像一种魔法加成。它认为:“问题本身是相同的,但拥有提示会让正确率变得容易得多。”它会根据提示的大小来调整成功的概率。
当研究人员将这些想法与忽略是否给予帮助的旧有标准方法进行对比测试时,结果非常明确。这两种新模型在预测学生是否能正确完成下一步方面,表现得显著更好。它们不仅预测得更准,而且在不同学生群体中的表现也更加一致,甚至可以预测新加入学生的表现。该研究利用一个包含 47,224 次交互的数据集来证明,忽视反馈会导致对学习者知识掌握情况的描绘变得模糊且不准确。通过对这种“帮助”进行显式建模,计算机能获得一个更清晰、更公平的学习者视图,确保“分数”反映的是真实的技能,而非仅仅是当时提供了多少协助。
技术摘要:在基于 Elo 的知识追踪中引入反馈以实现迭代问题解决
问题陈述
在数字学习环境中,学习者通常通过带有自动化反馈的迭代尝试来解决复杂任务。虽然标准的 Elo 等级分系统(ERS)因其计算效率和可扩展性,被广泛用于估计学习者能力和题目难度,但在这些场景下存在一个关键局限:它们将所有成功的结局等同对待。因此,ERS 无法区分独立成功与在协助下取得的成功。这种疏忽会导致知识估计出现偏差,因为学习者的表现可能反映的是所接收反馈的质量,而非其内在的能力。本文旨在解决在自动化反馈作为迭代问题解决过程的重要组成部分时,如何准确建模学习者知识的挑战。
研究方法
数据与背景
本研究利用了来自 LabNBook 平台、包含 296 名大学生共 47,224 次学习者-题目交互的数据集。任务涉及设计酸碱滴定方案,这是一项复杂的活动,需要进行动作的选择、参数化和排序。系统采用基于约束的模型(CBM)来根据 42 个专家定义的约束(项目)对提交的内容进行评估。反馈是在出现错误提交后提供的,针对特定的错误提供不同程度的协助(编码为 0 到 5 的序数变量,其中 0 表示无反馈,5 表示显式的正确解)。
建模框架
作者提出了一个模型层级,从标准基准模型过渡到具备反馈感知能力的扩展模型。
基准模型:
标准 ERS (ST): 使用单个全局参数来建模学习者知识 (θ k \theta_k θ k ) 和题目难度 (d i d_i d i ),并采用标准的逻辑函数。
增强型 ERS (EN): 作为比较的主要基准。它通过以下方式改进了 ST:
任务类型特定的知识: 用特定于任务类型(知识组件)的参数取代全局知识。
动态更新速率: 引入题目难度更新的衰减因子,以反映随着数据积累不确定性的降低。
先验知识估计: 在初始交互期间提升更新速率,以更好地估计先验知识。
反馈感知扩展模型: 本文引入了两个不同的模型来整合反馈,两者都区分了无辅助(l = 0 l=0 l = 0 )和有辅助(l > 0 l>0 l > 0 )的尝试:
新项目 (NI) 模型: 基于“反馈从根本上改变了任务性质”的假设进行运作。它将每一对 ( i t e m , f e e d b a c k _ l e v e l ) (item, feedback\_level) ( i t e m , f ee d ba c k _ l e v e l ) 视为一个独特的题目。项目空间从 I I I 扩展到 ( L + 1 ) × I (L+1) \times I ( L + 1 ) × I ,其中 L L L 是最大反馈等级。每个变体都有自己的难度参数 (d i , l d_{i,l} d i , l )。
概率修正 (PM) 模型: 基于“反馈并未改变任务本身,但以分级方式提高了成功的概率”的假设进行运作。它使用题目空间的二元区分(无辅助 vs 有辅助),但引入了一个依赖于等级的偏移量 (c l c_l c l ) 到成功概率函数中。概率建模为 σ ( θ k , t ( i ) − d i , f ( l ) + c l ) \sigma(\theta_{k,t(i)} - d_{i,f(l)} + c_l) σ ( θ k , t ( i ) − d i , f ( l ) + c l ) ,其中 c l c_l c l 代表由反馈等级 l l l 引起的成功概率偏移。
评估策略
作者使用均方根误差 (RMSE) 和 ROC 曲线下面积 (AUC) 对模型进行了评估。为了确保结论的稳健性,作者采用了三种互补的评估策略:
对学习者差异的稳健性: 通过对学习者轨迹进行自助采样(bootstrap)程序,测试在人口扰动下的稳定性。
跨学习者的一致性: 使用 Wilcoxon 符号秩检验来确定一个模型是否在个体学习者层面始终优于另一个模型。
对未知学习者的泛化能力: 使用留出测试,即用一半的学习者训练模型,并在另一半学习者上进行评估,以评估泛化能力。
主要结果
预测准确性: 在所有评估指标上,两种反馈感知模型(NI 和 PM)的表现都显著优于反馈不可知的增强型 (EN) 模型和标准 (ST) 模型。
与 EN 相比,NI 和 PM 模型在稳健性和泛化测试中实现了约 5.2% 至 5.5% 的 RMSE 增益。
性能差异的置信区间严格为正,且 Wilcoxon p 值极小(< 10 − 20 < 10^{-20} < 1 0 − 20 ),表明改进是具有统计学意义且一致的。
模型动态特性:
NI 模型 表明,将反馈等级视为不同的题目可以导致难度估计更稳定地收敛,这可能是因为 ( i t e m , f e e d b a c k _ l e v e l ) (item, feedback\_level) ( i t e m , f ee d ba c k _ l e v e l ) 对在难度方面更具同质性。
PM 模型 以更紧凑的参数化(更少的难度参数)达到了与 NI 相当的性能,尽管它需要估计额外的超参数 (c l c_l c l ) 来表示概率偏移。
两种模型都显示,反馈感知方法只需要相对较少的数据即可超越基准模型,性能差距在仅经过几百次预测后便开始显现。
稳定性与辨别力: 至关重要的是,这些预测准确性的提升是在不牺牲模型可解释性的前提下实现的。NI 和 PM 均保留了对学习者知识剖面的有效辨别能力,并产生了稳定的题目难度估计,这对于自适应学习系统至关重要。
意义与主张
本文主张,在迭代学习环境中,显式建模反馈对于准确的知识追踪至关重要。作者认为,忽略独立成功与辅助成功之间的区别会导致学习者能力的估计出现偏差。
其主要贡献在于证明了对 Elo 等级系统的轻量级扩展 可以有效地捕捉反馈丰富的学习中的细微差别。通过提出 新项目 (NI) 和 概率修正 (PM) 模型,本研究提供了计算高效的替代方案,可以与复杂的深度学习方法或贝叶斯知识追踪 (BKT) 扩展进行对比。研究结果表明:
反馈不应仅仅被视为事后的修正,而应被视为一种从根本上改变学习条件的变量。
可以在保持 ERS 的可扩展性和实时适应性的同时,将其整合进反馈机制中。
在建模反馈时,选择将其建模为任务转换 (NI) 还是概率偏移 (PM),取决于对模型表达能力与复杂度的权衡,因为两者在此背景下都产生了高度可比的实证结果。
作者总结道,这些方法为教育数据挖掘提供了一个引人注目的替代方案,弥合了对教学支持进行复杂建模的需求与实现大规模、实时自适应系统之实际约束之间的差距。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。