Incremental Predictive Value of Item-Adjusted Process Indicators for Mathematics Achievement among Korean Students in PISA 2022: A School-Level Out-of-Sample Validation Study
本研究表明,在严谨的学校层面样本外验证设计下,源自计算机化测评的项目调整过程指标,相较于传统的问卷数据,显著提高了对韩国学生在 PISA 2022 中数学成就的预测能力。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
每年,全世界有数百万名十五岁的青少年参加一项名为 PISA 的大规模测试,旨在考察他们如何将所学知识应用于现实生活中的情境。在这一测试的数学部分,学生坐在电脑前解决问题。虽然最终得分告诉我们他们答对了多少题,但计算机还记录了一层隐藏的数据:他们每道题具体花了多长时间、点击了多少次,以及修改答案的频率。多年来,研究人员一直想知道,这些行为的数字足迹是否能告诉我们一些通过简单问卷调查无法获取的关于学生能力的信息。我们知道,询问学生的自信心、焦虑感和学校环境能让我们很好地了解他们的潜力,但我们也知道,学生说自己是如何做的,与他们在解题过程中实际是如何做的,可能会大不相同。核心问题在于,一旦我们已经询问了他们的背景和感受,学生与测试交互的原始、未经处理的记录是否能提供任何新的、有用的信息。
一位韩国的研究人员采用了一种非常严谨的方法来回答这个问题,使用了 2022 年参加数学测试的 6,000 多名学生的数据。他们首先通过仅使用学生在调查问卷中提供的信息构建了一个强大的基准模型。这份调查涵盖了广泛的主题,包括家庭经济地位、对自身数学能力的信心程度、焦虑感、对学校的喜爱程度,以及他们在课堂上接触过什么样的数学题。单凭这份调查数据就足以成为学生最终得分的强有力预测指标。当研究人员观察学生实际完成测试时的计算机记录——即他们花费的时间和采取的操作次数时,他们发现这些行为数据本身也是有用的,但不如调查数据准确。学生自述的感受和背景条件在预测其最终得分方面,显然比单纯统计点击次数和所用秒数要有效得多。
然而,当研究人员观察这两类信息如何协同作用时,情况发生了变化。挑战在于计算机记录是杂乱的;在某道题上花费较长时间可能意味着学生遇到了困难,也可能仅仅是因为那道特定的题目比其他题目更难。为了解决这个问题,研究人员对数据进行了调整,使得每个学生的用时和操作次数仅与其他面临完全相同问题的学生进行比较。这消除了测试设计本身的影响,从而留下了学生相对的行为表现。当研究人员将这些经过调整的行为指标加入到调查模型中时,对学生数学成绩的预测能力显著提高了。结合后的模型所产生的误差比仅使用调查模型的误差在测试量表上低了约 11 分。这种提升在不同的计算机算法下都是一致的,并且即使在研究人员将模型应用于完全陌生的新学校系统进行测试时,这一结果依然成立,这意味着该模型可以预测从未见过的学生的表现。
研究人员谨慎地解释了这种提升意味着什么,以及它并不意味着什么。他们强调,行为数据并未证明花费更多时间或点击更多按钮会导致学生获得更高的分数。相反,这项研究表明,学生努力程度和策略的数字记录包含了无法通过提问获取的关于其能力的额外线索。研究还排除了这种提升仅仅是测试形式所导致的结果。通过调整数据以考虑每道题目的特定难度,他们证明了其价值来自于学生的实际行为,而不是因为计算机测试恰好将某些学生引导至更难或更容易的问题。研究结果表明,在大规模测试中,学生与计算机交互的方式是他们向我们介绍自身情况的有力补充,能够为他们的数学能力提供一个更清晰、更完整的图景。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。