Sequential generalized kernel equating: Providing comparable scores across multiple test forms with nonequivalent groups and differently measured covariates
本文提出并评估了“序贯广义核等值”方法,该方法通过考虑不同测验形式所测得的协变量分布差异,降低了非等效组测验分数等值中的偏差。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象你是一位老师,试图比较两个不同班级(A 班和 B 班)的成绩,以判断哪个班级表现更好。但这里有个难题:你不能直接查看他们的期末考试成绩,因为 A 班参加的是难度较高的试卷,而 B 班参加的是难度较低的试卷。为了进行公平的比较,你需要对成绩进行“等值”处理——将它们转换到同一量尺上。
通常,为了公平地做到这一点,你会给两个班级一些相同的“锚点”题目,以此来判断一份试卷比另一份难多少。但如果你没有这些锚点题目怎么办?
这正是本文要解决的问题。它提出了一种巧妙的变通方法,利用背景信息(如学生过去的成绩或学校类型)作为缺失锚点题目的替代指标。作者将这种方法称为序贯广义核等值法。
以下是该问题及其解决方案的简明解析:
问题所在:“尺子”本身已损坏
在标准方法中,我们假设背景信息(即用于衡量能力的“尺子”)对所有人都是相同的。
- 场景:假设你使用“先前考试的数学成绩”作为背景尺子,来帮助等值新的英语考试成绩。
- 故障:如果 A 班去年参加的数学考试很难,而 B 班参加的数学考试很容易呢?
- 结果:数学成绩"80 分”对 A 班和 B 班意味着完全不同的水平。如果你用这些不匹配的数据来修正英语成绩,最终的比较就会产生偏差。这就像试图用一把对一个人会缩短、对另一个人会拉伸的尺子来测量两个人的身高。
解决方案:“两步”修复法
作者建议采用序贯方法。不要立即使用原始的、不匹配的背景分数,而是首先修正背景分数。
可以这样理解:
- 第一步:校准尺子。在比较英语考试之前,你先取 A 班和 B 班的数学成绩,并相互进行“等值”处理。你将 B 班的“简单数学”成绩转换到 A 班的“困难数学”量尺上。现在,大家都使用同一种“数学语言”了。
- 第二步:比较主要事件。既然背景数学成绩已经公平且可比,你就使用这些经过调整的分数来帮助你等值英语考试。
研究发现了什么
作者进行了计算机模拟(就像创建一个包含虚拟学生和试卷的电子游戏),以观察这种两步法是否比旧的一步法更有效。
- 当“尺子”损坏时(难度不同):旧方法产生了不公平的结果(高偏差)。新的序贯方法首先修复了尺子,这使得最终的英语成绩比较更加准确。
- 当“尺子”完好时(难度相同):两种方法都表现良好,但新方法并未造成任何损害。
- 权衡:新方法增加了一点点“噪声”(统计不确定性),因为你多进行了一步计算。然而,消除巨大偏差(不公平)所带来的收益远远超过了这一微小成本。
现实世界测试:捷克高中毕业考试
为了证明该方法在现实生活中的有效性,研究人员将其应用于捷克国家高中毕业考试。
- 他们试图比较春季和秋季参加考试的学生英语成绩。
- 他们使用学生的**母语(捷克语)**成绩作为背景“尺子”。
- 现实核查:他们发现,捷克语考试在历年间实际上非常一致。由于在这个特定案例中“尺子”并没有真正损坏,与旧方法相比,新方法对最终英语成绩的改变不大。
- 教训:这证明了虽然新方法很强大,但如果你的背景数据本身已经稳定,你并不总是需要它。然而,如果你怀疑你的背景数据不一致(例如不同的数学考试),那么这种方法就是确保公平性的安全网。
一句话总结
如果你试图在没有共享“锚点”考试的情况下比较不同群体的考试成绩,并且正在使用背景数据(如过往成绩)来辅助,那么务必首先确保背景数据的测量是公平的。如果背景数据来自不同来源或难度不同的考试,请使用这种序贯方法,在修正主要考试成绩之前先修正背景数据。这样才能确保你不会将苹果与橙子进行比较。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。