← 最新论文
📊 statistics

Sequential generalized kernel equating: Providing comparable scores across multiple test forms with nonequivalent groups and differently measured covariates

本文提出并评估了“序贯广义核等值”方法,该方法通过考虑不同测验形式所测得的协变量分布差异,降低了非等效组测验分数等值中的偏差。

原作者: Michaela Vařejková (Institute of Computer Science of the Czech Academy of Sciences, Prague, Czech Republic, Faculty of Mathematics and Physics, Charles University, Prague, Czech Republic), Patrícia Ma
发布于 2026-05-28
📖 1 分钟阅读☕ 轻松阅读

原作者: Michaela Vařejková (Institute of Computer Science of the Czech Academy of Sciences, Prague, Czech Republic, Faculty of Mathematics and Physics, Charles University, Prague, Czech Republic), Patrícia Martinková (Institute of Computer Science of the Czech Academy of Sciences, Prague, Czech Republic, Faculty of Education, Charles University, Prague, Czech Republic), Eva Potužníková (Institute of Computer Science of the Czech Academy of Sciences, Prague, Czech Republic, Faculty of Education, Charles University, Prague, Czech Republic)

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你是一位老师,试图比较两个不同班级(A 班和 B 班)的成绩,以判断哪个班级表现更好。但这里有个难题:你不能直接查看他们的期末考试成绩,因为 A 班参加的是难度较高的试卷,而 B 班参加的是难度较低的试卷。为了进行公平的比较,你需要对成绩进行“等值”处理——将它们转换到同一量尺上。

通常,为了公平地做到这一点,你会给两个班级一些相同的“锚点”题目,以此来判断一份试卷比另一份难多少。但如果你没有这些锚点题目怎么办?

这正是本文要解决的问题。它提出了一种巧妙的变通方法,利用背景信息(如学生过去的成绩或学校类型)作为缺失锚点题目的替代指标。作者将这种方法称为序贯广义核等值法

以下是该问题及其解决方案的简明解析:

问题所在:“尺子”本身已损坏

在标准方法中,我们假设背景信息(即用于衡量能力的“尺子”)对所有人都是相同的。

  • 场景:假设你使用“先前考试的数学成绩”作为背景尺子,来帮助等值新的英语考试成绩。
  • 故障:如果 A 班去年参加的数学考试很难,而 B 班参加的数学考试很容易呢?
  • 结果:数学成绩"80 分”对 A 班和 B 班意味着完全不同的水平。如果你用这些不匹配的数据来修正英语成绩,最终的比较就会产生偏差。这就像试图用一把对一个人会缩短、对另一个人会拉伸的尺子来测量两个人的身高。

解决方案:“两步”修复法

作者建议采用序贯方法。不要立即使用原始的、不匹配的背景分数,而是首先修正背景分数。

可以这样理解:

  1. 第一步:校准尺子。在比较英语考试之前,你先取 A 班和 B 班的数学成绩,并相互进行“等值”处理。你将 B 班的“简单数学”成绩转换到 A 班的“困难数学”量尺上。现在,大家都使用同一种“数学语言”了。
  2. 第二步:比较主要事件。既然背景数学成绩已经公平且可比,你就使用这些经过调整的分数来帮助你等值英语考试。

研究发现了什么

作者进行了计算机模拟(就像创建一个包含虚拟学生和试卷的电子游戏),以观察这种两步法是否比旧的一步法更有效。

  • 当“尺子”损坏时(难度不同):旧方法产生了不公平的结果(高偏差)。新的序贯方法首先修复了尺子,这使得最终的英语成绩比较更加准确。
  • 当“尺子”完好时(难度相同):两种方法都表现良好,但新方法并未造成任何损害。
  • 权衡:新方法增加了一点点“噪声”(统计不确定性),因为你多进行了一步计算。然而,消除巨大偏差(不公平)所带来的收益远远超过了这一微小成本。

现实世界测试:捷克高中毕业考试

为了证明该方法在现实生活中的有效性,研究人员将其应用于捷克国家高中毕业考试。

  • 他们试图比较春季秋季参加考试的学生英语成绩。
  • 他们使用学生的**母语(捷克语)**成绩作为背景“尺子”。
  • 现实核查:他们发现,捷克语考试在历年间实际上非常一致。由于在这个特定案例中“尺子”并没有真正损坏,与旧方法相比,新方法对最终英语成绩的改变不大。
  • 教训:这证明了虽然新方法很强大,但如果你的背景数据本身已经稳定,你并不总是需要它。然而,如果你怀疑你的背景数据不一致(例如不同的数学考试),那么这种方法就是确保公平性的安全网。

一句话总结

如果你试图在没有共享“锚点”考试的情况下比较不同群体的考试成绩,并且正在使用背景数据(如过往成绩)来辅助,那么务必首先确保背景数据的测量是公平的。如果背景数据来自不同来源或难度不同的考试,请使用这种序贯方法,在修正主要考试成绩之前先修正背景数据。这样才能确保你不会将苹果与橙子进行比较。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →