Psychometric inference without refitting across heterogeneous instruments and populations
本文介绍了 METER,这是一种通过模拟训练的心理测量模型,它能够在无需重新拟合的情况下,成功推断出跨越多种未见工具和人群的人格特质,在现实世界数据中实现了与专家评估的高度相关性,同时也展示了在处理特定结构复杂性和建立绝对有效性方面的局限性。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在衡量人类特质的世界里,从一个人抑郁的深度到其人格的广度,科学家们都依赖于问卷调查。这些工具要求人们对自己的感受或行为进行评分,而这些答案被用来计算一个被称为“潜在特质”的隐藏分数,这个分数代表了他们是谁或他们的感受如何。传统上,每当研究人员想要使用一个新的问卷或研究不同的人群时,他们都必须从头开始。他们构建一个定制的数学模型,将新数据输入其中,并运行复杂的计算以找到最佳拟合。这个过程虽然灵活,但速度缓慢,对于每一次研究都需要进行一轮全新的重度计算,就像木匠为每一种遇到的不同木材都重新打造一套工具一样。
哥伦比亚大学和新南威尔士大学悉尼分校的一个研究小组提出了一个不同的问题:能否建立一个单一的、预构建的系统,在不需要为每种新情况重新构建的情况下学习如何为这些问卷评分?他们想知道,一个计算机程序是否可以通过完全模拟的数据——即由计算机生成的数百万个虚构测试场景——进行训练,从而学习人类回答问题的通用规则。如果成功,这个“摊销”(amortised)系统就可以查看它从未见过的真实世界问卷,并立即生成分数,而无需任何新的训练或调整。这意味着理解如何衡量人类特质的繁重工作发生在一次性的虚拟世界中,从而使该系统能够被立即重复用于不同的文化、语言和各类测试。
研究人员构建了一个名为 METER 的系统,其全称为“可迁移估计与表征测量引擎”(Measurement Engine for Transferable Estimation and Representation)。METER 不是向真实的人学习,而是在 40 个不同的模拟世界中接受训练,在这些模拟世界中,计算机清楚地知道每个人的特质以及每个问题的难度。在这些模拟中,系统学会了识别人们回答问题的模式,无论提问了多少个问题,也无论回答者是谁。一旦完成这些训练,研究人员就冻结了系统的内部设置,将其锁定以使其无法改变。随后,他们将这个冻结后的系统应用于来自全球数千人的真实数据,使用的都是系统在训练期间从未遇到过的问卷。
结果表明,这个冻结后的系统确实能够以卓越的准确度将其知识迁移到现实世界。当在涉及欧洲社会调查中超过 4 万名、分布在 21 个国家的抑郁量表进行测试时,该系统的评分与传统的定制化模型的相关性接近 0.97。在一次更严格的测试中,即使用于欧洲健康、老龄化与退休调查中的另一种抑郁量表进行测试时,该系统在 28 个国家实现了接近 0.99 的相关性。这意味着,在特质量表上从低到高的排序,几乎与专门的模型所产生的排序完全一致,但无需构建或运行那个专门的模型。只要研究人员告知系统哪些问题属于哪种特质,该系统在处理同时测量多种特质的复杂人格测试时也能表现良好。
然而,这项研究也明确界定了这种新方法失效的界限。当被要求分析一个使用多项选择题的认知能力测试时,该系统失败了,因为这种格式与它所接受训练的评分量表非常不同。它也无法自行发现数据中的新模式或隐藏结构;它只能在研究人员提供清晰的题目归类图谱的情况下,才能对特质进行评分。此外,虽然该系统可以准确地对人群进行排名,但它目前还无法提供医生或研究人员在做出临床决策时通常需要的精确统计置信区间。该系统是一个强大的工具,用于在不同环境下复用评分逻辑,但它并不是一个能取代对研究设计或对实际测量内容理解的“魔杖”。
研究人员证明,可以在模拟环境中学习测量规则,并将这些规则应用于现实世界而无需重新训练。这使关注点从为每次研究解决一个新的数学问题,转向了将学到的技能应用于新的情境。虽然该系统目前还不是所有传统方法的替代品,但它提供了一种快速且一致地为大型、多样化数据集评分的方法。研究结论指出,当问题与系统学习过的题目相似,且测试结构是预先已知的情况下,这种方法效果最好。这代表了使心理测量评分更加高效迈出的重要一步,尽管它仍然是一个必须在明确了解其边界和所能处理的数据类型的前提下才能使用的工具。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。