Different representation learning objectives recover distinct latent structures from the same psychometric data
本研究表明,应用于同一心理测量数据的不同表示学习目标会恢复出截然不同的潜在结构,其中对比式方法在教师-儿童检索方面表现出色,但未能保留行为表型,而多任务目标则在这些相互竞争的组织形式之间提供了部分权衡。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在教室寂静的角落里,教师的日常经历与儿童的行为表现是紧密交织在一起的。我们知道,教师的幸福感、对自身技能的信心以及他们营造的情绪氛围,都会塑造儿童的行为和学习方式。几十年来,科学家们通过让教师和儿童填写关于情感和行为的长篇问卷来研究这种联系。传统上,研究人员会将这数百个独立的答案进行汇总,转化为几个综合得分,然后观察这些得分之间的模式。这种方法虽然有效,但它假设最重要的故事隐藏在平均值之中。它将关于儿童情绪或教师压力的单个问题的详细且复杂的现实,视为不如最终生成的数字重要。
最近,一种研究人类行为的新方法出现了,它利用强大的计算机系统直接观察原始的个体答案。这些系统通常被称为“表示学习”(representation learning),它们试图在没有预先被告知要寻找什么的情况下,在高维数据中发现隐藏的模式。它们可以提取数千个具体的细节,并将它们压缩成一张更简单的地图,使相似的事物在图中彼此靠近。对于使用这些工具的科学家来说,一个自然的问题随之而来:如果你将同一组问卷答案输入不同的计算机系统,它们是否会找到相同的隐藏地图?或者,计算机的具体目标是否会改变它所绘制的地图?这个问题至关重要,因为如果计算机的目标改变了地图,那么我们在数据中发现的“真相”可能更多地取决于我们使用的工具,而非我们正在研究的人群。
一个研究小组致力于利用来自塞浦路斯的一项大型学前研究数据来回答这个问题。他们拥有757对匹配的教师与儿童数据,其中每位教师填写了139个关于自身福祉和工作的题目,每位儿童则接受了82个关于行为评估的测试。研究人员希望利用这些关联的问卷构建一张共享地图,使特定的教师与其对应的特定儿童在图中彼此靠近。同时,他们也想看看这张地图是否也能自然地将具有相似行为特征的儿童(例如高度适应型儿童与处于困境中的儿童)归为一类。
首先,研究人员使用一种标准且成熟的方法建立了一个“行为地图”。他们提取了儿童的82个行为问题,并使用一种称为“主成分分析”的技术来寻找主要模式。这一过程揭示了四个截然不同的群体。一组表现出高水平的适应功能,意味着他们能很好地处理社交场合;另一组是中等适应型;第三组表现出一定的脆弱性;第四组则面临较高的行为风险。这些群体清晰且独立:高风险组的儿童在行为量表上的得分与高功能组相比有着显著差异。这证实了数据中确实存在关于儿童行为的强大且自然的结构。
接下来,研究人员尝试构建一张能够连接教师与其特定儿童的地图。他们使用了一种现代计算机学习方法,称为“对比学习”(contrastive learning)。想象这样一个系统:它被告知,“这里有一位教师和她的孩子,请让他们的数字指纹看起来非常相似;这里有一位教师和一个互不相识的孩子,请让他们的指纹看起来非常不同。”计算机通过学习来调整其内部地图以实现这一目标。结果令人震惊。当研究人员要求计算机为给定教师寻找匹配的儿童时,它的表现远优于标准方法。在使用标准方法时,计算机仅有0.13%的概率猜中正确的孩子;而使用这种对比学习方法时,它在第一次尝试时猜中正确孩子的概率为7.27%,而在前十个猜测中命中目标的概率则达到了56.14%。这证明了计算机能够成功学习到特定教师与其特定学生之间的独特联系。
然而,当研究人员观察这张新地图中的儿童行为群体时,一个令人惊讶的问题出现了。虽然计算机在匹配教师与儿童方面表现出色,但在对儿童行为进行分组方面却表现得很糟糕。此前发现的四个清晰的行为群体几乎消失了。那些高度适应型的儿童在地图上四处散落,与处于高风险的儿童混杂在一起。计算机太擅长识别教师与儿童之间的联系,以至于它实际上抹杀了儿童行为类型的差异。这张地图是针对“关系”进行优化的,而非针对“个性”。
为了测试这是否是一个根本性的权衡问题,研究人员尝试了第三种方法。他们构建了一个同时承担两项任务的系统:它既要匹配教师与儿童,又要预测儿童的行为类别。他们希望这能迫使计算机保留两种类型的信息。结果是一种折中方案。该系统在保持行为群体聚集方面变得更加出色,群体重新变得清晰且明确。但这种进步是以牺牲为代价的:系统匹配特定教师与儿童的能力大幅下降,回落到了与标准方法相似的水平。
研究得出结论,这类数据并不存在一张单一且完美的地图。计算机所发现的隐藏结构完全取决于它被告知去寻找什么。如果目标是寻找教师与儿童之间的联系,计算机会找到一张充满这些联系的地图,但会丢失行为群体;如果目标是寻找行为群体,它会找到这些群体,但会丢失特定的师生联系。研究人员指出,师生对应关系和行为表型是存在于同一组数据中的两种不同类型的组织形式。两者并无优劣之分,但单一的计算机模型无法同时完美地捕捉这两者。这一发现提醒我们,当我们使用先进工具研究人类行为时,我们得到的答案是由我们向机器提出的问题所塑造的。数据并非只是静静地躺在那里等待被阅读;根据我们观察它的视角不同,它会展现出不同的真相。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。