想象一下,你是一名试图破解谜题的侦探,但你寻找的不是指纹,而是感受。在心理学世界里,科学家们使用一种特殊的“感觉尺子”——问卷调查,来测量一个人承受了多少压力、悲伤或焦虑。其中最著名的尺子之一是 SRQ-20,这是一份由 20 个问题组成的简短清单,在全球范围内被广泛用于发现心理困扰。但棘手的地方在于:一把尺子只有在对每个人都测量相同事物时才有效。如果一把尺子在阳光下会拉长,而在阴影下会缩短,你就无法信任它的测量结果。在科学中,这被称为“测量等值性”(measurement equivalence)。它在问:一个“悲伤”的回答,对于男性和女性来说,是否代表同样程度的悲伤?对于从未见过战争的人和对于经历过战争的人来说,其含义是否相同?如果这把尺子对某些群体失效了,我们可能会误以为他们更悲伤,而实际上只是因为工具存在偏差。这至关重要,因为如果我们弄错了数字,我们可能会把帮助送到错误的人手中,或者错失那些最需要帮助的人。
现在,让我们走进一组研究人员的故事,他们在哥伦比亚进行了一项测试,试图在极其严苛的条件下测试这把“尺子”。哥伦比亚有着悠久的武装冲突历史,研究人员想要知道:SRQ-20 对那些直接受到战争伤害的人来说是否依然公平有效,还是说创伤改变了他们回答问题的方式?他们还检查了这把尺子在男女之间以及不同地区之间是否存在差异。他们不仅仅是让人们填写调查问卷,还使用了一种复杂的数学工具包,称为“项目反应理论”(Item Response Theory, IRT)。你可以把它想象成将尺子拆解开来,检查每一个刻度,看看金属是否会根据持尺者的不同而膨胀或收缩。他们将问卷答案与“金标准”诊断访谈进行了对比,以验证这把尺子是否真的指向了真实的心理健康问题。
以下是他们的发现,这其中有一个情节转折。首先,他们发现 SRQ-20 是测量哥伦比亚人心理困扰的一把极佳的尺子。它本质上是一块坚固的整体,测量的是同一种类型的“心理重量”。但最令人兴奋的消息是关于战争的。他们发现,对于经历过武装冲突的人和未经历过的人来说,这把尺子的运作方式同样出色。即使对于那些直接遭受过创伤的人——那些目睹过酷刑、绑架或暴力的成年人——这把尺子也没有弯曲或断裂。这些人报告了更高水平的困扰,并不是因为问题令人困惑或对他们存在偏见,而是因为他们确实背负着更重的重量。研究人员能够将“真实的悲伤”与“测量误差”区分开来,证明了该工具是公平的。你可以将战争幸存者的得分与非幸存者的得分进行比较,并相信这种差异是真实的,而非工具的故障。
然而,故事并非完美。当他们观察性别时,发现尺子上出现了一道微小的裂缝。虽然该调查大致是公平的,但对于三个特定的问题(关于容易受惊、头痛和哭泣更多),女性倾向于比男性更容易回答“是”,即使她们感受到的困扰程度完全相同。这就像是尺子对女性有一个微小且一致的拉伸,为她们的总分增加了约 0.85 分。这是一个微小的偏差,但它是真实存在的。因此,如果你在比较男女差异,你需要了解这个微小的拉伸并调整你的判断,但这并不会毁掉整个工具。
他们还尝试添加了四个关于奇怪想法或幻觉的额外问题,试图制作一个“25 项尺子”,但效果并不理想。其中一个问题(“你是否比别人认为的更重要?”)几乎被一半的人回答了,即使是在没有经历过精神病体验的人当中也是如此,这使得它成为了针对这一群体的糟糕问题。团队得出结论,原始的 20 个问题是最好的选择。最后,他们检查了这把尺子是否能识别出真正的精神障碍。它做得相当不错,像一张可靠的网,捕捉到了大多数病例,尽管有时也会捕捉到一些并非我们所寻找的目标(假阳性)。底线是:在哥伦比亚复杂的、沉重的历史背景下,SRQ-20 是一个坚固、公平的工具,可以帮助我们在不被创伤本身误导的情况下,理解冲突带来的心理代价。
技术摘要:SRQ-20 在哥伦比亚的测量等效性研究 (ENSM 2015)
问题陈述
自评问卷 (SRQ-20) 是一种广泛应用于中低收入国家 (LMICs) 的常见心理困扰筛查工具。然而,其心理测量学证据基础通常局限于经典信度系数和假设的单维性,缺乏使用项目反应理论 (IRT) 对项目层面行为的深入探究。至关重要的是,针对在武装冲突暴露、性别和地区等方面存在差异的群体,SRQ-20 的测量等效性很少得到测试,且未能有效区分真实的潜在困扰差异(影响)与项目偏差(差异项目功能,即 DIF)。在像哥伦比亚这样受冲突影响的环境中,如果不对这种不变性进行严格测试就直接假设其存在,可能会将真实的群体困扰差异与测量伪影混淆,从而导致错误的流行病学估计和资源分配。
方法论
本研究利用了 2015 年哥伦比亚国家心理健康调查 (ENSM) 的数据,该调查是一个具有全国代表性的多阶段概率抽样调查,涵盖 10,865 名成年人。分析采用了现代心理测量工具包:
- 维度与模型拟合: 使用分类相关系数和加权最小二乘法 (WLSMV) 估计量进行验证性因子分析 (CFA)。通过 Horn 平行分析、双因子指数(解释共同方差,ω-层级)以及考虑局部依赖性的模型(集合参数化)来评估维度性。
- IRT 校准: 拟合两参数逻辑 (2PL) 模型以估计项目辨别力 (a) 和难度 (b)。使用 M2∗ 统计量、RMSEA 和项目级 S−X2 统计量评估模型拟合度。
- 测量等效性测试: 测试了多组 2PL 模型的层级结构(构型不变性、度量不变性、标量不变性)。为了解决在大样本中非显著 DIF 结果的局限性,作者对项目级效应量(符号预期得分差异,SIDS)进行了等效性检验,对照预设的 $|SIDS| < 0.10$ 阈值带。
- 影响与偏差的分离: 使用了“纯化锚定”程序。初始的构型模型识别出不变项目作为锚点。通过自由估计焦点组的潜在均值和方差,将真实的群体困扰差异(影响)与项目偏差分离。
- 效度与敏感性: 通过针对简化版复合国际诊断访谈 (CIDI) 12 个月诊断的设计加权 ROC 分析评估准则效度。进行了基于严重程度分级的比较(直接受害者与非暴露者)以及设计加权重估的敏感性分析。
关键结果
- 维度性: SRQ-20 本质上是单维的。虽然平行分析提示存在多个因子,但双因子指数表明存在一个主导的一般困扰因子(ECV = .71, ω-层级 = .79)。表观的多维性主要归因于四个内容冗余的项目对(例如:消化/胃部、疲劳类项目),这些项目可以通过相关残差成功建模,而无需引入第二个实质性维度。
- IRT 参数: 2PL 模型比单参数模型提供了更好的拟合度。项目表现出高辨别力(范围从 1.10 到 2.79),其中情感类项目(快感缺失、悲伤)的辨别力优于躯体类项目。该量表在筛查阈值(θ≈1.1–1.5)处具有高度的信息量(条件信度高,为 .93–.94),但在人口均值以上的信息量较低(边际信度为 .65)。
- 测量等效性:
- 武装冲突暴露: SRQ-20 在暴露于武装冲突的成年人与非暴露成年人之间表现出完全等效性。一旦对暴露组较高的困扰水平(影响 = +0.29 SD)进行建模,所有项目的 SIDS 均落在等效带内(最大 $|SIDS| = .033$)。净差异测试功能 (DTF) 微乎其微(+0.12 分)。即使在针对直接受害者的严重程度分级分析中,这种等效性依然成立。
- 地区: 在五个大区之间发现了完全等效性(最大 $|SIDS| = .046$)。
- 性别: 观察到部分不变性。虽然根据 ΔCFI 标准,标量不变性成立,但等效性检验显示有三个项目存在偏差(容易受惊吓、头痛、哭泣更多),即在相同的潜在困扰水平下,女性比男性报告更多的症状。这导致了 +0.85 分的净 DTF,表明原始总分存在向女性得分偏高的系统性偏差。
- 准则效度: 针对主要抑郁症的设计加权 AUC 为 .877,针对任何障碍的 AUC 为 .836。最佳截断点(如 ≥5)显示出良好的特异性,但敏感性适中,反映了筛查工具固有的权衡。低阳性预测值 (PPV) 归因于低患病率而非筛查质量差。
- 25 项扩展版: 增加的四个精神病性体验项目并未形成连贯的子量表(Cronbach's α=.45),这主要是由一个辨别力较差的“夸大感”项目驱动。建议使用 20 项版本。
意义与主张
本文声称 SR-20 是一个有效、可靠且本质上单维的工具,用于测量哥伦比亚成年人的常见心理困扰。其主要贡献在于确立了该工具在具有不同武装冲突暴露程度的群体间具有等效的功能,支持了在该特定人群内对暴露者与非暴露者进行有效比较。
研究强调了一个方法论上的区别:通过将真实的困扰差异与项目偏差分离,研究证明了尽管暴露组的困扰水平较高,但 SRQ-20 测量的是针对同一群体测量同一构念且处于同一度量标准之下,这验证了在冲突环境下使用 SRQ-20 进行人群内比较的有效性,而这种做法在以往往往只是被假设而未经验证。
然而,作者对这些主张的范围保持谨慎。他们明确指出,这些结果支持哥伦比亚人口内部的比较,并不授权进行跨国比较或在冲突与非冲突环境之间的全球性比较。此外,他们警告说,按性别划分的原始总分比较存在偏差,应进行调整(女性约 +0.85 分)或基于潜在度量进行解释。最后,研究建议不要在该背景下使用扩展的 25 项版本进行精神病筛查,而是提倡使用标准的 20 项版本。
每周获取最佳 psychiatry and clinical psychology 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。