Evaluation of linkage between health, education and social care administrative data for 21 million children in England
本研究评估了英格兰 2100 万儿童健康、教育及社会护理数据的关联情况,结果显示,尽管超过 90% 的近期群体已成功实现数据关联,但在来自贫困地区、伦敦居民以及少数族裔群体中的儿童方面,仍存在显著的代表性不足问题,这凸显了研究人员在进行分析时必须考虑这些人口统计学偏差的紧迫性。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明
想象一下,试图通过观察一张巨大的地图来了解一个国家儿童的健康状况。在英格兰,这张地图并非通过调查每一个家庭来绘制,而是通过将三套不同的官方记录缝合在一起而成:医院和诊所的医疗笔记、学校的出勤与成绩日志,以及社会护理部门保存的文件。几十年来,这些记录一直存储在不同的建筑中,受不同的规则保护。但研究人员一直在致力于将它们联系起来,创造了一个被称为 ECHILD 的强大工具。这个系统允许科学家观察一个孩子的健康状况、他们在教室里的时光以及他们的家庭社会环境如何在生命周期中交织在一起。人们希望通过看到全貌,我们可以更早地发现问题,并为在英格兰成长着的数百万年轻人设计更好的支持方案。然而,为了让这张地图发挥作用,它必须是准确的。如果地图遗漏了整个社区或特定人群,那么从中得出的结论可能会具有误导性,可能导致最脆弱的孩子无法获得他们所需的帮助。
最近,一个研究小组着手检查这张庞大数字地图的质量。他们想确切知道有多少儿童在这些不同记录之间被成功连接起来,并且同样重要的是,谁被遗漏了。他们查看了涵盖 1984 年至 2023 年间出生的 2100 万名儿童的数据。该过程涉及使用安全的、匿名的标识符,将一名儿童的学校记录与其医疗记录进行匹配。结果显示,该系统在其核心任务方面表现得非常出色。对于近年来出生的儿童,超过 90% 拥有医院出生记录的儿童成功与学校记录关联起来。同样,在 21 世纪初在校就读的儿童中,约有 88% 被发现拥有相应的医疗记录。总计,该系统现在持有 2100 万人的链接信息,创造了一个跨越超过 3.5 亿个观察年的资源。
然而,研究表明这张地图并非完美完整,且缺失的部分并非随机分布。研究人员发现,一个孩子被纳入链接数据的可能性在很大程度上取决于他们是谁以及他们住在哪里。与同龄人相比,居住在伦敦、来自较贫困地区以及来自少数族裔背景的儿童,其记录被成功链接的可能性较低。例如,被记录为黑人或亚裔背景的儿童,或者居住在经济最不利社区的儿童,出现在链接数据中的频率低于白人儿童或居住在较富裕地区的儿童。这种模式在不同的年龄组和时期都普遍存在。造成这些差距的原因各不相同。一些儿童可能选择了不让其健康数据用于研究,而另一些人可能就读于未被纳入国家数据库的私立学校,或者他们可能在幼儿时期后才移居英国,因此在系统中没有先前的医疗记录。
研究人员还调查了该系统是否意外地连接了错误的人,例如将一个孩子的学校记录连接到另一个孩子的医疗档案中。他们发现,错误匹配的情况极其罕见,发生率不到 1%。当错误发生时,在那些信息缺失或不明(例如没有固定住址或人口统计细节不完整)的儿童中更为常见。这表明,错误通常是由于数据质量差,而非匹配技术本身存在缺陷。研究还强调了一个特定的历史偏差:1997 年至 2002 年间出生的儿童由于在这些年份期间,婴儿出生时不会自动获得唯一的国家健康号码,导致记录出现混乱,从而增加了链接难度,因此这类儿童被链接的可能性较低。
这些发现的意义在于,它们揭示了利用大数据来理解社会的局限性。虽然 ECHILD 系统是一个生成证据以改善儿童健康的强大工具,但它并不能平等地代表每一个孩子。最有可能被低估的群体,往往正是面临最大健康和社会挑战的群体。如果研究人员在使用这些数据时没有考虑到这些差距,他们可能会误以为某些健康问题在贫困地区或少数群体中并不常见,仅仅因为这些孩子在数据集中缺失了。作者强调,了解谁是缺失的,与了解谁是存在的同样重要。通过了解他们地图的边界,科学家可以调整其方法,以确保他们讲述的关于儿童健康的故事是公平且准确的,而不是在无意中淹没了那些最需要被听见的声音。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。