Mapping social determinants of health in NIH research funding with large language models
本研究表明,经过微调的大型语言模型(尤其是 ModernBERT-base)在识别美国国立卫生研究院(NIH)资助申请书中的健康社会决定因素方面,显著优于传统的关键词方法和零样本方法,同时指出阈值校准是解决标签不平衡问题的关键策略。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
每天,一个人的健康状况不仅由其接受的药物或医生诊治所决定,更受到许多其他因素的影响。它受呼吸的空气、居住社区的安全程度、负担食物的能力,以及能否获得优质教育的影响。科学家们将这些因素称为健康的社会决定因素。它们是驱动某些社区繁荣而另一些社区挣扎的无形力量,并解释了绝大部分的健康结果。为了解决这些根深蒂固的问题,政府需要了解其研究资金的去向。在美国,国家卫生研究院(NIH)是全球最大的公共健康研究资助机构,将数十亿美元投入到特定的项目中。如果这种资助持续忽视某些社会问题,那么解决这些问题所需的科学证据就永远无法建立。
多年来,试图追踪政府在这些社会问题上支出多少的研究人员一直面临着一个困难的障碍。他们不得不阅读成千上万份资助申请书,这些是科学家撰写的冗长且复杂的文档。此前,他们依靠简单的计算机搜索来寻找相关的项目,而这些搜索仅查找特定的关键词。如果一份资助提案使用了完全正确的词汇,它就会被计入;如果它使用不同的语言描述同一个问题,或者将这一概念编织进一个更广泛的故事中,计算机就会漏掉它。这种方法过于僵化,就像试图通过只寻找颜色完全相同的针头来在干草堆中找针一样。结果,研究资金流向的真实图景始终模糊不清,关键社会问题的资金缺口也未能被察觉。
一支研究团队最近决定尝试一种不同的方法,使用一种被称为“大语言模型”的新一代人工智能。这些是经过海量文本训练的模型系统,能够像人类读者一样理解上下文和细微差别。这些模型不再仅仅是搜寻关键词,而是可以阅读资历提案并理解其潜在意图,即使作者没有使用标准术语。研究人员测试了十一种不同版本的模型,以观察哪一种能最好地识别资助申请中对社会决定因素的提及。他们想知道,这些智能模型是否能比旧有的关键词方法做得更好,以及它们是否能处理科学家描述社会问题时那种杂乱无章的现实情况。
该研究重点关注了2023财年资助申请中的“公共卫生相关性”部分,该数据集包含超过两千份资助申请。研究人员首先教模型识别五个特定的社会决定因素类别:经济稳定性、教育获取、医疗保健获取、社区环境以及社会社区背景。他们通过让专家仔细标注一部分文本,创建了一套用于模型学习的正确答案来实现这一点。随后,他们测试了这些模型,以观察它们在剩余文本中寻找这些类别的能力。挑战是巨大的,因为大多数资助提案根本不会提及这些社会因素,而且即便提及,这些内容也往往稀少且埋藏在文本深处。
结果揭示了一个关于这些人工智能系统如何运作的令人惊讶的事实。研究人员发现,在特定下游任务上微调的小型模型,其表现实际上优于那些占据新闻头条的庞大通用型模型。其中,ModernBERT-base在直接针对研究目标分类任务进行训练时达到了最高的性能。它比那些规模大出数千倍、依赖通用知识进行猜测的大型模型,更频繁地正确识别出文本中的社会因素。小型模型也更加稳定和一致,而大型模型有时会在学习特定任务规则时遇到困难。
然而,这项研究也揭示了一个关于如何使用这些工具的关键教训。研究人员发现,仅仅训练模型是不够的;他们还必须调整模型做出最终决策的方式。由于这些社会因素在文本中出现的频率极低,模型往往会忽略它们,假设它们并不存在。通过调整模型对每个特定类别的敏感度,研究人员得以找回大量遗失的信息。这一调整将一个几乎无法工作的系统转变为一个表现出高性能的系统。如果没有这一步,最先进的模型也会失败,无法捕捉到它们旨在寻找的数据。
当研究人员仔细观察不同类型的社会因素时,他们发现模型在处理不同类别时的表现各异。对于像经济稳定性或社区环境这样清晰、定义明确的主题,小型专业化模型表现出色,能够精准地识别这些因素。但对于更模糊和复杂的主题,例如社会与社区背景,大型通用模型则显示出了优势。这些主题通常以微妙的方式被描述,需要对人类关系和社会有广泛的理解,而这正是大型模型的强项。这表明,虽然小型模型通常更高效且更具优势,但最大的模型仍然拥有理解最抽象社会概念的独特能力。
这项工作的意义在于它如何改变科学资助和理解的方式。研究人员证明,建立一个能够扫描数十年资助数据、从而看清哪些社会问题正在被研究以及哪些被忽视的系统是可行的。他们展示了这可以通过相对小型、高效的模型完成,而不需要昂贵的大型硬件或私有的专有软件。这使得公共卫生官员和研究人员能够实时追踪资金趋势,确保资金被引导至最需要的地方。通过使用这些工具,机构终于可以看清其研究投资的全貌,识别出社会决定因素投入不足的盲点,并指导未来的决策,以创建一个更公平的健康体系。
该研究还强调了当前研究领域中一个持久存在的差距。即使使用最好的工具,分析也显示,某些领域(特别是教育获取与质量)在获得资助的申请书中仍显著代表性不足。这不仅仅是一个数据错误,它反映了科学界选择关注点的倾向。当一个社会因素在研究提案中被持续忽视时,解决该问题所需的证据基础就会变得薄弱。能够准确绘制这些趋势意味着政策制定者现在可以清晰地看到这些差距,并做出明智的选择来平衡研究组合,确保驱动健康差异的因素能得到与疾病本身同等严谨程度的对待。
最终,这项研究为审视科学发现的机制提供了一个新的视角。它超越了简单的词频统计,转而理解研究提案的真实意图。通过将专业化模型的精确性与大型模型的广泛理解力相结合,并仔细调整这些系统的决策方式,科学家们创造了一个强大的透明度工具。这个工具不仅仅是在计数资助项目,它揭示了一个国家健康研究的优先事项,为通往一个由完整的、准确理解塑造我们健康的社会力量所驱动的未来,提供了一条清晰的路径。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。