← 最新论文
🧬 biology

Context-aware LLM extraction and controlled-vocabulary normalization of GEO transcriptomic sample metadata

本文提出了一种可本地部署的大型语言模型流水线,该流水线能够将非结构化的 GEO 转录组学元数据提取并归一化为组织、疾病状态和处理方法的结构化受控词表标签,实现了高准确度,并显著优于确定性匹配方法。

原作者: Mateusz Szczepaniak, Jonathan Wren

发布于 2026-08-31
📖 1 分钟阅读☕ 轻松阅读

原作者: Mateusz Szczepaniak, Jonathan Wren

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 ⚕️ 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明

现代生物学的浩瀚档案包含了数以百万计的生命分子水平快照,捕捉了健康人群与患病人群细胞中基因如何开启或关闭的过程。这些记录存储在像基因表达综合数据库(Gene Expression Omnibus)这样的公共仓库中,旨在成为一个让科学家能够跨越数千项研究搜索模式的共享图书馆。然而,这个图书馆的实用性长期以来一直受到一个简单问题的阻碍:每个样本附带的注释是用人类语言的混乱混合物编写的。一位研究人员可能会将一个样本描述为“乳腺肿瘤”,而另一位则写成“乳腺癌”,第三位则使用了一个仅在其特定实验室内才有意义的晦涩缩写。由于这些描述是非结构化且不一致的,要在这些样本中寻找与特定疾病或组织类型相关的样本,就像是在一座每本书的标题都用不同方言书写、且散落在各处书架上的图书馆中寻找一本书一样困难。

为了解决这个问题,来自俄克拉荷马医学研究基金会的 Mateusz Szczepaniak 和 Jonathan Wren 开发了一个新系统,充当了这些生物学记录的通用翻译机。他们开发了一个在本地运行的人工智能流水线,旨在读取附属于 80 万多个真人样本的杂乱自由文本注释,并将其转换为整洁、标准化的标签。该系统专注于三个关键信息:样本来源的组织、患者或生物体的状况,以及样本接受的任何治疗。该系统不仅仅是阅读文本,它还理解整个研究的上下文,从而能够填补单个注释可能遗漏的细节。一旦提取出这些信息,系统会将每个标签链接到一个受控词汇表中,确保“乳腺癌”和“乳腺肿瘤”被识别为同一事物,同时也将尚未有标准名称的术语归类在一起。

研究人员在海量人类样本数据集上测试了他们的系统,发现该系统几乎能在所有提供信息的情况下成功识别组织类型,在一个经过仔细检查的基准测试中达到了近 99.7% 的准确率。对于识别疾病或状况,系统的正确率约为 95%。或许最重要的一点是,该系统并非仅仅是猜测;它利用研究的更广泛背景来消除歧义。如果单个样本注释仅写着“对照组”而未指明疾病,系统会查看研究的整体设计以及同一实验中其他样本的标签,从而正确推断出缺失的背景。这一步骤使得系统能够为最初被标记为“未指定”的组织标签恢复超过四分之三的信息。

这项工作的一个关键特征是它如何处理那些不符合现有医学词典的术语。该系统并没有强行将一个奇怪或独特的术语归入不属于它的类别,而是根据它们的相似性将这些不在词汇表中的概念组合在一起。这在保留原始研究特定细节的同时,仍使数据具有可搜索性。团队还确保了该系统可以在本地计算机上运行,而无需将敏感数据发送到外部服务器,使整个过程透明且可重复。通过将数百万个非结构化注释转换为结构化、可搜索的数据,这一流水线消除了科学发现的一个主要障碍。它允许研究人员轻松结合不同研究的数据,以发现有关疾病运作方式的新见解,将零散的注释集合转化为整个科学界连贯、可用的资源。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →