Assessing the Reliability of LLM-Generated Phenotype-Genotype Associations Through External Validation
本研究对四种大语言模型在生成表型-基因型关联方面的表现进行了基准测试,发现虽然它们能够产生大量具有中度至高度外部验证支持的候选关联,但其准确性因关联类型和模型的不同而存在显著差异,这强调了建立严格验证流程的至关重要性。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明
在现代医学领域,患者的健康故事通常是用两种不同的语言书写的。一种语言描述的是医生所看到的:高烧、特定的心律或某种特定形状的骨骼。科学家称这些可观察到的特征为表型(phenotypes)。另一种语言则隐藏在人体细胞内部,由 DNA 的代码编写而成。这段代码包含了基因以及遗传脚本中微小的变异,可以解释为什么一个人具有某种特征,或者为什么他们可能会患上某种特定的疾病。将这两种语言联系起来——将可见的症状与不可见的遗传原因相匹配——是精准医学的基础。它使医生能够诊断罕见疾病、预测风险,并选择符合个人独特生物学特性的治疗方案。然而,已知症状与基因之间联系的库增长得如此之快,以至于人类专家无法阅读每一篇新的科学论文来更新他们的记录。已发表的内容与官方记录之间的差距正在扩大,导致医生无法获得他们所需的最新答案。
为了弥补这一差距,研究人员正转向人工智能,特别是被称为大语言模型的某种类型的计算机程序。这些程序阅读了海量的文本,并能生成看起来和听起来都像人类写作的新句子。其核心理念是,如果这些程序阅读了足够的医学文献,它们或许能够瞬间建议哪些基因或遗传变异与患者的症状相关联,从而充当一名超快速的研究助手。但存在一个严重的担忧:这些程序以有时会捏造事实而闻名。它们可能会产生一个听起来很真实但并不存在的基因名称,或者将一个真实的基因与一个与其毫无关系的疾病联系起来。如果医生依赖了这样的错误,可能会导致错误的诊断。关键问题在于,这些人工智能工具究竟是真的能找到经过验证的症状与基因之间的真实联系,还是仅仅在进行猜测。
范德堡大学的一个研究小组致力于通过一项严谨的实验来测试这个问题。他们不仅仅是让计算机去猜测;他们建立了一个系统,将每一个答案都与世界上最受信任的数据库进行比对。他们选择了四种目前最先进的语言模型,并要求它们执行六种不同类型的任务。在某些任务中,计算机被给定一份症状清单,并被要求命名导致这些症状的基因或遗传变异。在其他任务中,计算机被给定一个基因或遗传变异,并被要求描述其引起的症状。他们在处理常见疾病(如高血压或糖尿病)和仅影响少数人的极罕见疾病时测试了这些模型。随后,研究人员将模型生成的每一个关联都通过了一个验证流程。他们检查了基因名称是否真实、遗传变异是否存在于标准记录中,并且最重要的是,检查了症状与基因之间的联系是否得到主要科学目录的支持。
结果呈现出一幅复杂的情况,揭示了这些工具的能力边界。总体而言,人工智能模型在生成真实名称方面表现得非常出色。它们建议的几乎所有基因和遗传变异在生物学世界中都是真实存在的;计算机很少编造虚假的名称。然而,真正的考验在于症状与基因之间的联系是否真实。当研究人员检查证据时,他们发现大约 74% 的模型生成的关联可以匹配到至少一个已建立的科学数据库。这意味着对于大约四分之三的建议,确实有文献证据可以支撑。在这些关联中,约有 9% 具有非常强的支持,另有约 54% 具有中等程度的支持。这表明这些工具确实可以作为医生和科学家进行调查的候选想法的强大生成器。
然而,模型的表现并非在所有问题类型下都是统一的。当被问及基因而非特定的遗传变异(即单核苷酸多态性或 SNP)时,模型的表现要好得多。当任务是将症状与基因联系起来时,模型能够为大约三分之二的答案找到强有力或中等程度的证据。但当任务转变为将症状与特定的遗传变异联系起来时,成功率显著下降。模型在处理罕见疾病时表现得最为吃力。虽然它们通常能找到心脏病或糖尿病等常见疾病的联系,但经常无法找到极罕见疾病的验证联系。这不仅凸显了人工智能本身的局限性,也反映了数据库本身的局限性。罕见疾病的科学记录往往是不完整的或分散的,这使得计算机即使在存在匹配项的情况下也难以找到匹配。
该研究还对比了四种不同的模型,以观察其中是否有一个明显优于其他模型。其中一个模型,Claude Sonnet,整体表现最好,成功生成的关联在约 69% 的时间内得到了证据支持。另一个模型 GPT-5.5 以约 65% 的表现位居第二。另外两个模型则相对落后,成功率分别在 61% 和 57% 左右。有趣的是,擅长寻找基因联系的模型并不总是擅长寻找遗传变异联系的模型。这表明每个模型从其训练的海量文本中学习到了不同的模式。研究人员还观察了不同模型之间的达成一致的频率。他们发现,即使给定相同的问题,模型也很少产生完全相同的答案列表。有时它们在公认的事实上达成一致,但在许多其他问题上,它们提供的建议却完全不同。这种缺乏一致性的现象意味着依赖单一模型是有风险的;如果一个模型提出了某种联系,并不保证它是正确的;如果两个模型意见不一,也不意味着两者都是错的。
或许最重要的发现是这些模型出错的性质。当研究人员手动审查那些无法在任何数据库中找到的建议时,他们发现大多数错误并非随机猜测。大约 60% 的匹配失败属于模型将一个真实的基因或变异与错误的疾病联系起来的情况。其他的失败往往是因为科学数据库本身尚未拥有该信息。这种区别至关重要。这意味着虽然模型通常不会捏造虚假的名称,但它们经常会对错误的联系表现出极高的自信。这为临床应用创造了特定的危险:医生仅凭输出结果无法分辨出一个联系是正确的、经过验证的联系,还是一个自信的“幻觉”。
研究人员得出结论,这些人工智能工具是有用的,但必须谨慎对待。它们是生成长列表可能性的优秀工具,可以作为人类专家的起点。然而,它们不能被信任来提供最终答案。它们提出的每一个建议在用于医疗环境之前,都需要经过既定记录的核实。研究表明,输出结果的可靠性高度取决于所提问题的类型。对于常见疾病和基因层面的问题,这些工具是相当可靠的。对于罕见疾病和特定的遗传变异,它们的确定性要低得多,这反映了我们集体科学知识中的现有差距。未来的路径在于利用这些模型来加速发现过程,但始终要将其输出与严格的验证步骤相结合。通过这种方式,可以将人工智能的速度与人类策划科学的准确性结合起来,确保患者症状与基因之间的联系既快速又真实。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。