← 最新论文
🧬 biology

Machine Learning–Based Classification of Cancer Using Promoter-Associated 5-Hydroxymethylcytosine Signatures in Cell-Free DNA

本研究表明,一种利用游离DNA中启动子相关5-羟甲基胞嘧啶(5hmC)特征的机器学习框架能够有效且准确地将癌症样本与健康样本区分开来,为癌症早期检测和精准肿瘤学提供了一种极具前景的无创策略。

原作者: Tisha Sehrawat

发布于 2026-09-01
📖 1 分钟阅读☕ 轻松阅读

原作者: Tisha Sehrawat

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 ⚕️ 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明

癌症是人体自身指令出错的一种疾病。几十年来,医生通过寻找血液中漂浮的破碎DNA片段或突变基因来寻找这种问题的迹象。虽然这些遗传线索很有价值,但它们通常只有在肿瘤已经大到足以释放出大量物质时才会出现。这导致了早期检测方面的空白,即癌症可能已经存在,但由于体积太小而无法留下遗传指纹。科学家们最近将注意力转向了一种不同类型的信号:附着在DNA上的化学标签,这些标签本身并不改变遗传代码,而是像音量调节旋钮一样,将基因的表达调高或调低。其中一种被称为5-羟甲基胞嘧啶(5-hydroxymethylcytosine)的标签特别引人注目,因为它会根据其来源的细胞类型而呈现特定的模式。当一个细胞变成癌细胞时,这些模式会发生变化,且这种变化与健康细胞截然不同。由于这些化学标签能在血液中存活,它们为早期发现癌症提供了一种潜在途径——不是通过寻找破碎的基因,而是通过注意到控制细胞运行的指令已被改写。

研究人员提莎·塞拉瓦特(Tisha Sehrawat)的一项新研究探讨了血液中的这些化学模式是否可以用来区分癌症患者与健康人士。该团队从一个包含804名个体样本的公共数据库中收集了数据,其中包括458名各类癌症患者和346名健康志愿者。研究人员并没有试图一次性阅读整个基因组(这就像为了寻找一个错别字而试图读完一整座图书馆里的每一句话),而是将重点放在了基因的特定起始点,即转录起始位点(transcription start sites)。他们测量了每个样本中数千个基因在这些起始点周围的化学标签含量。这为每位参与研究的人绘制了一幅详细的化学活动图谱。

为了理解如此海量的数据,研究人员使用了经过训练以识别模式的计算机程序,这一领域被称为机器学习。他们教导这些程序观察化学图谱,并判断样本是来自癌症患者还是健康人士。团队测试了三种不同类型的学习程序,以观察哪种效果最好。最成功的程序是通过构建许多小型决策树并将它们的答案结合起来,它能够正确识别出约78%的从未见过的测试案例中的癌症。同时,它也能在约72%的情况下正确识别出健康个体。虽然这并不完美,但它是一个强烈的信号,表明血液中的化学模式携带了足够的信息来区分这两类人群。

该研究还调查了哪些特定基因对于做出这些决策最为重要。当计算机在没有任何预先指令的情况下观察数据时,它发现最有用的信号来自于一种混合基因,其中许多基因此前并不被认为是癌症的主要驱动因素。然而,当研究人员强制要求计算机只观察已知参与癌症过程的基因时,程序仍然表现得非常好。这表明与癌症相关的化学变化是广泛存在的,并影响着基因组的许多不同部分,而不仅仅是少数几个著名的癌症基因。计算机识别出的最具影响力基因涉及控制细胞生长、细胞分裂以及细胞间如何进行通信。

该研究最重要的发现之一是,计算机发现的信号并非仅仅是反映了体内循环的不同类型血细胞。研究人员测试了结果是否只是捕捉到了人与人之间血液成分的自然差异。即使在考虑了这些因素后,计算机仍能高精度地区分癌症与健康。这表明化学模式确实与疾病的存在相关,而不仅仅是血液中的背景噪音。研究还表明,化学变化并非均匀分布;某些基因在癌症患者体内拥有更多的标签,而另一些则较少。这种复杂的、多方向的模式正是计算机所学习并识别的内容。

尽管取得了这些令人鼓舞的结果,研究人员谨慎地指出,这目前仅是一项概念验证,而非现成的医疗检测手段。该研究基于现有数据,且计算机模型是在属于同一集合的样本上进行测试的。要成为真正的临床诊断工具,此类检测需要在不同的医院、在不同的条件下,在完全不同的患者群体中进行验证。目前的模型也会出错,有时会漏掉癌症病例,或者错误地标记健康人士。研究人员建议,未来的工作应侧重于将这些化学信号与其他类型的数据(如DNA片段的大小或其他化学标记)相结合,以提高准确性。

这项工作证明了血液中DNA的化学景观蕴含着关于个人健康的丰富且多维的故事。通过专注于基因的起始点并利用现代计算机学习技术,科学家们可以开始更清晰地解读这个故事。研究结果表明,癌症在血液中留下了广泛且协调的特征签名,这超越了简单的基因突变。虽然通往临床检测的道路尚长,但这项研究为相信基因组的化学语言可以转化为强大的早期癌症检测工具提供了坚实的基础。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →