← 最新论文
🧬 biology

A Computational Cancer GWAS Screen Highlights Structural Variation at the 7q22.1 Locus Near STAG3

本研究表明,通过整合短读长和长读长测序数据的计算筛选,揭示了在与癌症全基因组关联研究(GWAS)信号重叠的减数分裂特异性基因位点处,结构变异显著富集,特别是识别出了一个位于 *STAG3* 基因附近的 442 bp 新型缺失,该缺失是 7q22.1 结直肠癌易感位点的候选驱动因素,而仅靠短读长测序将会遗漏这一发现。

原作者: Koushik Chowdhury

发布于 2026-09-18
📖 1 分钟阅读☕ 轻松阅读

原作者: Koushik Chowdhury

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 ⚕️ 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明

为了理解癌症是如何发生的,科学家经常研究写在我们DNA中的指令。这些指令不仅仅是单字母的列表;它们是一个复杂的图书馆,其中整个段落可能会缺失、重复或被重新排列。几十年来,研究人员一直在扫描这些图书馆,寻找微小的拼写错误——即单字母的变化——以寻找为什么有些人会患癌而另一些人不会的原因。然而,这种方法存在一个盲点。它经常会错过更大规模、更剧烈的遗传文本重排,即被称为结构变异(structural variants)的过程。这些是长度从五十个字母到数千个字母不等的DNA块,它们被删除、复制或移动。由于这些变化通常发生在基因组中杂乱且具有重复性的区域,用于读取DNA的标准工具很难清晰地观察到它们。当观察在减数分裂(产生精子和卵子的特殊细胞分裂过程)期间活跃的基因时,这一差距尤为显著。这些基因对于修复DNA至关重要,当它们发生功能障碍时,可能会为日后发生癌症敞开大门。

由德国萨尔兰大学的Koushik Chowdhury开展的一项新研究,对这些隐藏区域进行了全新的审视。通过结合两套强大的遗传数据——一套构建自标准的短读长测序,另一套构建自能够看穿基因组杂乱部分的先进长读长技术——研究人员为参与减数分裂的31个基因绘制了一张详细的结构变异图谱。其目标是观察这些在以往癌症研究中很大程度上被忽视的大型遗传重排,是否确实与已知的癌症风险位点相吻合。研究发现,这些结构变异并非随机噪声;与随机发生相比,它们出现在癌症风险信号附近的概率显著更高。最值得注意的是,研究确定了位于7号染色体上的一个特定的、长达442个字母的缺失,该缺失紧邻一个已知的结直肠癌风险因子。这个缺失位于一个名为STAG3的基因附近,STAG3的作用是作为已知驱动人体内结直肠癌的基因的一个备份版本。虽然这项研究并未证明该缺失会导致癌症,但它表明STAG3是一个值得进一步调查的强有力候选基因,为遗传性改变如何影响癌症风险提供了新的线索。

研究开始时首先承认了多年来癌症遗传学实践中的一个局限性。使用芯片扫描基因组的标准遗传测试非常擅长寻找单字母变化,但非常不擅长识别较大的结构重排。想象一下,你正在试图阅读一本书,其中的整页内容被撕掉了或者被错误地粘贴在别处;标准扫描仪可能只能看到剩余页面的文字,而完全错过缺失或错位的章节。这在涉及减数分裂的基因中尤为常见,因为这些基因通常被重复的DNA序列包围,从而使标准读取工具感到困惑。为了解决这个问题,Chowdhury使用了两个不同的数据集。第一个来自gnomAD,这是一个包含约63,000人遗传信息的庞大数据库,由标准的短读长测序生成。第二个来自人类泛基因组参考联盟(Human Pangenome Reference Consortium),它使用长读长测序技术,以更高的精度绘制了47个人的基因组,捕捉到了第一个数据集错过的复杂区域。

研究人员专注于31个特定基因。其中17个是广为人知的癌症基因,另外14个是减数分裂富集基因,这意味着它们的主要职责是在产生精子和卵子的过程中发挥作用。研究提出了一个简单的问题:这些基因中的结构变异是否与已知的癌症风险位置重叠?为了回答这个问题,研究人员将遗传图谱与之前研究中识别出的超过6,000个癌症风险信号目录进行了对比。结果令人震惊。在这些31个基因周围窗口中发现的结构变异,与在基因组其他地方发现的变异相比,与癌症风险信号重叠的可能性高出近八倍。这表明,以往研究中的盲点是真实存在的,并且这些较大的遗传变化很可能在科学家此前一直忽略的癌症易感性中发挥着作用。

最重要的发现之一是,来自泛基因组项目的长读长数据揭示了187个标准短读长数据完全未能检测到的结构变异。这些“隐形”变异并非随机分布;它们集中在减数分裂富集基因区域。这证实了这些特定基因的复杂性和重复性特征使得使用旧技术进行研究变得困难,并且新的长读长工具对于看到全貌是必不可少的。该研究识别了总计913个涉及这些减数分裂富集基因的关联,将其与包括乳腺癌、前列腺癌和皮肤癌在内的多种癌症联系起来。

研究中最详细的部分聚焦于7号染色体上一个被称为7q22.1的特定位置,这是一个已知的结直肠癌风险热点。之前的研究已经在该区域识别出两个与该疾病密切相关的单字母变化,但由于这些变化位于基因之间,科学家们并不清楚它们究竟影响了哪个基因。标准的图谱指向了一个名为TRIM4的邻近基因,仅仅因为它距离最近,但并没有证据表明TRIM4实际上参与了该疾病。

Chowdhury的分析揭示了一个位于7q22.1区域、长达442个字母的缺失,该缺失就位于两个已知风险信号的正中间。这个缺失在大约0.9%的人群中被发现。虽然研究不能明确证明该缺失是风险的直接原因,但其位置高度可疑。它位于与风险信号相同的微小遗传邻域内,窗口仅为8,700个字母。研究人员随后查看了该区域的基因,以确定哪一个可能是真正的目标。GJC3和AZGP1这两个基因物理位置位于缺失与下一个主要基因之间,但两者都没有显示出在结肠组织中受风险信号调节的迹象。然而,位于下游约289,000个字母处的STAG3基因显示出了强烈的信号。STAG3是STAG2的减数分裂特异性版本,而STAG2是一种在结直肠癌肿瘤中频繁发生突变的基因。研究发现,STAG3在结肠基因表达方面有已知的联系,这表明风险信号和该缺失可能会从远处调节STAG3。

论文谨慎地指出,这项发现并非声称解决了结直肠癌之谜。研究人员指出,尚未正式证明该缺失与风险信号在同一条DNA链上相关联,也尚未进行实验室实验来测试该缺失是否真的改变了STAG3的功能。这项研究是一项计算筛选,是一种通过处理大量数据来寻找最有希望的线索的方法。它表明STAG3是一个值得进一步研究的候选基因,特别是因为它符合一个生物学逻辑:一个在减数分裂期间负责修复DNA的基因,如果以受损的形式被遗传下来,可能会使一个人在日后更容易患癌。

这项工作凸显了科学家对待癌症遗传学方式的转变。通过超越简单的逐字扫描,并拥抱能够观察更大结构变化的工具,研究人员正在发现我们遗传DNA与疾病之间的新联系。该研究表明,那些“缺失”的结构变异并非仅仅是噪声;它们很可能是拼图的关键碎片,尤其是在那些标准工具难以读取的复杂基因组区域。对于7q22.1位点而言,这些发现为未来的研究提供了一个具体的方向,将焦点从一个通用的邻近基因转向一个具体的、具有生物学合理性的候选基因,这可能解释了为什么有些人天生就具有较高的结直肠癌风险。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →