✨ 要点🔬 技术摘要
大局观:解决“奶昔”难题
想象一下你有一杯水果奶昔。它是草莓、香蕉和蓝莓的美味混合物。如果你喝了一口并试图猜测配方,你可能会说:“味道很甜,”但你无法准确判断其中到底含有多少草莓成分,又有多少香蕉成分。
长期以来,研究结直肠癌(CRC)的科学家们就像是在品尝那杯奶昔的人。他们观察的是来自结肠的“块体”(bulk)组织样本——这是许多不同类型细胞(如肠道内壁细胞、干细胞和免疫细胞)的混合物。他们试图找出哪些特定的细胞导致了癌症,但因为所有东西都混合在了一起,信号变得模糊不清。他们无法分辨变化是发生在“草莓”细胞中,还是发生在“香蕉”细胞中。
这篇新论文介绍了一种“解构”奶昔的新方法。研究人员开发了一种方法,将块体组织数据重新拆解回其单个细胞类型,从而使他们能够精确观察在癌症发生之前,每个特定细胞类型内部究竟发生了什么。
工具箱:数字化解构
为了实现这一点,团队使用了一个强大的数字化工具箱:
参考库: 他们使用“单细胞”数据(就像是每一颗单独水果的高分辨率照片)作为参考指南。
解卷积机器: 他们使用了计算机算法(名为 EpiSCORE 和 CIBERSORTx )来充当数字反向搅拌机。他们获取“奶昔”(块体组织数据),并通过数学方法将其分离,以估算特定细胞类型(如肠上皮细胞 /吸收细胞、杯状细胞 /粘液分泌细胞和干细胞 )的 DNA 甲基化(DNA 上的化学标签)和基因表达(被读取的指令)。
侦探工作: 一旦他们获得了这些分离后的图谱,就会将其与来自近 18.6 万人的大规模遗传数据(包括患癌者和未患癌者)进行对比。这使得他们能够捕捉到仅在特定细胞类型中出现的微小遗传线索。
发现:寻找隐藏的罪魁祸首
通过对细胞进行个体化观察,研究人员发现了以前无法察觉的事物:
178 个新的“风险开关”: 他们发现了 17 处特定的 DNA 位点(称为 CpG 位点),它们就像开关一样。当这些开关在某些细胞中被拨动时,会增加患结直肠癌的风险。其中许多位点位于科学家以前从未关注过的地方。
68 个新的“风险基因”: 他们确定了 68 个极有可能驱动癌症的基因。
26 个新的“邻里区域”: 这些发现指向了人类基因组中 26 个此前未知的与癌症风险相关的区域(位点)。
细胞的故事:不同的角色,不同的风险
研究揭示了不同细胞在面对癌症时有着不同的“故事”:
维修队(肠内分泌细胞): 在这些细胞中,风险与 DNA 修复 问题有关。这就像是一支建筑施工队忘记了如何修理破碎的砖块。当它们无法修复 DNA 断裂时,建筑(细胞)就会变得不稳定且危险。
信使(吸收细胞和干细胞): 在这些细胞中,风险与 TGF-β 信号传导 有关。你可以把它想象成一种通信系统,告诉细胞何时停止生长。如果信号中断,细胞就会在不该生长的时候持续生长。
防御者(杯状细胞): 这些细胞显示出炎症和氧化应激 的迹象。这就像是一名保安,一直在与火灾(炎症)搏斗并逐渐精疲力竭,最终失去了对建筑的控制。
“可药物化”清单:潜在的锁匙
研究人员不仅发现了问题,还寻找了潜在的解决方案。他们检查了一个现有药物数据库,以查看是否有药物可以针对这些新发现的基因。
他们发现有 14 个基因 可以被药物靶向。
这些基因已经被 90 种不同的药物 (有些已获批准,有些处于临床试验阶段)用于治疗其他癌症或疾病。
这表明医生可能能够“ repurpose ”(重新利用)现有药物来治疗或预防结直肠癌,而不必等待全新的药物被发明出来。
明星选手:SF3A3
为了证明他们的方法有效,团队在实验室中挑选了一个名为 SF3A3 的基因进行测试。
预测: 他们的计算机模型显示,这个基因扮演着“反派”(癌基因)的角色,有助于癌症生长。
实验室测试: 他们取了结肠癌细胞并关闭了 SF3A3 基因。
结果: 没有了 SF3A3,癌细胞停止了生长,无法移动,也无法形成新的菌落。这证实了 SF3A3 确实是该疾病的关键驱动因素。
总结
简而言之,这篇论文就像是将一张模糊、低分辨率的犯罪现场照片升级为高清、3D 重建图像。通过将结肠组织的“奶昔”重新拆解为单个成分,研究人员找到了新的遗传线索,识别了不同细胞如何促成癌症,并强调了可能阻止这种疾病的现有药物。他们还通过实验验证了他们的头号嫌疑犯 SF3A3 ,证明了该方法的有效性。
技术摘要:基于反卷积的细胞类型特异性 DNA 甲基化全基因组和转录组范围关联研究识别了与结直肠癌风险相关的 CpG 位点和基因
问题陈述 传统的基于大块组织(bulk-tissue)的 DNA 甲基化全基因组关联研究(MWAS)和转录组范围关联研究(TWAS)已成功识别了许多与结直肠癌(CRC)风险相关的 CpG 位点和基因。然而,这些方法依赖于大块组织数据,未能考虑到结直肠组织中固有的细胞异质性,该组织由上皮细胞(如肠细胞、杯状细胞、干细胞)和基质成分混合而成。这种异质性可能会掩盖细胞类型特异性的调节信号并降低统计效能。此外,现有的框架往往缺乏用于优先排序变异以进行基因表达预测的调节上下文。迫切需要描绘细胞类型特异性的表观遗传和转录机制,以更好地理解 CRC 的易感性。
方法论 作者开发了一个基于反卷积信息的细胞类型特异性多组学框架,用于从大块正常结肠组织中推断细胞类型特异性的 DNA 甲基化(DNAm)和基因表达谱。
数据资源:
大块 DNAm: 293 个正常结肠样本(132 个来自 COLONOMICS,161 个来自 GTEx)。
大块基因表达: 707 个正常结肠样本(423 个来自 BarcUVa-Seq,284 个来自 GTEx)。
单细胞参考: 来自 Colorectal Molecular Atlas Project (COLON MAP) 的 scRNA-seq 数据用于表达分析;来自 EpiSCORE DNAm 图谱的甲基化数据用于甲基化分析。
GWAS 汇总统计数据: 78,473 例 CRC 病例和 107,143 例欧洲血统对照组。
功能验证: 来自 TCGA、CPTAC、DepMap 以及腺瘤-癌变和锯齿状癌变进展途径的 scRNA-seq 数据。
反卷积与模型构建:
甲基化 (ctMWAS): 使用 EpiSCORE 框架和张量成分分析 (TCA) 对大块 DNAm 谱进行反卷积,以推断四个上皮细胞类型(肠内分泌细胞、肠细胞、杯状细胞和祖细胞)的 CpG 水平的细胞类型特异性甲基化值。
表达 (ctTWAS): 使用 CIBERSORTx 对大块 RNA-seq 数据进行反卷积,以估计吸收性(肠细胞)、杯状细胞和干细胞的细胞类型特异性基因表达。
遗传预测模型: 利用弹性网络回归(elastic net regression),作者构建了遗传预测的 DNAm 和基因表达模型。这些模型利用了先前研究中识别出的潜在易感转录因子(TF)占用的调节变异(位于 51 个 CRC 相关 TF 的 1 Mb 范围内)。协变量包括性别、年龄、遗传主成分和 PEER 因子。
关联与整合:
关联测试: 使用 S-PrediXcan 将遗传预测模型与 CRC GWAS 汇总统计数据进行整合。通过元分析(使用聚合 Cauchy 关联测试,ACAT)结合了跨数据集的结果(用于甲基化的 COLONOMICS/GTEx;用于表达的 BarcUVa-Seq/GTEx)。
共定位: 进行分析以识别高置信度的关联,即 DNA 甲基化/基因表达与 CRC 风险共享同一个因果变异(PP.H4 > 0.8)。
功能优先级排序: 通过评估候选基因在 TCGA 中的差异表达一致性、在 DepMap CRISPR 筛选中的必需性,以及在腺瘤-癌变和锯齿状癌变序列中的失调情况(使用 scRNA-seq 数据)来进行功能优先级排序。
通路与药物分析: 使用 Enrichr 进行通路富集。查询药物靶点数据库(DrugBank、ChEMBL 等)以识别具有药物开发潜力的靶点。
实验验证: 在三种 CRC 细胞系(HCT116、RKO、SW480)中对优先排序的基因 SF3A3 进行 siRNA 敲低实验,以评估其对细胞活力、迁移、侵袭和集落形成的影响。
关键结果
细胞类型特异性 CpG 位点 (ctMWAS): 研究识别了 2,341 个显著的细胞类型特异性 CpG-CRC 风险关联(2,134 个唯一位点)。经过共定位过滤后,识别出 178 个高置信度 CpG 位点,分布在 106 个位点(loci)中。值得注意的是,其中 14 个位点是此前 GWAS 中未曾报道过的全新 CRC 易感位点。
细胞类型特异性基因 (ctTWAS): 研究识别了 151 个显著的细胞类型特异性基因-CRC 风险关联(121 个唯一基因)。共定位分析产生了 68 个高置信度关联,对应于 53 个唯一基因。其中 12 个映射到了新的易感位点。
多组学整合: 共优先排序了 132 个独特的高置信度风险基因(86 个来自 ctMWAS,53 个来自 ctTWAS,其中 7 个重叠)。
功能支持: 34 个基因在 TCGA 中显示出一致的差异表达;12 个基因在 CPTAC 中显示出一致的蛋白质丰度变化;5 个基因被确定为 DepMap 中细胞生存所必需的基因。
阶段特异性失调: 50 个基因在腺瘤-癌变序列中呈差异表达,44 个基因在锯齿状息肉-癌变序列中呈差异表达,其中 20 个基因在两种途径中均得到支持。
通路富集:
ctMWAS(肠内分泌细胞): 富集于同源重组修复 (HRR)、DNA 双链断裂修复 (DSBR) 和 TP53 调节。
ctTWAS: 在吸收性/干细胞中富集于 TGF-β 信号传导;在杯状细胞中富集于先天免疫反应、氧化应激和转录重编程。
可成药靶点: 在 132 个优先排序的基因中,识别出 14 个与 90 种 FDA 批准或临床阶段药物相关的潜在可成药靶点。其中五个基因(CACNA1I, ERBB2, JAK3, NISCH, TXN )正被目前处于临床评估阶段的 43 种药物所靶向。
实验验证: SF3A3 被鉴定为一个收敛性风险基因(在肠细胞和祖细胞中均受到 ctMWAS 和 ctTWAS 的支持)。siRNA 敲低 SF3A3 显著降低了 CRC 细胞系的细胞活力、迁移、侵袭和集落生长能力,支持了其作为癌基因驱动因子的作用。
意义 本文声称,这种基于反卷积的框架能够实现细胞类型解析的、用于识别结直肠癌易感性的表观遗传和转录机制,克服了大块组织分析的局限性。通过整合遗传、表观遗传和转录组数据,该研究提供了更全面的 CRC 遗传架构理解,揭示了 26 个此前未报道的 GWAS 位点和 69 个未报道的风险基因。研究结果为疾病生物学提供了见解,特别是强调了不同上皮细胞类型中截然不同的调节机制(例如,肠内分泌细胞中的 DNA 修复与杯状细胞中的免疫信号传导)。此外,识别出 14 个与现有临床化合物相关的可成药靶点,为 CRC 的预防、治疗开发和药物重定位提供了具有行动力的见解。对 SF3A3 的功能验证进一步支持了该方法在识别新型癌基因驱动因子方面的效用。
每周获取最佳 genetic and genomic medicine 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。