← 最新论文
🧬 biology

Development of T-Cell-Associated Signatures Based on Machine Learning Integration for Predicting Breast Cancer Prognosis

本研究开发了一种稳健的基于机器学习的 T 细胞相关特征,该特征在预测乳腺癌预后以及识别可能从免疫治疗中获益的患者方面,表现优于传统的临床特征。

原作者: Yan Liu, Yuxin Cheng, Ting Huang, Liang Zhang, Zhenwei Yang, Mengting Zeng, Zhiyang Li, Hai Lu

发布于 2026-09-01
📖 1 分钟阅读☕ 轻松阅读

原作者: Yan Liu, Yuxin Cheng, Ting Huang, Liang Zhang, Zhenwei Yang, Mengting Zeng, Zhiyang Li, Hai Lu

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 ⚕️ 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明

技术摘要:基于机器学习集成开发用于预测乳腺癌预后的 T 细胞相关特征

问题陈述
乳腺癌仍是全球最常见的癌症,其预后在发生转移(尤其是骨转移)时会显著恶化。虽然单细胞测序阐明了肿瘤异质性和肿瘤微环境(TME),但 T 细胞动态在乳腺癌进展和预后中的具体作用仍未得到充分理解。此外,现有的临床分期和分子分型往往无法完全捕捉肿瘤-免疫相互作用的复杂性,因此需要更强大的生物标志物来进行预后预测和免疫治疗反应评估。

方法论
本研究采用了一种结合单细胞 RNA 测序(scRNA-seq)和批量 RNA-seq 数据的多组学集成策略,并通过先进的机器学习流水线进行分析:

  1. 数据获取与预处理:

    • scRNA-seq: 分析了包含原发性乳腺癌组织和配对淋巴结转移组织的两个数据集(GSE180286 和 GSE158399),使用 R 包 Seurat 进行处理。通过 SCTransform 去除批次效应,并进行了降维(PCA、t-SNE)。
    • Bulk RNA-seq: 从 The Cancer Genome Atlas (TCGA-BRCA) 和六个独立的 GEO 数据集(GSE1456, GSE20685, GSE24450, GSE42568, GSE58812, GSE7390)中检索转录组和临床数据。
    • 免疫治疗队列: 使用三个免疫治疗数据集进行验证:GSE78220(黑色素瘤)、GSE135222(小细胞肺癌)和 IMvigor210(尿路上皮癌)。
  2. 特征构建:

    • 细胞注释与差异分析: scRNA-seq 数据识别出 13 个细胞簇。T 细胞群体在肿瘤组织和转移组织之间表现出显著的丰度差异。提取了这些 T 细胞状态之间的差异基因(logFC > 0.5, p < 0.05)。
    • 亚型分类: 基于 T 细胞差异基因的共识聚类将 TCGA-BRCA 样本分为两个亚型(C1 和 C2)。
    • 机器学习集成: 从 TCGA 队列中,通过单变量 Cox 回归筛选出 419 个差异基因,进而确定了 52 个预后基因。这些基因接受了 101 种 10 种机器学习算法(包括 Random Survival Forest, Elastic Net, Lasso, Ridge, Stepwise Cox, CoxBoost 等)的组合测试。
    • 最优模型选择: 选择在多个数据集中具有最高平均 Harrell's 一致性指数(C-index)的模型。确定的最优组合为 StepCox (forward) + Ridge 回归
  3. 验证与分析:

    • 预后价值: 根据中位风险评分将患者分为高风险组和低风险组。在所有数据集中进行了生存分析(Kapмер-Meier)、ROC 曲线和 C-index 比较。
    • TME 与多组学: 使用 ssGSEA、ESTIMATE 和 CIBERSORT 评估免疫浸润。通过 maftools 分析体细胞突变以计算肿瘤突变负荷(TMB)。计算了肿瘤免疫功能障碍和排除(TIDE)评分,以预测免疫治疗反应。

主要结果

  • T 细胞亚型的识别: 识别出两个共识簇(C1 和 C2)。C2 表现出“热”肿瘤表型,与 C1 相比,其免疫细胞浸润(包括激活的 CD8+ T 细胞、NK 细胞和巨噬细胞)显著更高,且总生存率显著更好。
  • TRS 模型的稳健性: 由 StepCox+Ridge 模型衍生的 T 细胞相关特征(TRS)在七个独立数据集中表现出优于传统临床特征(年龄、性别、T/N/M 分期及分子亚型)的预后准确性。该模型在各种队列中保持了高准确性,C-index 值范围为 0.682 至 0.769。
  • 与 TME 和基因组学的关联:
    • 低-TRS 组: 特点是免疫细胞浸润丰富,MHC 分子、趋化因子和免疫检查点(PD-1, PD-L1, CTLA-4)表达较高,且在癌症免疫循环的所有七个步骤中活性均较高。
    • 高-TRS 组: 与较高的肿瘤纯度、较低的免疫浸润以及较高的肿瘤突变负荷(TMB)相关。值得注意的是,高-TRS 组显示出更高的 TP53 突变频率(49% vs. 20% 在低-TRS 组中)和更高的 TIDE 评分,表明存在免疫功能障碍和排除现象。
  • 免疫治疗预测: 在三个独立的免疫治疗队列中,与高-TRS 患者相比,低-TRS 得分的患者表现出显著更好的总生存期和更高的 PD-1/PD-L1 阻断反应率(完全缓解/部分缓解)。低-TRS 与“免疫炎症型”(炎性)肿瘤表型强相关。

意义与主张
作者声称,本研究成功开发了一种稳健的、基于机器学习的 T 细胞相关特征(TRS),该特征可作为乳腺癌的独立预后因子。其工作的意义在于:

  1. 卓越的预测能力: TRS 在预测患者生存方面优于传统的临床分期和分子分型。
  2. 免疫治疗指导: 该特征能有效对可能从免疫检查点抑制剂中获益的患者进行分层,识别出具有“热”肿瘤微环境和有利免疫治疗反应的“低-TRS”人群。
  3. 机制见解: 研究将特定的 T 细胞相关基因表达模式与免疫浸润、TMB 和免疫检查点表达联系起来,为观察到的预后差异提供了生物学基础。

局限性
作者承认存在以下局限性:

  • 回顾性性质: 所有数据均源自公共回顾性队列,可能引入选择偏倚。
  • 样本量: 部分免疫治疗验证队列的样本量相对较小(例如 n=27, n=28)。
  • 机制验证: 该特征中所含特定基因的具体生物学功能尚未通过 in vitroin vivo 模型进行实验验证。
  • 缺乏前瞻性数据: 该模型尚未在前瞻性临床试验中得到验证。

结论
研究结论认为,TRS 模型是乳腺癌个性化预后预测和临床决策的有力工具,特别是对于识别可能从免疫治疗中获益的患者。未来的工作需要在前瞻性多中心研究中验证这些发现,并阐明其潜在的分子机制。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →