在我们身体的活细胞内部,微小的电信号像心跳一样脉动,支配着从神经元的放电到心肌收缩的一切活动。这些信号依赖于钙的移动,钙是一种在细胞进出之间流动以触发行动的矿物质。当科学家想要了解一种新药可能如何影响大脑或心脏时,他们通常会实时观察这些钙流。如果一种药物具有毒性,它可能会扰乱这些信号,导致钙离子出现异常剧烈的波动或完全停止移动。多年来,研究人员一直使用高速摄像机来观察单个实验中数百个微小孔中的这些事件,捕捉关于钙波如何上升、下降和摆动的海量数据。但这种信息洪流一直难以管理。摄像机会为每一个孔产生数十种不同的测量值,从而创造出一座几乎无法通过人工进行分类的数字大山,使得许多关于药物安全性的潜在重要线索被埋没在噪声之中。
为了解决这个问题,一个研究小组开发了一种名为 CalFluxTools 的新型数字化工具。可以将它想象成一个专门的翻译官,它能将来自这些钙摄像机的原始且混乱的输出转化为一个清晰、有序的故事。该软件旨在处理一种特定类型的实验数据,在这种实验中,细胞会被一种在钙移动时会发光的荧光染料填充。当加入一种化合物时,摄像机会记录光强随时间的变化,生成一个包含峰值和谷值的复杂轮廓。在过去,分析这些轮廓需要科学家编写自己的自定义计算机代码,或者依赖昂贵的封闭式软件,而这些软件往往迫使他们只能选择观察少数几项测量指标,从而忽略了其余部分。CalFluxTools 通过自动化整个过程改变了这一现状。它可以读取原始数据文件,通过填补缺失点或移除错误测量值来对数据进行清洗,然后运行一系列统计测试,以观察某种药物是否改变了细胞的行为。
这个新工具的力量在于其能够同时观察全局的能力。它不再强迫科学家去选择哪些测量指标重要,而是使用一种计算机学习技术,同时考虑钙信号中的每一个细节。在一次测试中,研究人员创建了一个伪数据集,他们确切知道哪些药物是有毒的,哪些是安全的。当他们将这些数据输入 CalFXTools 时,软件正确识别出了有毒化合物,甚至发现高剂量会导致更严重的损伤。它是通过对结果进行分组来实现这一点的,即显示接受有毒药物处理的细胞与接受安全物质处理的细胞看起来截然不同,而接受低剂量有毒药物处理的细胞则介于两者之间。这种在数十种不同测量指标中发现微妙模式的能力,使得该工具能够高精度地预测毒性,这在手动操作中是极其困难的。
研究人员还在涉及实验室培养的人类脑细胞的既往研究真实生物学数据上测试了该工具。在其中一个案例中,他们观察了携带与阿尔茨海默病相关的遗传突变的细胞,这些细胞表现出异常的钙信号。他们用已知用于治疗该疾病的药物处理了这些细胞。CalFluxTools 成功识别出这些药物有助于将细胞的钙信号恢复到更健康、更正常的模式,这与科学家在早期更耗时的研究中所发现的结果相吻合。在另一个测试中,软件分析了接受不同类型称为寡核苷酸的遗传药物处理的细胞数据。该工具根据这些药物已知的毒性程度对其进行了正确排序,将高毒性药物与安全药物区分开来,并展示了剂量与损伤程度之间的明确联系。
CalFluxTools 之所以特别有用,是因为它不仅仅给出一个简单的“通过或失败”的答案。它提供了一张详细的地图,描绘出细胞究竟发生了怎样的变化,并强调了钙信号中哪些特定部分受到了影响。这有助于研究人员不仅了解一种药物是否有毒,还了解它可能是如何导致这种毒性的。该软件设计灵活,允许科学家调整其处理缺失数据的方式,或将不同的细胞组与基准进行比较。通过将一项复杂且耗时的任务转变为快速、自动化的过程,这个新软件包使科学家能够更快速、更有信心地筛选更多药物。它为利用高速钙成像的全方位力量来确保我们的药物安全打开了大门,确保我们细胞内部的信号保持稳定且强劲。
技术摘要:CalFluxTools——用于高通量钙振荡筛选数据分析的 R 程序包
问题陈述
高通量(HT)全板动力学成像读取器(如 Molecular Devices 的 FLIPR 和 Hamamatsu 的 FDSS)能够监测兴奋性细胞(如神经元、心肌细胞)的胞内钙振荡。虽然这些平台可以生成丰富的动力学数据,但钙振荡剖面的分析却极具挑战性。单次实验可能会输出超过 60 个峰值动力学参数(例如,PeakPro 2 会生成高达 63 个终点),其中许多参数描述的是冗余特征。现有的分析方法通常依赖于自定义脚本或专有软件,需要手动选择终点。这种手动方法不仅劳动强度大、容易产生偏差,而且难以处理高维数据的复杂性,尤其是在区分毒性暴露与非毒性暴露,或识别改善性化合物方面。
方法论
作者开发了 CalFluxTools,这是一个开源的 R 程序包,旨在实现高通量钙流数据的自动化解析、质量控制(QC)和分析。该软件专门针对由 ScreenWorks PeakPro 2 软件生成的 .statAll 文件进行了 384 孔板格式的验证。
- 输入与架构: 该程序包接受三个主要输入:
.statAll 动力学数据文件、包含孔位元数据(化合物、浓度、孔类型)的用户定义板图(CSV)以及指定过滤和插补规则的参数清单(Excel)。数据按标准化的 S4 类结构(CalFluxData)进行组织,其中包含专门用于板集(plateSet)和单个板(plate)的类。
- 处理流程:
- 解析与插补: 程序包读取原始数据,并根据清单中定义的特定参数规则处理缺失值(NA 或空白)(例如,将空白替换为特定值或将 NA 替换为其他值)。
- 过滤: 根据用户定义的覆盖率和变异系数(CV)阈值对数据进行过滤,以剔除低质量参数。
- 实验设计: 该工具支持非配对设计(标准分析)和配对设计。在配对分析中,实验板会与时间零点参考板进行比较,并通过 log2 倍数变化进行数据转换,以控制孔间差异。
- 统计分析: 流水线生成 Z 分数,计算 Z' 因子(以评估正对照和负对照之间的分离度),并进行 T 检验(使用 Benjamini-Hochberg 校正),以识别相对于对照组或参考板的显著参数偏移。
- 机器学习: 采用随机森林算法(通过 10 折交叉验证训练,
ntree=1000,mtry=变量总数的 1/3)来基于已知的毒性(正对照)和非毒性(负对照)暴露,预测测试孔的连续毒性评分(0 到 1)。该模型会自动计算基准剂量,并提供变量重要性图表。
- 输出: 程序包生成综合可视化结果,包括 PCA 图(针对孔和参数)、覆盖率和参数偏移的热图、按剂量/时间排列的条形图以及带有颜色编码的 Excel 表格。
主要贡献与结果
作者通过三个不同的测试案例验证了 CalFluxTools:
模拟数据(配对分析): 使用一个人工生成的合成数据集,其中特定参数被手动修改以模拟溶剂、毒性和非毒性暴露,CalFluxTools 成功地:
- 识别了工程化改变的峰值动力学。
(Identified engineered changes in peak kinetics.)
- 在 PCA 图中展示了正对照和负对照的清晰分离。
- 重现了剂量依赖性的聚类现象,即更高的毒性剂量向正对照簇移动。
- 利用随机森林模型正确地对低毒性和高毒性化合物进行了分层,并识别出正确的基准剂量。
阿尔茨海默病表型筛选(非配对分析): 该程序包重新分析了先前发表的涉及人类 iPSC 衍生神经球(WT vs. APOE4)并接受 AD 治疗药物(多奈哌齐、美金奈明等)处理的数据。
- CalFluxTools 重现了已知的生物学现象,显示出更高剂量的多奈哌齐和美金奈明与野生型对照聚集在一起,而较低剂量和其他化合物则与 APOE4 疾病模型聚集在一起。
- 与依赖于手动选择参数(峰值计数/间距)的原研究不同,自动化模型识别出“钙瞬时持续时间(从峰值到高度 60% 处) (CTDP_60)”和“上升斜率 (Rise Slope)”为最具辨别力的特征,证明了其发现药物诱导的表型调节新维度的能力。
寡核苷酸神经毒性(配对分析): 该工具被用于筛选具有已知低、中、高神经毒性潜力的寡核苷酸。
- 机器学习模块准确地按剂量梯度对暴露情况进行了分层,预测评分随化合物从低毒性向高毒性转变而增加。
- 变量重要性分析强调了与 AD 研究不同的独特参数(例如,峰值间距、曲线下面积),凸显了进行无偏见、针对特定数据进行特征选择的必要性。
意义与主张
本文声称 CalFluxTools 是首个专门为全板读取器中的 3 8 4 孔高通量钙振荡数据分析而设计的开源软件。其意义在于:
- 自动化与可重复性: 它用标准化的流水线取代了临时脚本和手动参数选择,减少了分析师的偏差并提高了效率。
- 全面利用: 通过利用机器学习而非手动选择来利用所有 60 多个输出参数,该工具提高了检测毒性和识别改善性化合物的灵敏度。
- 灵活性: 它支持多种实验设计(配对/非配对)、多种剂量和时间点,同时允许用户通过可定制的过滤和插补规则应用领域特定知识。
- 易用性: 该程序包旨在让程序员和非程序员均能使用,提供用于外部分析的中间文件,并促进用于实验迭代的快速 QC 反馈。
作者总结道,CalFluxTools 拓宽了获取全面高通量 FLIPR 数据分析的途径,支持更高效的神经毒性、心脏毒性和表型筛选研究。
每周获取最佳 bioinformatics 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。