A structured study of cross-condition prediction of transcriptional responses to gene perturbations
本文介绍了 TranScouter,这是一个轻量级的编码器-解码器框架,它利用大语言模型(LLM)衍生的基因嵌入和目标条件的转录组图谱,在已见及未见的生物条件下,都能具有竞争力地预测基因扰动引起的转录响应。
1012 篇论文
生物信息学宛如一座连接生物学与计算机科学的桥梁,利用强大的算法和数据分析技术,将海量的生命遗传信息转化为可理解的科学发现。这一领域不再依赖显微镜下的观察,而是通过代码挖掘基因组的秘密,帮助科学家理解疾病机制、追踪病毒变异并推动精准医疗的发展。
作为 Gist.Science 的专属栏目,我们持续追踪来自 bioRxiv 的最新预印本论文,确保您能第一时间接触前沿动态。团队对每一篇新上传的预印本进行深度处理,不仅提供详尽的技术总结,更精心撰写通俗易懂的科普解读,让复杂的生物数据变得清晰易懂。
以下为您呈现该领域最新发表的几项重要研究成果,带您探索生命数字化的最新进展。
本文介绍了 TranScouter,这是一个轻量级的编码器-解码器框架,它利用大语言模型(LLM)衍生的基因嵌入和目标条件的转录组图谱,在已见及未见的生物条件下,都能具有竞争力地预测基因扰动引起的转录响应。
本文介绍了 SAHA,这是一个可扩展的 R 程序包,它通过利用摘要统计数据和用户定义的超参数来生成透明的半自动化注释报告,从而加速单细胞和空间转录组研究中的细胞类型鉴定,并实现快速、保护隐私的标签转移。
作者提出了 BWR-finder,这是一种新型的无数据库软件工具,它利用并行化的基于 BWT 的种子延伸算法,在保持高灵敏度的同时,与现有工具相比,能够更高效地检测超大规模基因组(超过 10 Gb)中的分散重复序列,并提升了运行速度和内存使用效率。
crispAIPE 是一个基于 Transformer 的概率框架,通过在单纯形上利用狄利克雷似然(Dirichlet likelihood)和分裂共形校准(split-conformal calibration)对竞争性编辑事件进行建模,从而量化先导编辑结果的不确定性,进而实现对变体纠正效率的可靠预测以及跨细胞类型的泛化设计过滤。
尽管单细胞基础模型在基因嵌入方面表现出一些共同的结构模式(例如核糖体富集),但几何离群值在很大程度上是模型特有的,并且不能可靠地识别具有生物学重要性的基因或疾病相关靶点。
RKMR 是一个可扩展且具备不确定性感知能力的框架,它通过整合非线性核建模、尖峰-平板(spike-and-slab)变量选择以及空间依赖性,从高维空间组学数据中识别出稳健且具有预测性的标志物面板,在准确性和可解释性方面均优于现有方法。
PG-LLM 基准测试表明,尽管通用语言模型缺乏对结构数据或多序列比对的访问权限,但它们能够有效地对蛋白质变体进行排序,并表现出优于许多成熟的基于序列的预测器的能力,尽管它们仍然落后于专门的生物分子工具。
这项研究表明,在低遗传分化水平下的局部祖源推断,其根本限制在于可行性阈值和现有参考数据的不足,而非模型架构本身,这证明了单位点准确率指标掩盖了严重的结构性失效,并且提供更丰富的单倍型信息比架构创新能带来更大的性能提升。
这项研究揭示了一个新发现的、在原核生物和真核生物中广泛存在的进化保守型 GFP 折叠蛋白家族,该家族以一个由两个精氨酸、两个谷氨酸酸和一个酪氨酸组成的高度受限且埋藏的电荷网络取代了经典的荧光发色团,而这一基序也趋同地存在于无关的 DUF2490 家族中。
MassGAT 是一种开源的、基于图的协同学习方法,它通过将离子物种建模为图并利用图注意力网络,将峰检测与注释集成到 LC-HRMS 数据中,从而超越了现有的独立处理流程。