GBZ-base and GAF-base: Indexed pangenome file formats
本文介绍了 GBZ-base 和 GAF-base,这是一种基于 SQLite 的索引文件格式,能够实现对局部泛基因组子图及其对应比对结果的高效、基于磁盘的提取,解决了现有批处理格式在交互式应用中的局限性。
858 篇论文
生物信息学宛如一座连接生物学与计算机科学的桥梁,利用强大的算法和数据分析技术,将海量的生命遗传信息转化为可理解的科学发现。这一领域不再依赖显微镜下的观察,而是通过代码挖掘基因组的秘密,帮助科学家理解疾病机制、追踪病毒变异并推动精准医疗的发展。
作为 Gist.Science 的专属栏目,我们持续追踪来自 bioRxiv 的最新预印本论文,确保您能第一时间接触前沿动态。团队对每一篇新上传的预印本进行深度处理,不仅提供详尽的技术总结,更精心撰写通俗易懂的科普解读,让复杂的生物数据变得清晰易懂。
以下为您呈现该领域最新发表的几项重要研究成果,带您探索生命数字化的最新进展。
本文介绍了 GBZ-base 和 GAF-base,这是一种基于 SQLite 的索引文件格式,能够实现对局部泛基因组子图及其对应比对结果的高效、基于磁盘的提取,解决了现有批处理格式在交互式应用中的局限性。
Panomap 是首个利用泛基因组变异图谱来消除参考偏差并提高多样化纳米孔样本比对准确性的信号空间映射器,同时保持了紧凑且可扩展的索引。
本文引入了一种由生成式 Potts 模型参数化的连续时间蛋白质进化模型来模拟上位效应,揭示了虽然上位效应会减缓整体进化过程并导致对进化距离的系统性低估,但由于上下文依赖的速率异质性,它并不会改变平均位点特异性速率。
本研究表明,通过剔除非代表性肽段来精炼血浆光谱库,可以在不损害蛋白质鉴定的前提下,显著提高数据非依赖性采集(DIA)蛋白质组学相对定量的精准度、准确度和计算效率。
MKMC 是一个可扩展的、无需参考基因组的工具包,它利用 k-mer 统计特性,实现了在模式和非模式生物中稳健的 RNA-seq 分析,成功检测到了传统基于比对的方法往往难以发现的生物学信号和异构体特异性事件。
作者提出了 CircDiscoverer,这是一个综合且用户友好的网络资源,它整合了人工策展和计算预测的数据,用于探索包括人类、小鼠、果蝇和植物在内的多种物种的环状 RNA-蛋白质相互作用及 RNA 修饰图谱。
本文介绍了一个利用空间转录组学对齐任务来基准测试科学编码智能体的交互式框架,该研究表明,虽然更丰富的环境上下文会增加工具探索,但它也可能通过引发脆弱的工作流和不必要的转换来降低性能,从而强调了将智能体轨迹与最终输出一同进行评估的必要性。
LeafRank 是一种新颖的系统发育动力学框架,它利用单细胞 DNA 定序的系统发育树和多类型分支过程模型来推断染色体不稳定肿瘤中单个细胞的相对适应度,成功地量化了生长异质性,并揭示了全基因组倍增谱系的适应度是通过随后的改变而非即时优势获得的。
Rectangle 是一个稳健且可扩展的 Python 框架,它利用多尺度反卷积和对未知内容的显式建模,通过利用单细胞参考数据来准确解析批量 RNA-seq 数据中的细胞表型,从而实现群体规模的高分辨率细胞图谱分析。
本文证明了编码智能体可以通过将文献引用的基因程序提取并组合为具名轴,从而自动生成具有可解释性的零样本单细胞嵌入模型,在实现与数据驱动方法相当的生物学质量的同时,确保了固有的批次鲁棒性和可解释性,且无需训练或预先存在的基因集数据库。