Mind the Alignment Gap: A Spatial Transcriptomics Benchmark for Scientific Coding Agents
本文介绍了一个利用空间转录组学对齐任务来基准测试科学编码智能体的交互式框架,该研究表明,虽然更丰富的环境上下文会增加工具探索,但它也可能通过引发脆弱的工作流和不必要的转换来降低性能,从而强调了将智能体轨迹与最终输出一同进行评估的必要性。
1012 篇论文
生物信息学宛如一座连接生物学与计算机科学的桥梁,利用强大的算法和数据分析技术,将海量的生命遗传信息转化为可理解的科学发现。这一领域不再依赖显微镜下的观察,而是通过代码挖掘基因组的秘密,帮助科学家理解疾病机制、追踪病毒变异并推动精准医疗的发展。
作为 Gist.Science 的专属栏目,我们持续追踪来自 bioRxiv 的最新预印本论文,确保您能第一时间接触前沿动态。团队对每一篇新上传的预印本进行深度处理,不仅提供详尽的技术总结,更精心撰写通俗易懂的科普解读,让复杂的生物数据变得清晰易懂。
以下为您呈现该领域最新发表的几项重要研究成果,带您探索生命数字化的最新进展。
本文介绍了一个利用空间转录组学对齐任务来基准测试科学编码智能体的交互式框架,该研究表明,虽然更丰富的环境上下文会增加工具探索,但它也可能通过引发脆弱的工作流和不必要的转换来降低性能,从而强调了将智能体轨迹与最终输出一同进行评估的必要性。
LeafRank 是一种新颖的系统发育动力学框架,它利用单细胞 DNA 定序的系统发育树和多类型分支过程模型来推断染色体不稳定肿瘤中单个细胞的相对适应度,成功地量化了生长异质性,并揭示了全基因组倍增谱系的适应度是通过随后的改变而非即时优势获得的。
Rectangle 是一个稳健且可扩展的 Python 框架,它利用多尺度反卷积和对未知内容的显式建模,通过利用单细胞参考数据来准确解析批量 RNA-seq 数据中的细胞表型,从而实现群体规模的高分辨率细胞图谱分析。
本文证明了编码智能体可以通过将文献引用的基因程序提取并组合为具名轴,从而自动生成具有可解释性的零样本单细胞嵌入模型,在实现与数据驱动方法相当的生物学质量的同时,确保了固有的批次鲁棒性和可解释性,且无需训练或预先存在的基因集数据库。
EZSolver 是一个无需模板的生成式框架,它利用流匹配(flow matching)和评估器引导的双向搜索,能够准确预测分布外化学反应中的极性酶促反应机制,克服了传统基于规则模型的泛化局限性。
本研究提出了 PredHLM,这是一种基于 XGBoost 的定量且具有可解释性的机器学习模型,该模型利用近 12,000 种化合物进行训练,能够准确预测人类肝微粒体代谢半衰期并识别关键化学驱动因素,以支持早期药物发现中的快速决策。
该论文介绍了 stGP,这是一个将时空转录组数据分解为时间与空间成分的统计框架,旨在识别具有解释性的、细胞类型特异性的基因程序,从而揭示动态组织结构和局部细胞反应如何随时间和解剖生态位而演变。
该论文介绍了 DL4DR,这是一种双塔残差后期融合深度学习模型,通过将细胞系编码为基因组图像并结合分子表示来预测泛乳腺癌药物反应,从而在不依赖细胞系身份的情况下,实现了对未见细胞系和癌症类型的卓越泛化能力,并识别出新的基因组驱动因素。
该论文介绍了 hmSEKRE,一种基于 k-mer 的隐马尔可夫模型,它通过扫描转录组来识别长链非编码 RNA 中非线性的、结构域层面的序列相似性,从而在不需要预先知晓序列比对的情况下,实现对功能相关 RNA 结构域及其相关蛋白质相互作用网络的发现。
本文介绍了 AllTheBacteria,这是一个综合性的社区资源,它对近 250 万个公开细菌基因组进行了统一处理,以支持大规模生物学研究,并通过通过人工智能驱动的挖掘发现并验证新型抗菌肽,成功展示了其应用价值。