Carbon: Decoding the Language of Life
本文介绍了 Carbon,这是一系列高效的领域自适应生成式 DNA 语言模型,它们采用非重叠的 6-mer 分词和专门的训练目标,在实现与现有大规模基因组模型相当的性能的同时显著提升了推理速度,从而证明了将模型设计与 DNA 独特的统计和生物学特性相契合的重要性。
320 篇论文
基因组学探索着生命最底层的密码,致力于解读决定生物性状的遗传蓝图。这一领域不再局限于实验室,而是正深刻影响着我们对疾病、进化乃至人类自身起源的理解。在 Gist.Science 的基因组学版块中,我们专注于呈现来自 bioRxiv 的最新预印本,确保您能第一时间接触到科学界最前沿的未经同行评审的原始发现。
我们的团队会即时处理 bioRxiv 发布的每一篇相关预印本,将其转化为通俗易懂的科普摘要与详尽的技术解读,帮助不同背景的读者跨越专业壁垒。无论您是寻求灵感的科研工作者,还是对生命奥秘充满好奇的探索者,这里都能为您提供清晰、及时的资讯。
以下是该领域最新发布的论文列表,邀请您一同开启这场解读生命密码的探索之旅。
本文介绍了 Carbon,这是一系列高效的领域自适应生成式 DNA 语言模型,它们采用非重叠的 6-mer 分词和专门的训练目标,在实现与现有大规模基因组模型相当的性能的同时显著提升了推理速度,从而证明了将模型设计与 DNA 独特的统计和生物学特性相契合的重要性。
WaveSeekerNet 模型能够准确预测甲型流感病毒的宿主起源,并揭示禽类与哺乳动物宿主之间独特的基因组适应模式,为评估人畜共患风险及识别关键适应性突变提供了定量框架。
本研究揭示,尽管插入序列(IS)元件(尤其是 IS256 家族)在持续性骨科植入物相关感染中驱动了表皮葡萄球菌显著的遗传多样性,但菌株的高水平多重耐药性和生物膜形成能力更可能是流行克隆的固有特征,而非宿主内快速适应的结果。
本文介绍了 SpeciMiR,这是一个在 220 万个 miRNA-mRNA 配对上训练生成的 AI 框架,能够合成具有增强脱靶效力且最小化脱靶效应的靶点特异性 siRNA 序列,并成功恢复了与 FDA 批准的肝病药物相对应的结合区域。
本研究引入了一种贝叶斯框架,通过建模 Y 连锁基因表达的降低,成功从批量男性 RNA-seq 数据中估算染色体 Y 嵌合性丢失(LOY),该方法在大型 LOY 事件中与基于 DNA 的测量结果表现出强相关性,同时也凸显了该方法因转录混杂而存在的局限性,并强调其作为基于 DNA 检测的概率性而非直接替代方案的性质。
本文介绍了 PerturbPlan,这是一款交互式网络应用程序,它利用一种新颖且计算高效的解析公式,实现功能强大且灵活的单细胞 CRISPR 筛选实验的快速设计,从而克服了现有基于模拟工具的局限性。
通过分析十三种人体组织中的一百多万个体细胞突变,本研究揭示衰老基因组表现出“有组织的脆弱性”,即关键且高度连接的基因通过转录偶联修复和选择性过滤得到系统性保护,这表明机体衰退并非由总突变负荷驱动,而是由突变积累的具体网络位置所驱动。
本研究利用 RibOxi-seq2 技术建立了黑腹果蝇 S2 细胞中 snoRNA 表达及 2'-O-甲基化位点的综合图谱,揭示了 rRNA、snRNA 和 mRNA 中广泛存在的修饰,并鉴定出新的共有序列,这些序列可能在缺乏经典引导 snoRNA 的情况下指导 mRNA 甲基化。
本研究证明,尽管与冷冻对照相比,环境温度储存方法(FTA 卡和 DESS 缓冲液)会导致单个寄生线虫幼虫的测序质量降低,但它们为混合样本提供了可比的结果,从而为资源有限环境下的全基因组测序提供了一种可行的替代方案。
本研究提出了 Jindo1-G-TTAGGA,这是首个满足严格 TTAGGA 标准的完整、无间隙且单倍型解析的犬参考基因组,其包含一个单 contig 的 Y 染色体,解决了约 79% 的全长犬 Y 染色体序列,并显著推进了对犬结构变异及性染色体演化的理解。