HARVEST: Unlocking the Dark Bioactivity Data of Pharmaceutical Patents via Agentic AI
本文介绍了 HARVEST 系统,这是一种利用多智能体大语言模型从美国专利局档案中自动提取并结构化海量“暗”生物活性数据的管道,该系统在极低成本和时间内构建了包含数百万条记录及大量新靶点与骨架的数据库,并揭示了现有模型在泛化能力上的根本局限。
1018 篇论文
生物信息学宛如一座连接生物学与计算机科学的桥梁,利用强大的算法和数据分析技术,将海量的生命遗传信息转化为可理解的科学发现。这一领域不再依赖显微镜下的观察,而是通过代码挖掘基因组的秘密,帮助科学家理解疾病机制、追踪病毒变异并推动精准医疗的发展。
作为 Gist.Science 的专属栏目,我们持续追踪来自 bioRxiv 的最新预印本论文,确保您能第一时间接触前沿动态。团队对每一篇新上传的预印本进行深度处理,不仅提供详尽的技术总结,更精心撰写通俗易懂的科普解读,让复杂的生物数据变得清晰易懂。
以下为您呈现该领域最新发表的几项重要研究成果,带您探索生命数字化的最新进展。
本文介绍了 HARVEST 系统,这是一种利用多智能体大语言模型从美国专利局档案中自动提取并结构化海量“暗”生物活性数据的管道,该系统在极低成本和时间内构建了包含数百万条记录及大量新靶点与骨架的数据库,并揭示了现有模型在泛化能力上的根本局限。
本文介绍了一种名为 PREMISE 的基于 Rust 构建的概率框架,该框架通过整合质量感知的期望最大化算法与高效比对技术,克服了传统 k-mer 方法丢失关键信息的缺陷,从而在病毒宏基因组测序中实现了对流感病毒等病原体的高分辨率鉴定、来源分配及混合感染检测。
本文提出了一种名为 Zigo 的新型机器学习方法,该方法仅需标准 VCF 文件即可通过分析 X 染色体基因型分布来自动推断性别,无需参考数据或手动阈值调整,并在多种数据模态和不同数据集上展现了高精度与强泛化能力。
本文提出了一种针对彩色压缩 de Bruijn 图的新方法,通过结合插值与外推技术来校正基因组数量差异,并利用 Hill 数指数对稀有和常见节点进行加权,从而实现对泛基因组多样性的有效比较。
该论文提出了 SpeciefAI,一种基于 Transformer 的多物种模型,能够直接在 mRNA 空间生成针对特定物种(如人和犬)优化的抗体框架序列,从而在满足宿主高效表达需求的同时最小化免疫原性。
本文通过引入由泛基因组图诱导的同源关系概念,提出了用于比较不同图模型及定义其相互转换性质的同源度量标准,并开发了相应的转换算法及工具包 WGAtools。
本文设计了空间占用小于每 k-mer 3 比特的更快子集秩数据结构,从而在低内存区间实现了帕累托最优的 SBWT 基 k-mer 查找结构。
本文提出了名为"10-minimizers"的新型最小化子类,证明了其在非渐近区间内具有比随机最小化子更低的期望密度,并进一步设计了兼具常数空间、低密度和快速 k-mer 键检索特性的"spacers"方案,从而在性能上超越了现有的常数空间最小化子方法。
本文提出了名为 scTimeBench 的模块化基准平台,通过评估九种主流方法在预测准确性、嵌入一致性和谱系保真度等关键任务上的表现,揭示了现有单细胞时间序列分析方法在保持生物信号和谱系重建方面的不足,并发布了相应的开源 Python 工具包以推动该领域的标准化评估。
MosaicTR 是一种利用长读长测序数据量化串联重复序列体细胞不稳定性的工具,它克服了短读长测序的读长和 PCR 滑动限制,通过 motif 单元加权指标有效降低测序噪声,并支持在不同组织或时间点间检测特异性不稳定性变化。