Distribird: Literature-Informed Prior Distribution Design for Bayesian Model Calibration
Distribird 是一个代理式 Web 应用程序,通过部署多智能体流水线来提取、加权并拟合科学数据,从而为贝叶斯模型校准自动创建基于文献的先验分布,进而为通常使用的均匀先验或缺乏依据的单提示词大语言模型基准提供了一种可追溯且经过有效性验证的替代方案。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
科学通常依赖于构建模型来理解世界是如何运作的,从农田里作物的生长方式到疾病在人群中的传播方式。这些模型就像是由方程组成的复杂机器,包含了许多被称为“参数”的可调节部分。其中一些部分代表可以直接测量的事物,比如河流的宽度,但许多部分则代表隐藏的量,例如病毒感染细胞的速率,或植物根系深入土壤的深度。为了使这些模型发挥作用,科学家必须调整这些隐藏的部分,直到模型的预测与现实世界的观测结果相匹配。这种调整过程被称为“校准”。
几十年来,调整这些模型最可靠的方法是一种被称为“贝叶斯校准”的方法。这种方法要求科学家在查看新数据之前,先陈述他们对某个隐藏部分的既有认知。这种初始认知被称为“先验分布”。如果科学家知道某种温度不能超过特定的限制,他们可以将这一知识融入模型中。然而,寻找构建这些信念的正确信息是非常困难的。知识散落在数以千计的科学论文中,手动收集这些信息对于单个模型而言可能需要数天的阅读时间。由于这个过程非常缓慢,许多研究人员干脆跳过这一步,假设每个可能的参数值出现的概率都是相等的。这种捷径虽然简单,但往往会导致模型准确性降低,且从新数据中学习的速度变慢。
一个研究团队开发了一个名为 Distribird 的新工具来解决这个问题。这是一个自动化系统,旨在阅读科学文献并为科学家构建这些初始信念,将过去需要数天才能完成的工作缩短至几分钟。该系统通过获取参数的描述(例如“玉米光合作用的最大温度”)来运作,然后派出由数字代理组成的团队去搜索科学数据库。这些代理会寻找相关的研究论文,阅读它们,并提取其他科学家报告的具体数值。随后,系统会根据原始研究与当前情况的匹配程度对这些数值进行加权。如果一项研究是针对不同类型的植物或在不同的气候条件下进行的,系统会将该数值视为不太重要。最后,它将所有收集到的数值合并为一个单一且定义明确的概率分布,代表了当前的最佳知识水平。
研究人员在包括气候科学、生态学和工程学在内的十个科学领域中的二十四个不同参数上测试了这个工具。他们将自动化系统的结果与一种更简单的方法进行了对比,后者是让单个人工智能在不查阅任何论文的情况下猜测分布。结果显示,两种方法生成的先验分布在准确性上相似。自动化系统并没有比简单的猜测找到更优的分布“中心”,但它提供了简单猜测无法提供的东西:一条完整的证据链。Distribird 使用的每一个数字都链接回特定论文中的特定句子。科学家可以查看结果,并清楚地看到哪些研究支持了该结论,从而允许他们验证工作,或决定忽略他们不信任的来源。
或许最重要的发现是该系统如何处理它无法回答的问题。当研究人员询问关于自然界中不存在的参数时(例如虚构的名称或没有物理意义的内部软件设置),自动化系统能够正确地拒绝给出答案。它将这些请求标记为无效并停止运行。相比之下,那个不查阅文献的简单方法在面对这些虚假问题时,竟然自信地编造了答案,为不存在的事物提供了具体的数值。这种说“我不知道”而不是编造内容的能力对于科学安全性至关重要。研究人员还确保了整个系统都在使用开源软件的本地计算机上运行,这意味着没有任何私密数据或未发表的研究细节会被发送给外部公司。
这种额外的安全性和透明度是以时间和计算能力为代价的。虽然简单的猜测只需几秒钟,但完整的自动化过程每个参数需要大约二十分钟到四十分钟,并且需要阅读数十篇论文的全文。研究人员发现,对于非正式工作,快速猜测可能就足够了。然而,对于每一项数字都必须具有可辩护性和可审计性的严肃科学工作,自动化系统提供了一种简单猜测无法提供的信任水平。它将缓慢、手动的文献阅读任务转变为一个快速、可重复的过程,并留下了清晰的记录链,确保科学家使用的模型是建立在真实证据而非猜测之上。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。