← 最新论文
🧬 biology

The Little Scientist: LLM Agent-Driven Discovery via the Scientific Method

该论文介绍了“小科学家”(The Little Scientist),这是一个基于大语言模型(LLM)的智能体框架,通过由增强了“库恩智能体”(Kuhn agent)以实现范式转移的迭代假设检验循环来自动化科学发现,并仅利用 CPU 资源便成功生成了用于蛋白质适应度预测和 DNA 基序发现的新颖、达到最先进水平(SOTA)的算法。

原作者: Travis Smith

发布于 2026-08-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Travis Smith

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ⚕️ 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明

科学的进步往往并非源于单一的、天才般的灵光一现,而是通过一个缓慢且重复的循环:猜测、测试并从错误中学习。研究人员提出一个想法,构建一个工具来测试它,观察其失效之处,然后根据这些具体的失败点来完善想法。这就是科学方法,一个驱动了人类数世纪发现的过程。长期以来,计算机在处理数字或遵循严格指令方面表现出色,但在模仿这种类人推理循环方面却一直表现挣扎。它们可以尝试数百万种随机的变化来寻找更好的解决方案,即一种被称为“进化搜索”的方法,但它们往往缺乏理解“为什么”某次尝试会失败,或者在陷入困境时改变整个研究路径的能力。研究人员一直在追问的问题是:是否可以教会一个计算机程序像科学家一样思考——形成假设、测试假设,并根据结果进行学习,就像人类那样。

最近一项名为“小科学家”(The Little Scientist)的研究以肯定的回答了这个问题。研究人员构建了一个系统,其中的人工智能智能体扮演着科学家的角色,在一个数字实验室中解决复杂的生物学问题。该智能体并非盲目地尝试数百万次随机的代码更改,而是遵循一个严格的、循序渐进的过程:它对如何改进解决方案提出假设,编写代码来测试该想法,运行测试,然后仔细比较结果与最初预测之间的差异。如果结果比预期差,该智能体并不会仅仅丢弃这次尝试;它会分析失败的具体原因,从而形成一个新的、更好的假设。当智能体陷入微小改进的局部循环时,第二个专门的智能体会介入,提出一种全新的思考问题的方式,迫使系统打破僵局并探索新的领域。

研究人员在两个截然不同的生物学挑战上测试了这个系统。第一个任务是寻找 DNA 序列中的隐藏模式,这对于理解基因是如何受调控的任务至关重要。第二个任务是预测蛋白质结构的改变如何影响其功能,这对于药物开发和理解疾病至关重要。在两种情况下,系统仅被给予了原始数据和游戏规则,而没有任何关于现有最佳解决方案的先验知识。结果是,系统发现了两种超越目前人类专家所使用的最先进工具的新方法。对于 DNA 模式任务,该系统从零开始发明了一种新算法,该算法不仅更准确,而且比目前科学家使用的标准工具快了 11 倍。对于蛋白质预测任务,它发现了一种结合现有多个模型预测的复杂策略,达到了超越全球 90 多个竞争模型的排行榜顶尖水平的准确度。

使这一成就尤为显著的是其过程的高效性。整个研究程序(涉及数千次假设与测试的迭代)是在一台标准的计算机服务器上运行的,无需专门且昂贵的图形硬件。与近期其他自动化发现的尝试相比,该系统消耗的计算能力相对较少,因为那些尝试通常需要大规模的分布式计算机网络。研究人员发现,通过强制要求 AI 解释其推理过程并从特定的失败中学习,该系统寻找解决方案所需的尝试次数远少于依赖随机试错的方法。这表明,教导机器遵循科学方法——而不是仅仅让它们进行猜想与检查——可能是未来实现自动化发现的一种更强大的方式。

这个被作者称为“小科学家”的系统是通过两个不同角色的协作运作的。第一个是“科学家”智能体,它充当主要研究员。它编写代码、运行实验,并记录其思想和结果的详细日志。第二个是“库恩”(Kuhn)智能体,以一位著名的科学哲学家的名字命名,这位哲学家曾描述过科学进步有时需要视角的彻底转变。当“科学家”智能体停止取得进展并陷入困境时,“库恩”智能体会介入。它观察失败的历史,并建议一种完全看待问题的新方式,通常是从另一个科学领域汲取灵感。这迫使系统放弃当前的路径,尝试一种根本不同的方法,就像一位意识到当前理论有误并决定用新视角重新开始的人类科学家一样。

在 DNA 模式发现挑战中,系统的任务是寻找作为转录因子结合位点的短 DNA 序列。这些位点对于开启或关闭基因至关重要,但寻找它们非常困难,因为这些模式可能很微妙且长度不一。系统从一个基础方法开始,在几周的时间里不断迭代改进其方法。它发现,基于模式出现的频率及其在不同 DNA 样本中出现的一致性来进行观察,比以往的方法更有效。它产生的最终算法被研究人员命名为 DALE,该算法能够比现有的最佳工具更准确地识别这些模式。同时,它的运行速度也显著加快,在旧工具需要几分钟或几小时处理数据时,它仅需几秒钟即可完成。系统在没有被告知这些特定策略的情况下实现了这一点;它是通过假设与测试的循环完全自主发现这些策略的。

第二个挑战涉及预测蛋白质突变如何影响其适应度(即功能发挥情况)。这是一个复杂的问题,因为蛋白质是由长链构建块组成的,改变其中一个构建块可能会产生不可预测的影响。系统被给予了来自五个不同现有模型的预测,并被要求将它们合并为一个更好的预测。系统并没有简单地对结果取平均值,而是开发了一种名为 Delta V 的策略。它学会了根据每个模型的置信度以及特定突变如何影响蛋白质结构来调整每个模型的权重。它还开发了一种在蛋白质相邻部分之间共享信息的方法,意识到如果一个模型在某一部分出错,那么它在相邻部分也很可能出错。这种方法使它在主要的全球基准测试中超越了所有其他模型,以显著优势击败了排名第二的模型。

“小科学家”的成功凸显了我们使用人工智能进行科学研究方式的转变。我们不再仅仅将 AI 视为执行指令或搜索数据模式的工具,而是将其视为一名初级研究员。它被赋予了进行推理、犯错并以结构化方式从错误中学习的自由。研究人员发现,系统通过形成明确的预测并随后将其与实际结果进行对比的过程,是其成功的关键。当系统预测某种改变会改善结果但实际并未发生时,它并不仅仅是跳过,而是分析差异以理解哪里出了问题。这种通过学习失败而非仅仅丢弃失败的过程,使得系统能够建立起随机搜索方法无法实现的对问题的深度理解。

该研究还证明了这种方法可以在资源非常有限的情况下工作。整个项目是在一台具有标准计算能力的虚拟主机上运行的,总成本不到 500 美元。这与近期其他需要大规模计算机集群和数百万美元计算成本的自动化发现系统形成了鲜明对比。研究人员认为,这种效率来自于系统接收到的反馈质量。系统不仅仅是被告知“这是好的”或“这是坏的”,而是得到了关于测试在哪些部分失败以及为何失败的详细报告。这使其能够进行有针对性的改进,而非随机猜测。

虽然结果令人印象深刻,但研究人员也谨慎地指出了其局向。该系统是在两个特定的生物学问题上进行的测试,在这些问题中,数据是组织良好的,且结果可以精确测量。目前尚不清楚这种方法是否适用于数据混乱、评估成本高昂或答案不易量化的问题。研究人员还指出,他们的系统并不是取代人类科学家,而是与人类并肩作战。需要人类研究员来搭建数字实验室、定义规则并提供初始数据。人类还在某一时刻介入,为系统提供了额外的数据源,这使得系统实现了性能的重大飞跃。这表明,未来的科学发现可能在于一种伙伴关系:人类提供战略方向,而 AI 处理快速且不知疲倦的实验迭代。

这项研究的发现为人工智能能够超越单纯的信息处理、积极参与创造性发现的过程提供了一个缩影。通过模仿科学方法,这些系统可以高效且有效地探索复杂问题。它们可以发现人类专家可能未曾想到的新算法和新策略,并且其过程具有透明度,使我们能够准确理解它们是如何得出结论的。随着技术的进步,我们可能会看到这些系统应用于更广泛的科学挑战,从设计新材料到理解人类大脑的复杂性。“小科学家”不仅仅是一个解决问题的工具;它证明了科学发现的过程本身是可以自动化的,从而开启了一个加速研究的新时代。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →