← 最新论文
💻 computer science

HypoForge: A Self-Improving Multi-Agent Framework for Automated Hypothesis Generation and Testing via Scientific Skill Learning

HypoForge 是一个用于自动化科学发现的自改进多智能体框架,它通过采用特定阶段的学习策略——用于假设生成的对抗性生成器-判别器机制,以及用于假设检验的基于结果的技能学习——来实现无需微调基础模型的持续改进。

原作者: Ziqing Qian, Jiaying Lei, Yifang Wang, Nan Cao

发布于 2026-08-27
📖 1 分钟阅读☕ 轻松阅读

原作者: Ziqing Qian, Jiaying Lei, Yifang Wang, Nan Cao

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

科学始终是好奇心与证据之间的对话。研究人员观察到世界中的某种模式,追问其发生的原因,并提出一种被称为“假设”的解释。这种想法不仅仅是一个猜测;它是关于自然运作方式的一个特定主张,是可以被测试的。当科学家设计实验以观察这一想法是否经得起现实检验时,真正的研究工作才算开始。如果数据支持该主张,该想法就会增强;如果数据与之矛盾,该想法则会被舍弃或修改。这种提出并测试的循环是发现的引擎,但它也是一个缓慢且艰难的过程,需要多年的训练才能掌握提问艺术和构建正确测试的方法。

几十年来,计算机一直被用于处理数字和运行模拟,但在参与这种对话的创造性部分方面却一直表现挣扎。人工智能的最新进展赋予了机器阅读海量文本并生成类人语言的能力,这引发了人们对于机器可以作为自主科学家的希望。然而,这些系统大多表现得像是在背诵了单一教科书章节后,试图仅凭这些固定知识来解决所有新问题的学生。它们可以生成假设或进行测试,但无法从错误中学习以在下一次做得更好。它们缺乏积累经验的能力,这意味着每当面对一个新的科学问题时,它们都会从零开始,重复同样的错误并错过同样的洞察。

一组研究人员通过开发一种名为 HypoForge 的新系统解决了这一局限性,旨在帮助人工智能随着时间的推移学习并提高其科学推理能力。该系统的构建基于这样一个观察:生成假设和测试假设是两种截然不同的任务,需要不同类型的学习。当机器提出一个新想法时,通常没有即时的方法知道它是真还是假;答案可能在数年后才会揭晓。在这一阶段,系统无法依赖简单的对错信号。相反,研究人员让系统通过将许多不同的想法进行相互比较来批判自己的工作,从而精炼其识别哪些解释最合理且在科学上最可靠的能力。

一旦系统生成了一组候选想法,它就会进入测试阶段,此时规则发生了变化。在这里,系统设计实验,编写运行代码,并在真实数据上执行。由于这些实验的结果是已知的,系统会收到关于其设计是否奏效以及代码是否运行正确的清晰、事实性的反馈。研究人员发现,通过将这两个阶段分开处理,系统可以为每个阶段学习特定的技能。它学会了在生成想法时成为更好的评论家,在测试时成为更精准的工程师。这种方法使系统能够将其过去的成功与失败提炼为可重用的“技能”,就像人类科学家内化以往研究中的教训以改进未来工作一样。

研究人员在涉及真实世界数据的科学任务集上测试了这个框架,涵盖了从预测社交媒体参与度到分析医学引用的各种任务。他们将该系统与依赖静态指令或固定工作流的其他先进人工智能工具进行了对比。结果显示,HypoForge 的表现始终优于其他系统。在生成假设的任务中,它产生的想法不仅质量更高,而且比竞争对手涵盖了更广泛的可能性解释。在测试这些想法的任务中,它成功设计的实验验证正确假设的成功率也高于其他方法。

至关重要的是,研究表明,该系统的进步源于其从经验中学习的能力,而非改变其底层大脑。系统不需要从头开始重新训练或获取新数据来学习;它只是根据收到的反馈来优化其使用的程序。当研究人员移除从过去结果中学习的能力时,系统的性能显著下降,这证明了经验的积累是关键因素。该系统还展示了它可以将这些学到的技能迁移到新的、未见的任务中,这表明它学习的是通用的科学推理原则,而非仅仅是记忆特定的答案。

这项工作为人工智能在科学领域的发展指明了一条充满前景的路径。研究人员不再仅仅构建那些快速执行指令的机器,而是正在开发能够进化自身探究方法的系统。通过将想象可能性的创造行为与验证可能性的严谨行为分离,并通过允许系统为每种行为学习不同的技能,HypoForge 已经证明机器可以开始模仿人类科学发现的累积本质。该系统并非取代科学家,而是提供了一种新型的合作伙伴,它能随着每一次实验的运行而变得更加聪明,将缓慢的试错过程转化为持续改进的闭环。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →