← 最新论文
🤖 AI

SciToolAgent-Evo: An Ontology-Aware Self-Evolving Agent for Open-World Scientific Tool Acquisition

本文介绍了 SciToolAgent-Evo,这是一种本体感知的自我进化智能体,它通过对比学习和基于 LinUCB 的探索-利用策略,在开放世界环境中动态获取并集成新的科学工具,并通过新的 OpenSciToolBench 基准测试进行了验证。

原作者: Yuqi Tang, Chenyi Zhou, Libin Wang, Keyan Ding, Qiang Zhang, Huajun Chen

发布于 2026-08-03
📖 1 分钟阅读☕ 轻松阅读

原作者: Yuqi Tang, Chenyi Zhou, Libin Wang, Keyan Ding, Qiang Zhang, Huajun Chen

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你是一位才华横溢的侦探,但你解决的不是犯罪案件,而是科学谜团。你拥有一个装满各种小工具(如“分子称重器”或“蛋白质扫描仪”)的巨大神奇工具箱。在过去,如果你需要解决一个案例,你只能使用工具箱中已有的工具。如果完美的工具不在其中,即使你完全知道那个工具应该如何运作,你也会陷入困境。这就是当今大多数辅助科学家工作的计算机程序的现状:它们被困在一个“封闭世界”中,受限于最初教给它们的固定工具列表。

但真正的科学是混乱且开放的。有时,为了解决一个问题,你需要一个从未见过的工具。这就是“智能体”(Agent)概念出现的地方。把智能体想象成一个由大语言模型(LLM)驱动的超级聪明机器人助手——LLM是一种非常擅长理解人类语言和进行推理的AI。这些智能体非常擅长从已知列表中挑选合适的工具。然而,当列表不完整时,它们就会遇到困难。它们不知道如何表达:“我没有合适的工具,所以我需要去寻找一个新的,并学习如何在下次使用它。”那么,大问题来了:我们能否构建一种机器人科学家,它不仅能挑选工具,还能像人类研究员一样,在实战中“学习”新工具?

这正是 SciToolAgent-Evo 这篇论文所探讨的内容。来自浙江大学的研究团队构建了一种新型AI智能体,它就像一个自我进化的科学探索者。它不再受限于静态的工具箱,而是拥有一个“成长型大脑”,能够记住过去的成功与失败。当它遇到无法用现有工具解决的科学任务时,它不会放弃。相反,它会主动出击,寻找新工具,弄清楚其工作原理,并将其添加到自己的永久收藏库中。

以下是这种“自我进化”魔力的拆解步骤:

1. “进化记忆”(智能体的大脑)
想象一下,这个智能体有一个特殊的笔记本。在里面,它记录了三样东西:

  • 技能库(Skill Library): 常见任务的快捷方式(例如“如何计算分子的重量”)。
  • 经验池(Experience Pool): 关于哪里出错以及下次如何修复的笔记(例如“不要在没有容器的情况下尝试称量气体”)。
  • 工具图谱(Tool Map): 一个记录了它所知所有工具及其功能的地图。
    每当智能体解决一个问题时,它都会更新这个笔记本。如果失败了,它会记录失败的原因;如果成功使用了新工具,它会准确地写下该工具是如何运作的,这样下次就再也不用猜测了。

2. “主动请求”(提出正确的问题)
大多数AI智能体都在等待你告诉它们要做什么。SciToolAgent-Evo 则不同。当它看到一个难题时,它不仅仅是在寻找工具,它还会将问题分解,并问自己:“我现在具体需要什么样的能力?”它会创建一个“能力购物清单”。这有助于它即使在工具名称很奇怪或者不在原始列表中的情况下,也能找到正确的工具。

3. “多臂老虎机门控”(风险承担者)
这是最聪明的部分。智能体必须做出决定:“我是应该使用我已经知道的工具(安全),还是应该尝试寻找一个全新的、未知的工具(冒险)?”为了做出这种选择,它使用了一种被称为“多臂老虎机门控”(Bandit Gate)的数学策略(得名于一种需要在拉动已知杠杆获得小奖与尝试新杠杆获得大奖之间进行权衡的博弈游戏)。

  • 如果已知工具看起来行得通,它就会使用这些工具。
  • 如果已知工具显得乏力,门控就会发出指令:“去探索!”于是智能体开始搜寻新工具。
    一旦它找到了新工具,它会对其进行测试。如果测试通过,该工具就会获得一张详细描述其功能的“身份卡”(本体论/Ontology),并被添加到图谱中。

结果:一个新的基准测试
为了证明其理念的有效性,团队并没有仅仅针对简单问题进行测试。他们构建了一个名为 OpenSciToolBench 的新测试。把它想象成一个有四个难度的电子游戏:

  • 第一级: 简单任务,使用1-2个工具(例如询问一个简单的事实)。
  • 第二级: 中等任务,使用2-4个工具(例如比较两种化学物质)。
  • 第三级: 困难任务,使用3-6个工具(例如寻找符合复杂规则的分子)。
  • 第四级: 专家级任务,使用5-10个工具(例如设计一整套研究策略)。

该基准测试包含了跨生物学、化学和材料科学领域的 900个现实科学任务。当他们将 SciToolAgent-Evo 与其他顶尖AI智能体进行对比测试时,结果令人印象深刻。在最难的等级中,这个新智能体的表现显著优于其他模型。例如,在第三级任务中,它的正确率约为 56%,而排名第二的智能体仅为 35% 左右。

为什么这很重要
论文指出,这种方法之所以是一个重大进步,是因为它解决了“能力差距”问题。过去,如果科学家要求AI执行一项需要未知工具的任务,AI要么会失败,要么会产生“幻觉”(编造事实)。然而,SciToolAgent-Evo 会承认它不知道该工具,然后主动去寻找它、学习它,最后使用它。它创造了一个学习闭环:尝试 \rightarrow 失败/寻找 \rightarrow 学习 \rightarrow 更新记忆 \rightarrow 再次尝试。

作者发现,这种“自我进化”的特性使智能体更加稳健。即使在它所需的工具中有 70% 最初是未知的,该智能体仍能解决约 59% 的任务。这证明了该智能体不仅仅是在背诵答案,它实际上是在学习如何动态地获取和使用新的科学工具。

简而言之,SciToolAgent-Evo 就像一个永不停歇成长的机器人科学家。它始于一个微小的工具箱,但随着工作的开展,它构建起了一个庞大且有序的工具与技能库,使其能够应对真实科学发现中那些不可预测的、开放世界式的挑战。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →