← 最新论文
💬 NLP

SSE-Bio: A Structured Self-Evolving Agent with Agentic Retrieval Policy for Multi-Hop Biomedical Reasoning

本文介绍了 SSE-Bio,一种结构化自进化智能体,它利用可训练的代理策略和细粒度模板编辑来优化检索决策并提升多跳生物医学推理能力,在关键基准测试上优于现有的基准模型。

原作者: Zhaohan Meng, Zaiqiao Meng, Siwei Liu, Hao Xu, Ke Yuan, Iadh Ounis

发布于 2026-08-25
📖 1 分钟阅读☕ 轻松阅读

原作者: Zhaohan Meng, Zaiqiao Meng, Siwei Liu, Hao Xu, Ke Yuan, Iadh Ounis

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在现代医学的广袤领域中,发现新疗法或理解复杂疾病的过程,往往感觉就像是在解一个拼图,而拼图碎片则散落在不同的知识领域之中。一位医生可能知道某种特定药物可以治疗某种症状,而一位研究人员可能知道某种特定蛋白质会导致该症状,但将药物与蛋白质联系起来则需要跨越一道并不总是显而易见的鸿沟。这种被称为“多跳推理”(multi-hop reasoning)的过程对于医学发现至关重要,但对计算机而言,掌握这一过程却极其困难。传统的人工智能系统通常难以应对,因为它们往往遵循僵化的、预设的路径,或者进行广泛的猜测,从而在面对复杂的证据时误入歧途。如果计算机遗漏了逻辑链条中哪怕一个关键环节,整个结论就可能崩塌,从而导致不完整或错误的医疗建议。

为了应对这一挑战,研究人员开发了一种名为 SSE-Bio 的新型人工智能智能体,专门用于应对这些复杂的医学谜题。与以往依赖静态指令或在出错时对自身记忆进行大规模改动的旧系统不同,这种新智能体采用了一种更为严谨的方法。它维持着一份清晰、结构化的当前思维过程记录,并使用一个专门的决策者来精确选择何时以及检索什么信息。它不会在每次尝试后都从头开始重写其整套规则,而是根据有效经验对记忆进行细微且精准的编辑。这使得系统能够在不迷失方向或凭空捏造事实的前提下,从经验中学习。

SSE-Bio 的核心创新在于它如何管理其记忆和信息检索。该系统围绕一个中央规划器构建,该规划器维护着一个结构化的状态,就像一本短期笔记,记录着推理在任何给定时刻的具体进展。当系统需要解决问题时,该规划器会参考一个由过往成功方案组成的长期库,即“模板”。然而,系统并不会盲目复制这些旧方案。相反,一个专门的组件(充当检索策略的角色)会决定是去获取关于疾病和药物的具体事实,还是调取过去的通用策略。这一决策针对每一个推理步骤都经过仔细考量,确保系统只收集其真正需要的信息。如果系统犯错,它不会丢弃整个记忆;相反,它会执行精细的编辑,仅更新模板中错误的部分,从而保持其余知识的完整性。

为了教会这个智能体如何做出关于检索内容的最佳决策,研究人员使用了一种涉及比较系统可能采取的不同路径的训练方法。他们创建了一些场景,让智能体尝试“查找事实”与“查找策略”的不同组合。通过分析哪些路径导向正确答案,哪些路径导致了死胡同,系统学会了识别出表明其需要更多信息的迹象。这一训练过程非常严格,既关注最终答案的正确性,也确保每一步推理都有实际证据支撑。结果表明,该智能体不仅准确,而且在得出结论的过程中具有透明度,因为它能够指出用于构建论据的具体证据片段。

在旨在评估医学推理能力的三个不同基准测试中,SSE-Bio 的表现始终优于现有系统。在一个包含数千个复杂医学问题的名为 BioHopR 的数据集上,这种新智能体的准确率较之前表现最好的自我进化系统有了显著提升。它在处理需要寻找多个正确答案的问题时表现尤为出色,而许多其他系统在面对此类任务时往往会过早放弃或提供不完整的列表。该系统还展示了其技能泛化能力,在处理从未见过的医学问题时表现良好,这表明其学习方法具有鲁棒性和适应性。

研究人员发现,系统的成功并非归功于单一特征,而是源于其结构化记忆与智能检索策略的结合。当他们移除使其能够进行精细编辑记忆的能力,或者移除决定搜索内容的组件时,系统的性能明显下降。这证实了精确更新知识以及明智选择信息来源的能力对于其成功都是必不可少的。研究还显示,该系统仍有提升空间;即使具备目前的能力,若为其提供完美的信息,其表现将会更好,这表明瓶颈不在于其推理逻辑,而在于其获取信息的质量。

在更广泛的人工智能背景下,这项工作代表了一种转变——即不再试图通过大范围重写指令的方式来学习一切。相反,SSE-Bio 表明,一种更受控、更结构化的记忆与信息检索方法可以带来更可靠、更可信的结果。通过保持清晰的推理步骤记录并对其知识库进行细小且有针对性的调整,该系统避免了经常困扰更混乱的学习方法的混乱与错误。这种方法为构建能够辅助高风险领域(如医学,其中准确性和解释推理过程的能力与答案本身同样重要)的人工智能提供了一条充满前景的路径。研究人员承认,虽然他们的系统是一个重要的进步,但在优化信息获取方式以及管理不断增长的知识库以确保其高效且实时更新方面,仍有大量工作要做。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →