← 最新论文
🤖 AI

Autonomous Knowledge Graph Exploration with Adaptive Breadth-Depth Retrieval

本文介绍了 ARK,一种自适应且无需训练的图谱检索器,它使语言模型能够动态平衡全局词汇搜索与邻域探索以进行证据检索,在基准数据集上实现了最先进的性能,并展示了成功蒸馏至更小模型的能力。

原作者: Joaquín Polonuer (Department of Biomedical Informatics, Harvard Medical School, Boston, MA, USA, Departamento de Computación, FCEyN, Universidad de Buenos Aires, Buenos Aires, Argentina), Lucas Vittor
发布于 2026-04-30
📖 1 分钟阅读☕ 轻松阅读

原作者: Joaquín Polonuer (Department of Biomedical Informatics, Harvard Medical School, Boston, MA, USA, Departamento de Computación, FCEyN, Universidad de Buenos Aires, Buenos Aires, Argentina), Lucas Vittor (Department of Biomedical Informatics, Harvard Medical School, Boston, MA, USA), Iñaki Arango (Department of Biomedical Informatics, Harvard Medical School, Boston, MA, USA), Ayush Noori (Department of Biomedical Informatics, Harvard Medical School, Boston, MA, USA, Department of Engineering Science, University of Oxford, Oxford, UK), David A. Clifton (Department of Engineering Science, University of Oxford, Oxford, UK, Oxford Suzhou Centre for Advanced Research, University of Oxford, Suzhou, Jiangsu, China), Luciano Del Corro (ELIAS Lab, Departamento de Ingeniería, Universidad de San Andrés, Victoria, Argentina, Lumina Labs, Buenos Aires, Argentina), Marinka Zitnik (Department of Biomedical Informatics, Harvard Medical School, Boston, MA, USA, Kempner Institute for the Study of Natural and Artificial Intelligence, Allston, MA, USA, Broad Institute of MIT and Harvard, Cambridge, MA, USA, Harvard Data Science Initiative, Cambridge, MA, USA)

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你是一名侦探,试图解开一个谜团,但你拥有的不是一本单一的笔记本,而是一座庞大、 sprawling 的图书馆,其中每一本书都通过无形的丝线与其他书相连。有些书只涉及单一主题(例如“苹果”),而另一些则通过长长的关系链相互连接(例如“苹果” \to “果园” \to “果农” \to “天气模式”)。

这就是**知识图谱(KGs)**所面临的挑战:巨大的事实网络,其中信息以节点(事物)和边(关系)的形式存储。

本文介绍了一种名为ARK(自适应知识检索器)的新工具。将 ARK 想象成一名超级聪明、自主的侦探,它确切地知道如何在这座图书馆中导航,以找到你问题的答案。

以下是 ARK 的工作原理,通过简单的类比进行解释:

问题:“过于浅显”与“过于迷失”的两难困境

以往在这些图书馆中查找信息的方法存在两个主要缺陷:

  1. “关键词搜索”侦探:这位侦探擅长找到包含特定词汇(如“苹果”)的书籍。但他们只看封面。如果答案隐藏在连接链的三本书之后,他们就会错过。他们过于浅显
  2. “种子”侦探:这位侦探挑选一本起始书,然后顺着丝线走到下一本,再走到下一本。但如果他们选错了起始书,就会陷入死胡同。他们过于脆弱,因为他们依赖于猜测正确的起点。

解决方案:ARK 的双工具包

ARK 通过赋予 AI 侦探一个双工具包,并允许其根据线索(查询)在两者之间自由切换,从而解决了这一问题。

  1. 工具 A:“全局搜索”(广撒网)

    • 作用:它一次性扫描整个图书馆,以找到与你问题中的词汇相匹配的书籍。
    • 使用时机:如果你的问题是关于某个特定事物(例如“告诉我关于电影《盗梦空间》的信息”),ARK 会广撒网,立即找到正确的起点。
    • 类比:这就像在使用搜索引擎在庞大的百科全书中找到正确的页面,然后再开始阅读。
  2. 工具 B:“邻域探索者”(局部漫步)

    • 作用:一旦有了起始书籍,它就会走到书架上紧邻其旁的书籍(即“邻居”),并检查它们是否相关。
    • 使用时机:如果你的问题是关于一系列事件(例如“谁撰写了引用了关于这种药物研究的论文?”),ARK 就会停止搜索整个图书馆,转而顺着丝线从一本书走到下一本。
    • 类比:这就像询问图书管理员:“还有谁坐在这张桌子旁?”然后检查他们的书籍。

魔法:“自适应”决策

ARK 的精髓在于它能够即时决定使用哪种工具

  • 如果你提出的问题侧重于词汇(例如“特斯拉的价格是多少?”),ARK 会使用全局搜索来快速找到答案。
  • 如果你提出的问题侧重于连接(例如“药物 A 如何影响蛋白质 B,进而影响疾病 C?”),ARK 就会切换到邻域探索以追踪线索。

它不需要预先被告知要走多少步。它只需继续前行,直到找到答案,或者意识到需要再次撒开更大的网。

“团队协作”提升(并行代理)

为了确保侦探不会遗漏任何内容,ARK 可以同时派出多名侦探

  • 想象派出三名侦探进入图书馆。他们都以略微不同的方式开始。
  • 当他们回来时,ARK 会查看他们的列表。如果其中两三名侦探找到了同一本书,那么这本书很可能是正确答案。
  • 这种“投票”系统使得结果更加可靠,而无需在特定示例上训练 AI。

“学生”版本(蒸馏)

通常,这位聪明的侦探需要一个非常强大(且昂贵)的大脑(大型 AI 模型)才能如此清晰地思考。

  • 作者提取了超级聪明的“老师”的“思维过程”(侦探所走的路线),并教导一个更小、更便宜、更快的“学生”(一个 80 亿参数的模型)去模仿这些步骤。
  • 结果:学生侦探几乎能像老师一样出色地完成任务,但运行速度更快、成本更低。它学会了如何探索,而无需事先被展示“正确答案”;它只是通过观察老师的工作而学会的。

结果

该论文在三个巨大的现实世界图书馆上测试了 ARK:

  1. Amazon:一个巨大的产品和评论商店。
  2. MAG:一个包含科学论文和作者的庞大图书馆。
  3. PRIME:一个复杂的生物数据地图(药物、基因、疾病)。

结果

  • ARK 击败了几乎所有其他方法,特别是在复杂的科学和生物图谱上,在这些图谱中顺着“丝线”追踪至关重要。
  • 在找到第一个正确答案方面,它将准确率提高了巨大幅度(比其他方法高出高达 31%)。
  • 它证明了你无需在每一个特定图谱上训练 AI;你只需要赋予它正确的工具,并让它自己找出策略。

总结

ARK 就像一名侦探,知道何时使用搜索引擎(以找到正确的起点),何时使用手电筒(以逐步追踪线索)。它能根据问题进行调整,通过团队协作来避免错误,并且能够教导一个更小、更便宜的版本来执行相同的工作。它使得在复杂、互联的数据中寻找答案变得更加快速和准确。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →