AutoSchema: Live Schema Grounding for Agentic Text-to-Sparql over Heterogeneous Knowledge Graphs
本文提出了 AutoSchema,这是一个用于实时模式接地(schema grounding)的无需训练的框架,它使语言模型智能体能够直接检查异构知识图谱端点并构建 SPARQL 查询,而无需依赖预先策划的模式文件,证明了其在生物医学和化学领域相比于 TogoMCP 等现有方法具有更高的准确性和效率。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,科学互联网就像一座巨大而混乱的图书馆,其中的每一本书都用不同的语言编写,使用各自独特的分类系统,并且每一位图书管理员都说着一种无人能懂的方言。这就是生命科学领域中**知识图谱(Knowledge Graphs)**的现状。科学家们拥有的不是一个单一的巨型数据库,而是成千上万个专门化的“图谱”(事实的数字地图),涵盖了基因、疾病和药物等领域。每个图谱都是信息的宝库,但它们的构建方式各不相同。一个图谱可能将某种药物称为“药物 A”,而另一个则称其为“化合物 X”,并且它们将这些药物与疾病关联的方式也完全不同。
要向计算机提问,例如“哪些药物可以治疗这种特定的癌症?”,你需要将你的自然语言翻译成一种名为 SPARQL 的严格的、计算机可读的代码。这就像是试图向图书管理员借书,但你必须知道精确的杜威十进制分类号、特定的书架代码,以及目录中作者姓名的精确拼写。如果你哪怕出了一丁点差错,计算机也会返回空结果。多年来,解决方案是让人类(或聪明的 AI)为每一座图书馆编写一份庞大且完美的“参考指南”,然后才能开始提问。但如果图书馆的架子在夜间之间发生了变化呢?或者如果这是一个从未有人见过的全新图书馆呢?这正是本文所要解决的问题:一个计算机代理如何在不需要预先编写手册的情况下,在身处图书馆内部的同时,摸索出这座图书馆的规则?
该论文介绍了一个名为 AutoSchema 的新框架,它扮演着这些科学图书馆中一位超级聪明、充满好奇心的侦探的角色。AutoSchema 不再等待人类编写一份静态的“参考指南”(作者称之为 MIE 文件,该指南可能会过时),而是让 AI 代理直接进入“实时”数据库并四处窥探。当代理产生疑问时,它不会去猜测规则,而是直接询问数据库:“嘿,你的书架叫什么名字?这个基因怎么拼写?这个药物是如何与那个疾病联系起来的?”它会在提问的瞬间,实时收集这些证据。
研究人员使用各种棘手的生物医学问题,将这位“侦探”与旧方法(依赖于那些预先编写的参考指南)进行了对比测试。他们发现 AutoSchema 通常能找到更正确的答案。在涉及基因和疾病的测试中,新方法比旧方法更频繁地获得正确的事实,且犯错更少。它还使用了更少的“工具调用”(即向数据库提问的尝试次数更少),并且不容易陷入死循环。作者指出,这种方法在处理杂乱、不规则或尚无参考指南的全新数据库时尤其有用。然而,他们也谨慎地指出,虽然结果令人鼓舞,但在他们的测试中,“桥接(bridge)”功能(用于连接两个不同图书馆的功能)并未被频繁使用,仍需更多实验来确保它在每种场景下都能完美运行。
简而言之,这篇论文认为,与其依赖一张可能错误或过时的静态预设地图,我们不如让 AI 代理进行实地探索。通过将问题建立在数据库当前的实际状态之上,它们可以更准确、更高效地在复杂的生命科学数据景观中进行导航。这是一种从“背诵地图”到“边走边识地形”的转变。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。