← 最新论文
💻 computer science

Graph Query Generation with Constraint-guided Large Language Agents

本文介绍了 UniQGen,这是一种新颖的约束引导框架,它利用大语言模型代理和扩展的 Chase 与 Backchase 算法,在无需微调的情况下生成高质量、可执行的用于知识图谱问答的 Cypher 查询,从而在准确性和效率上显著优于现有最先进的方法。

原作者: Mengying Wang, Nicolaas Jedema, Rahul Pandey, RaviKiran Krishnan, Jens Lehmann, Yinghui Wu

发布于 2026-05-05
📖 1 分钟阅读☕ 轻松阅读

原作者: Mengying Wang, Nicolaas Jedema, Rahul Pandey, RaviKiran Krishnan, Jens Lehmann, Yinghui Wu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你拥有一个庞大且细节极其丰富的知识库(知识图谱)。你想用简单的英语向它提问,例如“哪些药物治疗手足搐搦?”或“哪些美国城市在二月举办过奥运会?”

问题在于,这个知识库使用两种截然不同的“语言”来存储数据:一种像严格的结构化归档系统(RDF/SPARQL),另一种则像灵活互联的笔记网络(属性图/Cypher)。大多数计算机程序仅被构建为只懂其中一种语言。如果你尝试用英语提问,计算机往往会感到困惑,编造不存在的事实(幻觉),或遗漏重要细节(例如某种药物是否真正获批使用)。

UniQGen 登场:带有安全网的“智能翻译器”

本文作者构建了一个名为 UniQGen 的新系统。不要把它仅仅看作一个靠猜测的翻译器,而应将其视为一个在撰写最终报告前先解决谜题的侦探团队。以下是其工作原理,使用简单的类比说明:

1. “约束表”(线索板)

UniQGen 不会直接跳入编写查询数据库所需的复杂代码,而是首先像侦探一样将线索钉在软木板上。

  • 线索:它将你的问题拆解为小事实(例如,“药物”、“治疗”、“手足搐搦”)。
  • 隐藏线索:它还添加了你未明说但隐含的“语用”线索。例如,如果你询问药物,系统知道你可能指的是获批药物,而非理论上的药物。
  • 置信度评分:每个线索都会获得一个“置信度评分”。如果线索模糊(如“任何药物”),则得分较低;如果线索具体(如“FDA 批准”),则得分较高。

2. “追逐”阶段(放松网)

想象你撒下一张渔网来捕鱼(答案)。

  • 问题:你的初始网可能太紧了。你可能加入了一条规则,例如“仅限冬季奥运会”,但你的问题只是“奥运会”。因为网太小,你一无所获。
  • 解决方案(追逐):系统从一个包含所有线索的超紧网开始。如果它一无所获(或错过了正确答案),它会系统地逐个移除线索以放松渔网。它会持续放松,直到至少捕获正确的答案。这确保了它不会遗漏任何重要内容(完备性)。

3. “回溯”阶段(收紧网)

现在,你的网已经足够宽松,能捕获正确的鱼,但同时也捕获了大量垃圾(错误答案)。

  • 问题:你有一张能捕获“所有奥运会”的网,但你只想要“冬季奥运会”。
  • 解决方案(回溯):系统现在反向工作。它从宽松的网开始,尝试逐个重新添加线索,以过滤掉垃圾。一旦它意识到“如果我再加这一条规则,我就会再次开始丢失正确答案”,它就会停止添加线索。这确保了最终答案精确且不包含垃圾(可靠性)。

4. “渲染器”(说语言)

一旦侦探团队确定了完美的线索集(逻辑),系统就会将该逻辑翻译成数据库理解的具体语言。

  • 魔力:由于逻辑是在翻译之前确定的,UniQGen 能够同等擅长地讲两种语言(SPARQL 和 Cypher)。它无需每次都被重新训练或“教授”新语言;它只需更改最终报告的方言即可。

为什么这很重要?

  • 无需“ schooling”:大多数 AI 系统需要针对每个新数据库在海量数据上进行“学习”(微调)。UniQGen 是“免训练”的。它利用其侦探逻辑即时解决问题。
  • 无“锁定”:公司往往因为切换太难而陷入使用某种特定数据库的困境。UniQGen 通过理解问题的意图而不仅仅是数据库的语法,打破了这种锁定。
  • 更好的答案:在测试中,UniQGen 在寻找正确答案方面远优于以往的方法,特别是对于需要连接多个点(多跳推理)的复杂问题。它在标准测试中显著提高了准确率。

简而言之:
UniQGen 是一个智能、适应性强的代理,它首先通过将问题拆解为线索来确切理解你的意图,然后利用“先放松后收紧”的策略,在捕获所有正确答案和过滤错误答案之间找到完美平衡,且无需针对遇到的每个新数据库进行重新训练。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →