Reducing Hallucinations in Language Model-based SPARQL Query Generation Using Post-Generation Memory Retrieval
该论文提出了 PGMR,这是一个模块化框架,通过让大语言模型生成带有自然语言占位符的中间查询,并随后由一个鲁棒的非参数化记忆检索模块进行解析,从而减少了 SPARQL 查询生成中的幻觉问题,进而显著提高了在各种数据集和分布偏移下的查询正确性和安全性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你有一位非常聪明、博学多才的图书管理员(即大语言模型或 LLM),他非常擅长写故事和解决逻辑谜题。然而,这位图书管理员有一个奇怪的癖好:当被要求在庞大且混乱的图书馆目录(即知识图谱)中查找特定条目时,他经常会编造书架编号。他可能会自信满满地说:“这本书在书架 Q937 上”,即便那个书架根本不存在。在数据世界中,这些虚假的书架编号被称为幻觉 URI(hallucinated URIs),它们会导致图书管理员无法找到正确答案。
这篇论文介绍了一种名为 PGMR(后生成记忆检索,Post-Generation Memory Retrieval)的新系统来解决这个问题。以下是它的工作原理,分为几个简单的步骤:
1. 问题所在:图书管理员的猜谜游戏
通常,当你问图书管理员“汉堡市的市长是谁?”时,他会尝试编写一个特定的搜索查询(称为 SPARQL 查询)来寻找答案。为此,他需要知道汉堡(Hamburg)和市长(Mayor)在图书馆系统中的精确、秘密代码。由于他在思考时无法实时查阅这些代码,他只能依赖记忆。如果他的记忆模糊,他就会猜一个像 Q12345 这样的代码。如果这个代码错了,搜索就会失败,或者返回毫无意义的内容。
2. 解决方案:“占位符”策略
PGMR 不再要求图书管理员立即猜测秘密代码,而是改变了游戏的规则。
第 1 步:草稿(图书管理员的工作)
图书管理员被要求使用描述性占位符而不是秘密代码来编写搜索查询。- 与其写:
wd:Q1055(汉堡的秘密代码) - 他写:
[ENT] 汉堡 [/ENT] (德国北部的一座主要城市) - 与其写:
wdt:P190(“姐妹城市”的秘密代码) - 他写:
[REL] 姐妹行政机构 [/REL] (指姐妹城市)
现在,图书管理员可以专注于逻辑(句子结构),而不必担心那些棘手的特定代码。他本质上是在编写一份查询的“草稿”。
- 与其写:
第 2 步:查找(检索器的工作)
一旦图书管理员完成草稿,一个单独的、极其精准的工具(检索器)就会接管工作。这个工具拥有一个完美且最新的图书馆索引。它会阅读图书管理员的描述性笔记(“汉堡,德国北部的一座主要城市”)并立即找到与该描述匹配的真实秘密代码(Q1055)。它会将描述替换为真实的代码,从而将草稿转化为最终可运行的查询。
3. 为什么这是一个游戏规则的改变者
该论文声称,这种方法通过以下三个主要原因实现了巨大的进步:
它阻止了“假代码”(幻觉):
在之前的测试中,图书管理员大约有 75% 的时间在编造假代码。使用 PGMR 后,假代码率降至几乎为 0%。因为图书管理员从未需要去猜测代码,所以他无法编造。检索器只使用图书馆中实际存在的代码。它知道何时说“我不知道”:
有时,图书馆里根本没有答案。在旧系统中,图书管理员只会猜一个假代码并给出一个错误的答案。而在 PGMR 中,检索器会检查其索引。如果它无法为该描述找到匹配的代码,它就会停止并表示:“我找不到这个。”论文表明,该系统可以进行调整,使其在不确定时拒绝回答,这使得系统更加安全和可靠。它能抵御干扰:
研究人员测试了如果在检索器面前填入数百万个无关书籍(噪声)以试图迷惑检索器,会发生什么。即使记忆被增加了 9 倍 的干扰性无用信息,系统也几乎没有变慢,并且依然能找到正确的代码。这就像是在有人往你的草堆上又扔了 9 个草堆的情况下,依然能找到其中的针头。
总结
你可以把 PGMR 看作是一个团队:一个人是建筑师(LLM),负责设计蓝图;另一个人是供应商(检索器),负责寻找建造所需的精确、真实的材料。通过将设计与材料采购分离,该系统确保了最终的建筑是用真实的、现有的零件建造的,而不是想象出来的零件。
论文得出结论,这种简单的分离使得人工智能在处理结构化数据的复杂问题时,能够更加准确、安全地回答问题,而不会出现那种令人恼火的编造习惯。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。