Neuro-Symbolic Question Answering Architecture Integrating Ontology-Constrained Query Generation
本文提出了 ORACOLO,一种将本体约束的 SPARQL 查询生成与稠密检索回退相结合的神经符号问答架构,证明了其在保持相当忠实度的同时,在事实准确性方面显著优于纯稠密检索。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在人工智能领域,大型语言模型在编写文本方面已变得异常流利。它们可以通过基于从海量数据中学习到的模式来预测句子中的下一个词,从而回答问题、总结故事并进行对话。然而,这些模型有一个根本性的弱点:它们无法区分一个事实是真实的,还是仅仅听起来很有道理。为了解决这个问题,工程师们开发了一种称为检索增强生成的方法。这种方法为模型提供了一组文档供其阅读,然后再回答问题,迫使它将其回答建立在真实证据之上,而不是仅仅依赖于自己的记忆。然而,这种方法产生了一个新的问题。当系统搜索证据时,它经常会发现一段文字,其中答案被埋在一个句子之中。模型必须因此扮演一名侦探的角色,从散文式的文字中提取出特定的事实。在此过程中,它很容易误读上下文或错误地重构数值,导致生成的答案虽然流畅,却存在细微的错误。
为了解决这一问题,意大利萨莱诺大学的研究人员构建了一个名为 ORACOLO 的新系统。他们想知道是否可以通过使用被称为“本体”(ontology)的正式知识图谱,而不是仅仅通过搜索纯文本,来使事实搜索变得更加精确。本体是一个结构化的数据库,其中的事实以清晰、孤立的连接形式存储,就像一张图书馆卡片目录,每本书都以严格的格式列出了其作者和年份。挑战在于,这些目录对于普通人来说很难查询,因为它们需要一种专门的、正式的语言。该团队结合了两者的优点:他们使用神经网络(一种擅长理解人类语言的人工智能类型)将用户的提问转化为正式查询。然后,他们使用符号引擎(一个严格的计算机程序)在那个结构化地图上执行该查询。如果地图返回了明确的答案,系统就会使用它;如果地图没有返回任何内容,系统则退回到传统的文本段落搜索方法。这种混合方法使他们能够测试结构化地图是否能比文本搜索提供更准确的事实,即使两种方法都使用相同的语言模型来撰写最终答案。
研究人员在瑞士卢加诺大学图书馆的一个真实世界图书馆目录上测试了这个系统。该目录包含近十万条关于书籍的事实,包括书名、作者、出版日期和内容摘要。他们根据这个目录创建了一系列问题,范围从简单的请求(如“谁写了这本书?”)到更复杂的链式信息。然后,他们将新系统与仅使用文本搜索的标准版本进行了对比,确保两个系统都使用完全相同的语言模型来生成最终答案。这是一个至关重要的步骤,因为这意味着任何结果上的差异都必须源于信息的获取方式,而非创作者的智力水平。结果显示出准确性的明显提升。新系统正确识别答案中特定事实的频率远高于仅使用文本的系统。虽然仅使用文本的系统大约有 29% 的时间能得到正确答案,但新系统将这一比例提高到了接近 47%。
研究表明,这种改进特别源于检索精确事实的能力。当问题询问单个信息(如作者姓名或出版年份)时,新系统的表现显著更好。当问题需要将两个信息联系在一起时,它也表现出色。然而,当问题需要系统对事实进行推理(例如从书籍内容中推断主题)时,这种优势就消失了。在这些情况下,两个系统的表现相似。这表明,这种新架构并没有让计算机变得更擅长思考,而是让计算机更擅长寻找它进行思考所需的精确原材料。该系统还证明了结构化地图并没有以文本搜索所做的那种方式让答案变得更加“忠实”于证据。两个系统在遵循所给信息方面同样出色。区别仅仅在于,新系统最初被赋予了更好、更精确的信息。
研究的一个关键发现是该系统如何处理自身的错误。研究人员发现,正式地图并不总是奏效。在大约 24% 的案例中,从人类语言到正式查询的转换失败了,或者查询没有返回结果。在这些时刻,系统并没有放弃。它检测到了失败,并立即切换到文本搜索方法来寻找答案。这种安全网意味着即使在严格的地图无法提供答案时,系统仍能提供响应。然而,研究人员也发现,当正式地图正常工作时,系统的准确性最高。当系统依赖文本回退机制时,准确性的提升幅度要小得多。这证实了结构化地图才是精准度的来源,而文本搜索则充当了可靠的备份。
这项研究还揭示了关于衡量这些系统质量的一个令人惊讶的问题。衡量答案质量的一个常用指标是“相关性”,它检查答案与主题的匹配程度。研究人员发现,一个没有任何事实错误但仅仅是流畅地进行猜测的系统,其相关性得分可能比他们的准确系统还要高。这是因为猜测型的系统写出了长篇大论、流畅优美的答案,听起来非常完美,而准确的系统有时会给出简短、直接的回答,或者在找不到事实时拒绝回答。这表明相关性评分可能会产生误导,奖励的是风格而非实质。研究人员得出结论,要真正评估这些系统,我们必须观察事实是否正确,而不仅仅是看答案听起来是否好听。
最后,团队检查了运行这个新系统的成本。翻译问题、检查地图并撰写答案的过程比直接让语言模型进行猜测要耗时得多。平均而言,新系统回答单个问题需要约 292 秒,而仅使用文本的系统约为 35 秒。研究人员指出,这种延迟主要是由于语言模型处理信息所需的时间,而不是检查地图所需的时间。他们发现,在他们的流程中,有一个试图将复杂问题拆解为较小部分的特定步骤,实际上减慢了系统的速度,却没有提高结果。移除这一步可以在不损害准确性的情况下显著缩短时间。这表明,虽然该系统目前对于即时、交互式的使用来说太慢了,但在准确性比速度更重要的场景下(如核实历史记录或检查机构数据)是具有实用价值的。这项工作证明,通过将人类语言的灵活性与结构化数据的精确性相结合,我们可以构建出比仅依赖语言的系统更加可靠的系统。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。