GeoRisk-RAG: A Hierarchy-Aware Risk Framework for Improving RAG Reliability through Selective Answering
GeoRisk-RAG 是一种新颖的层级感知框架,它通过利用基于有向无环图(DAG)的距离度量来评估地理有效性并实现选择性回答,从而增强了地理空间领域检索增强生成(RAG)的可靠性,与标准的语义相似度基准相比,显著降低了针对位置相关问题的错误置信率。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
当计算机程序试图利用庞大的文档库来回答问题时,它面临着一个微妙但危险的陷阱。这些被称为大型语言模型的程序,非常擅长寻找与问题听起来相似的词汇。如果你询问关于某个特定城镇的消防安全,计算机可能会找到一篇关于邻近城镇消防安全的完美文章。对于机器而言,这些词汇匹配得如此之好,以至于答案看起来是正确的。但在现实世界中,一个城镇的规则并不总是适用于下一个城镇。一个在某个城市禁止某些树木的规定,在下一个城市可能完全不存在。当计算机基于错误的位置自信地给出答案时,它会创造一种虚假的安全感,这在人们针对野火等自然灾害做出决策时可能非常危险。
弗吉尼亚理工大学及其他机构的研究人员开发了一种修复此问题的新方法,称为 GeoRisk-RAG。该系统不再仅仅寻找匹配的词汇,而是会检查所找到信息的实际地理位置。它不将世界视为一个扁平的地点列表,而是将其视为一个结构化的层级结构,理解城市是县的一部分,而县又是州的一部分。通过使用基于全球事实数据库构建的类似地图的结构,该系统可以精确测量两个地点在行政边界方面的距离。这使得它能够知道什么时候答案是完美的匹配,什么时候是一个接近但范围更广的猜测,以及什么时候完全是错误的地方。
团队使用一套专门针对野火(一个对位置要求极高的主题)的新问答集测试了这种方法。他们创建了一个包含 449 个问题的数据集,涵盖了 19 个不同的州和 28 个城市,范围从一般安全提示到特定城镇的具体规则。他们将这个新系统与仅依赖词汇匹配的标准方法进行了对比。结果显示,安全性有了显著提升。标准方法即使在信息来自错误位置时也会给出自信的答案,大约有 9% 的时间未能就地理不匹配向用户发出警告。相比之下,新系统将这一错误率降低到了 1% 以下。
该系统的独特之处在于它如何处理不确定性。当计算机找到的信息相关但不完全一致时——例如,当用户询问特定县的情况,而系统找到了适用于整个州的规则时——它不会仅仅进行猜测或保持沉默。相反,它会提供答案,但会增加一个明确的警告,说明该信息适用于更广泛的区域。如果信息是关于一个完全不同的地方,系统则会拒绝回答,从而防止用户根据误导性的建议采取行动。人类评估者更青睐这种行为,他们认为这种带有警告和选择性回答的方式比旧系统那些自信但可能错误的响应更值得信赖。
研究还表明,即使在问题不依赖于特定位置时,这种方法依然有效。当回答关于火灾季节或设备的通用问题时,系统并没有变得更慢或准确性降低。它只是应用了同样严谨的地理检查,确保每一个回答都立足于正确的语境。研究人员发现,通过将地理视为一种结构化关系而非仅仅是一个关键词,他们可以让人工智能在现实世界的决策中变得更加可靠。这种方法表明,对于涉及安全的关键话题,最有帮助的答案并不总是那个听起来最自信的答案,而是那个清楚地知道其适用范围的答案。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。