TRACE: Trustworthy Retrieval-Augmented Conversational Engine
本文介绍了 TRACE,这是一个检索增强型框架,通过将用户查询解析为结构化和语义约束,增强了具备约束感知能力的公共服务推荐,并证明了高质量的检索能显著减少幻觉,且无论底层大语言模型的规模如何,都能提高用户满意度。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图在一个巨大的、杂乱无章的阁楼里寻找一件特定的、隐藏的宝藏。这个阁楼里装满了旧箱子,有些贴着清晰的标签,有些标签撕裂了,还有些根本没有任何标签。现在,想象你有一个超级聪明的机器人助手,它非常喜欢讲故事。如果你问机器人:“金币在阁楼的哪里?”它可能会因为太兴奋于讲述关于金币的故事,而编造一个不存在的位置,或者指向一个实际上装着旧袜子的箱子。这就是许多现代 AI 聊天机器人的问题所在:它们很擅长交谈,但当需要寻找真实事实时,有时会信口开河。
这篇论文生活在“检索”(retrieval)的世界里,这只是一个形容在回答问题之前搜索信息这一行为的专业术语。它还涉及“约束”(constraints),即你给搜索设定的特定规则,比如“只看红色的箱子”或“只看 1990 年的箱子”。研究人员提出的核心问题是:如果我们修复搜索部分,让机器人只看阁楼里真实的箱子,机器人是否就会停止编造故事?他们想知道,一个更好的搜索引擎是否是让 AI 变得值得信赖的秘诀,特别是当人们需要寻找像食物派发点这样的现实世界服务时。
研究人员构建了一个名为 TRACE(可信检索增强对话引擎)的新系统来测试这个想法。把 TRACE 想成一位非常严格的图书管理员,在机器人助手开口说话之前,它拒绝让其说话,除非它已经亲手核对了图书卡。当用户问一个问题,比如“如果我没有身份证件,在西德威科县(Sedg回个县)哪里可以获得食物?”时,TRACE 不会让机器人瞎猜。首先,它会将问题分解为两个部分:“结构化”规则(如特定的县)和“语义”规则(如对身份证件的要求)。
为了找到正确的答案,TRACE 使用了一张“双重”地图。地图的一部分是知识图谱(Knowledge Graph),它就像一个由相互连接的点组成的网络,精确展示了事物的关系(城市 → 县 → 派发点)。另一部分是向量嵌入(Vector Embedding),它就像一团模糊的意义云,能够理解关于谁可以获得帮助的文本描述。系统首先使用严谨的网络来找到符合位置规则的一小组候选对象。然后,它通过检查这些“模糊云”来确认这些候选对象是否也符合其他规则。如果列表为空,它会抓取下一批候选对象并重试。只有一旦拥有了一个经过验证的列表,它才会让 AI 聊天机器人编写最终答案。
团队使用一个包含约 800 个食物派发点的真实目录和 1,000 个虚构问题测试了这个系统。他们使用了 15 种不同的 AI 模型进行测试,范围从极小的模型到非常庞大的模型,甚至还与一个著名的“专有”模型(GPT 5.5)进行了对比。他们还测试了不同版本的“地图”,包括一个完全没有图谱的版本(仅有纯文本)以及一个结合了位置和营业时间的“超级图谱”。
结果非常明确,并表明搜索的质量比聊天机器人背后的“大脑”规模更重要。当他们使用最好的地图版本(KG-3,结合了位置和时间)时,系统的规则遵循能力显著提升。例如,平均“约束满足度”(即答案实际遵循用户规则的频率)从基础搜索时的约 64% 跳升至先进地图下的近 88%。更重要的是,AI 编造虚假派发点(即“幻觉”)的次数大幅下降,从约 10% 降至仅 2%。
或许最有趣的发现是,随着搜索变得更好,最聪明和最微小的 AI 之间的差异开始消失。当搜索很混乱时,大型、昂贵的模型比小型模型表现得好得多。但当搜索变得严格且精确时,即使是微小的模型,其表现也几乎与巨型模型不相上下。这表明,在需要寻找真实、经过验证的信息的情况下,拥有一个优秀的图书管理员(检索)比拥有一个擅长交谈的天才(LLM)更为重要。论文总结道,为了让公共服务聊天机器人变得值得信赖,我们需要首先致力于修复检索,因为那是阻止 AI 胡编乱造的关键。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。