Hierarchical Reranking for Scalable Financial RAG System
本文介绍了 Hierarchical Reranker,这是一个可扩展的 RAG 框架,它通过整合检索前优化、两阶段排序机制以及长上下文管理,显著提升了复杂金融文档分析中的检索精度与事实一致性,并由此在 ACM-ICAIF '24 FinanceRAG 挑战赛中取得了顶尖表现。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下你是一名试图破解谜团的侦探,但你拿到的不是单一的犯罪现场,而是一个包含数百万本书籍的图书馆,每本书都充满了成千上万页微小且令人困惑的文字和复杂的图表。这正是金融分析师在阅读诸如 10-K 文件(公司向政府提交的巨型报告)以寻找特定数字或事实时的日常现实。在人工智能的世界里,有一种叫做 RAG(检索增强生成)的工具,它就像一位超级聪明的图书管理员。它不仅阅读书籍,还会搜索它们以找到你需要的精确页面,然后仅根据它所找到的内容编写摘要。然而,标准的图书管理员往往会被这些庞大的金融图书馆规模所压垮,或者被文字与数字的混合体搞混,或者在文档过长时编造事实。这篇论文探讨了如何构建一个既快速、准确,又不会在任务规模巨大时迷失细节的图书管理员。
本文的作者 Joohyun Lee 和 Sungwoo Hong 提出了一种名为**层级重排序器(Hierarchical Reranker)**的新系统。你可以将这个系统想象成一个两步走的侦探团队招聘过程。与其雇佣一名庞大、昂贵且缓慢的侦探去阅读一本 10 万页书中的每一页,这个系统采用了“小而大”的团队策略。首先,一名快速、轻量级的侦探(一个小型的 AI 模型)快速扫描整个图书馆,并剔除那些明显无关的页面,将选件范围缩小到最有可能的 100 页。然后,一名高技能、专家级的侦探(一个大型、强大的 AI 模型)对这 100 页进行深入、仔细的观察,以选出真正回答问题的最终前 20 页。这种方法节省了时间和金钱,因为昂贵的专家只在最有希望的候选对象上进行繁重的工作,而不是在整个图书馆中浪费精力。
但找到正确的页面仅仅是成功的一半。论文还介绍了一种在侦探开始寻找之前处理文档的巧妙方法。金融文档是杂乱无章的;它们使用诸如“YoY”(同比)或“EPS”(每股收益)之类的缩写,并将段落文字与巨大的数字表格混合在一起。系统的第一步是“清洗”查询和文档。它将这些令人困惑的缩写转换为完整的单词,标准化单位(使“1M”和“1,000,000”看起来一致),并且至关重要的是,将这些杂乱的表格转换为一种称为 JSON 的结构化格式。这就像是将一份手写的电子表格转换为数字数据库,这样 AI 就不会对哪个数字属于哪个类别感到困惑。通过这种“预清洗”,系统确保了 AI 在开始搜索之前能完美理解问题和证据。
作者使用的第三个主要技巧是处理那些由于过长而无法一次性放入 AI 内存中的文档的策略。尽管现代 AI 模型声称可以阅读海量文本,但论文发现,当文本超过一定界限(具体为 64,000 个 token,即文本长度的度量单位)时,AI 会开始出错,尤其是在处理数字方面。为了解决这个问题,该系统表现得像一位准备盛大宴会的厨师。它不是试图一次吃掉整顿饭,而是将长文档切成两个较小的、易于处理的块。它要求 AI 分析第一个块并写出一份草案,然后分析第二个块并写出另一个草案。最后,一个“融合”步骤将这两个草案合并为一个最终答案,同时检查它们是否一致并解决任何冲突。这确保了即使面对一份 10 万页的巨型报告,AI 也不会丢失事实。
当研究人员在几个著名的金融基准测试(如 FinQA 和 FinanceBench)上测试他们的系统时,结果令人印象深刻。该系统在名为 NDCG@20 的指标上获得了 0.7918 的得分,该指标衡量系统将正确信息排在列表顶部的能力。这个得分显著优于那些未使用其特殊清洗和两步排序方法的系统。事实上,这种方法非常有效,帮助该团队在 ACM-ICAIF '24 FinanceRAG 挑战赛中获得了第二名,这是一项旨在测试 AI 如何处理金融数据的竞赛。论文指出,通过结合这三项创新——清洗数据、使用两步侦探团队以及智能地切割长文档——金融机构现在可以构建出不仅聪明而且足够可靠的 AI 系统,用于审计和投资分析等现实世界任务,而不会出现 AI 编造事实或在噪音中迷失的情况。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。