Hyperparameter Analysis in Retrieval-Augmented Generation Systems Applied to the Public Prosecutor’s Office of the State of Espírito Santo Corpus
本研究采用实验设计方法,对专为圣埃斯皮里图图州检察官办公室定制的检索增强生成系统中的关键超参数(具体为分块策略、上下文容量和 LLM 选择)进行了分析与优化,并通过使用对齐秩变换(Aligned Rank Transform)进行的统计分析,揭示了这些因素对响应质量具有显著影响。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你有一个超级聪明的机器人朋友,它能写论文、讲笑话,还能回答你问的几乎任何问题。这个机器人就像一个读遍了整个互联网的才华横溢的学生。但问题在于:这个学生对事实的记忆力很糟糕。如果你问它关于某项特定法律的问题,它可能会自信满满地编造出一个听起来非常完美但完全虚假的规则。这被称为“幻觉”(hallucination),当你在法庭或医院等需要准确信息的地方时,这是一个大问题。
为了解决这个问题,科学家们发明了一个聪明的技巧,叫做检索增强生成(Retrieval-Augmented Generation,简称 RAG)。这就像是在考试前给你的机器人朋友一叠教科书。它不再靠自己的记忆去瞎猜,而是先在书中查找答案,然后仅根据它找到的内容来撰写回复。这就像是一个在写报告之前先检查证据文件的侦探。但这里有一个转折:你如何组织这些书非常重要。你是把页面撕成碎片?还是保留完整的章节?以及在机器人开始写作之前,你让它阅读多少页?如果你把这些设置搞错了,机器人可能会错过关键线索,或者被过多的噪音干扰。这正是来自巴西的一个研究团队决定解决的难题。
侦探的困境:调优机器
在巴西的圣埃斯皮里图州(Espírito Santo),检察官办公室(MPES)拥有一个庞大的法律文件库——数以千计的法律、规则和条例。多年来,寻找特定的规则一直是一场噩梦。公务员必须精确地知道要去哪里找,否则就会陷入困境。为了提供帮助,他们构建了一个名为 Fabi 的虚拟助手(以一位真实的、知识渊博的员工命名)。Fabi 使用了 RAG 技巧:她阅读法律库并为工作人员回答问题。
但 Fabi 并不完美。有时她会错过重要的细节;有时她的回答很模糊。由 Heitor Quartezani 及其团队领导的研究人员提出了一个简单的问题:什么样的设置能让 Fabi 成为最优秀的侦探? 他们并没有凭直觉猜测,而是将这个问题视为一场巨大的科学实验。他们测试了系统中四个不同“旋钮”的所有组合,以观察哪种组合能产生最准确、最诚实且最有帮助的答案。
以下是他们旋转的参数以及他们的发现:
1. “切割”策略(分块/Chunking)
想象你有一个冗长且复杂的法律故事。你该如何把它切分并交给机器人?
- 旧方法(递归式/Recursive): 将故事切成固定大小的块,比如像把一条面包切成 500 个字符的小段。这很简单,但你可能会把一个句子切断,从而丢失意义。
- 聪明的方法(语义式/Semantic): 只有当话题发生变化时才进行切割。如果法律从“假期规则”转向“加班费”,那才是切割的地方。这样可以保持思想的完整性。
研究发现: 研究人员发现,“聪明的方法”(语义切割)是明显的赢家。具体来说,基于话题变化的第 95 百分位数进行切割(意味着只有当话题发生显著变化时才切割)能最大限度地保持信息的完整。那种将内容切成 500 个字符小碎片的“旧方法”表现很差;它破坏了法律逻辑,使机器人无法找到正确的答案。在法律工作中,错过哪怕一个细节都可能是灾难性的,因此保持故事的完整性是最重要的因素。
2. 搜索方法(检索/Retrieval)
Fabi 如何在图书馆中找到正确的页面?
- 向量搜索(Vector Search): 这就像是在问机器人:“帮我找一些感觉像这个问题的东西。”它擅长理解含义,但可能会错过精确的词汇。
- 词法搜索(Lexical Search): 这就像传统的图书馆卡片目录。它寻找精确的单词匹配。它擅长处理特定术语,但在理解语境方面表现较差。
- 混合搜索(Hybrid Search): 这是两者的结合之美。它使用一种特殊的数学技巧(称为倒数排名融合/Reciprocal Rank Fusion)来结合“感觉”搜索和“精确单词”搜索。
研究发现: 混合搜索成为了冠军。通过结合这两种方法,即使用户以奇怪的方式提问或使用了非常具体的法律术语,Fabi 也能找到正确的文档。单纯靠“感觉”搜索是不够的,而单纯靠“精确单词”搜索又过于僵化。两者结合,使系统变得更加可靠。
3. 阅读多少内容(Top-K)
当 Fabi 找到最好的文档后,她在回答之前应该阅读多少内容?是读 5 页?还是 20 页?
- 研究发现: 她读得越多,表现就越好——至少在一定范围内是这样。阅读 20 份文档 得到了最好的结果。事实证明,给机器人一个更大的“网”来捕捉信息有助于它找到正确的线索,即使其中一些额外的页面带有噪音。然而,研究人员注意到,在 15 份文档之后,最终答案质量的提升在统计学上不再具有显著性。因此,虽然阅读 20 份文档效果略好,但会消耗更多的计算资源。他们建议,未来系统可以使用更智能的过滤器,在阅读更少页面的同时,依然获得同样出色的结果。
4. 大脑能力(LLM 选择)
最后,他们为 Fabi 测试了两个不同的“大脑”:庞大且超级聪明的 gpt-4o 以及更小、更快的 gpt-4o-mini。
- 惊喜之处: 你可能会认为,更大、更昂贵的大脑会胜出。但实际上,较小的 gpt-4o-mini 表现得同样出色,有时甚至更好!
- 原因: 那个巨大的大脑太聪明了,以至于有时会试图表现得“过度有创意”。当机器人阅读 20 份文档时,大一点的大脑会开始混合各种想法或过度解读文本,从而导致微小的错误。而较小的脑子则更加“听话”。它严格遵守所提供的文本,只提取事实而不添加自己的“色彩”。对于一个需要精准的法律助手来说,这种稍微“死板”一点的特性实际上是一种超能力。
最终结论
研究人员并非仅仅在猜测;他们运行了 3,840 次不同的实验(即针对 40 个不同的问题测试了 96 种不同的设置),并使用先进的数学方法证明了他们的结果。
他们得出结论,要构建一个最好的法律助手:
- 按话题切割文档,而不是按固定大小。
- 使用混合搜索,结合含义与精确单词。
- 阅读大约 20 份文档,以确保不会遗漏任何信息。
- 使用较小、较便宜的 AI 模型(gpt-4o-mini),因为它能更严格地遵循指令,且犯错更少。
这项研究意义重大,因为它超越了“试一试看会发生什么”的阶段。它利用严谨的科学告诉我们,如何精确地调优这些强大的工具,使它们不仅听起来很聪明,而且真正做到聪明且可靠。对于检察官办公室来说,这意味着 Fabi 现在可以更快、更准确地帮助他们找到正确的法律,从而让法律系统运作得更好,造福每一个人。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。