Retrieval Augmented Generation Framework for the Nepali Legal Domain Question Answering
本研究引入了首个用于尼泊尔法律问答的检索增强生成框架,利用《尼泊尔法律杂志》(Nepal Kanun Patrika)档案实现了高精度和高真实性评分,从而解决了低资源法律领域的数据稀缺挑战。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下尼泊尔的法律系统就像一座宏大的古老图书馆。这座图书馆包含了成千上万份用尼泊尔语编写的法院判例(案例法)。然而,这里有两个大问题:
- 书籍很混乱: 它们是用过时的语言编写的,散落在各处,而且并没有被很好地数字化。
- 图书管理员是新手: 人工智能(AI)模型通常是用英文书籍进行训练的。当你询问有关尼泊尔法律的问题时,它们往往会感到困惑或胡编乱造,因为它们还没有“读”过足够的尼泊尔语法律文本来学习规则。
这篇论文介绍了一种修复此问题的新方法,使用的是一种称为 RAG(检索增强生成) 的系统。把 RAG 想象成不是一个试图背诵教科书的学生,而是一个聪明的研究助理,它被允许在开口说话前先在图书馆中查阅答案。
以下是研究人员如何构建并测试这位助手的:
1. 图书馆(数据)
团队前往了尼泊尔最高法院的官方数字档案馆(称为 Nepal Kanun Patrika)。他们抓取并清洗了 10,320 份法律文件。
- 挑战: 他们不能直接将这些庞大的文档喂给 AI。这就像试图通过阅读整本书来寻找其中特定的句子一样。
- 解决方案: 他们将文档切成了较小的“块”(就像把一个长篇故事切成短段落),以便 AI 能够更好地处理它们。
2. 搜索引擎(寻找正确的页面)
在 AI 回答问题之前,它需要找到图书馆中的正确页面。研究人员测试了两种不同的搜索方式:
方法 A:“关键词猎手”(BM25)
- 工作原理: 这就像一位传统的图书管理员,寻找精确的词汇。如果你问:“偷窃的处罚是什么?”,图书管理员会扫描“处罚”、“偷窃”和“法律”这些精确的词。
- 结果: 这种方法成为了冠军。在查找小片段时,它的正确率达到了 91%;在查找整篇文档时,正确率为 88%。它非常精准,因为法律语言通常是非常具体且具有重复性的。
方法 B:“语义匹配者”(稠密检索)
- 工作原理: 这就像一位理解问题“氛围”或“含义”的图书管理员,即使词汇不同也能理解。它利用先进的数学(嵌入/embeddings)来推测“偷窃”和“盗窃”是同一个意思。
- 结果: 这种方法不错,但对于这项特定工作来说并不出色。它只能找到正确文档的 75%。研究人员发现,对于尼泊尔法律,精确的词汇匹配比猜测含义效果更好,这可能是因为法律术语非常严谨。
速度陷阱:
“关键词猎手”(BM25)有一个代价。当他们为了提高准确性而将文档切成极小的片段时,搜索变得非常缓慢(就像是在搜索 110,000 张微小的索引卡片,而不是 10,000 本书)。为了保持系统足够快以投入使用,他们选择了“关键词猎手”的“整篇文档”版本。虽然准确度略低,但速度更快。
3. 答案撰写者(生成响应)
一旦系统找到了正确的文档,它就需要撰写答案。
- 规则: AI 被严格告知:“不要捏造事实。”
- 策略: 研究人员使用了两步走的过程。首先,AI 必须指出证明答案的文档中的确切句子。其次,它必须仅根据该句子来编写答案。如果找不到证据,它被要求说“我不知道”,而不是进行猜测。
4. 结果(它奏效了吗?)
团队用法律专家编写的 100 个问题测试了这个系统。以下是表现最好的版本(关键词猎手 + 整篇文档)的表现:
- 成功率: 它成功为 92% 的问题生成了答案。
- 真实性: 经过另一个 AI 和人类律师的检查,答案有 85% 是真实的(意味着它们没有捏造事实或幻觉)。
- 可靠性(Groundedness): 74% 的答案直接由图书馆中找到的文本所支持。
核心结论
这篇论文证明了,对于像尼泊尔这样资源匮乏的语言,你不需要一个记住了所有内容的超级聪明 AI。相反,你需要一个可靠的搜索工具来找到精确的法律文本,以及一个严格的 AI,在它面前没有文本时拒绝发言。
通过将简单的、快速的搜索方法(BM25)与细心的写作过程相结合,他们创建了第一个能够可靠回答尼泊尔法律问题且不捏造事实的系统。这是一个基础,最终可能帮助普通人在不需要法律学位的情况下了解自己的法律权利。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。