PROSLEX: A Novel Dataset for Expert-Annotated Legal Statute Prediction for Indian Judiciary
本文介绍了 PROSLEX,这是一个包含 1,623 份经专家标注的印度法律文件及其对应的 7,450 条详细解释的新型数据集,旨在通过评估各种大语言模型提示策略在准确性和法律推理连贯性方面的表现,来推进可解释的法律条文预测。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你是一名试图破解谜题的侦探,但你寻找的不是指纹,而是适用于某个故事的具体法律。在法律的世界里,尤其是在像印度这样的地方,每一桩犯罪或纠纷都与一套特定的书面规则——被称为“成文法”的东西——紧密相连。把这些成文法想象成一本关于一场巨大且复杂游戏的规则手册。如果有人违反了规则,你必须找到规则手册中描述其错误的那一页。这被称为“成文法预测”。多年来,计算机在阅读这些故事并猜测正确规则手册页面的能力上一直在不断提高,有点像一个超级快速的图书管理员。但问题在于:仅仅猜对那一页是不够的。在真实的法庭上,法官或律师需要知道为什么该规则适用。他们需要的是推理过程,即那个“因为”,而不仅仅是“是什么”。这就像一个 GPS,它告诉你向左转,却拒绝解释是因为前面有一个巨大的坑洼。这篇论文深入探讨了这个缺失的部分,提出了这样一个问题:我们能否教会计算机不仅去猜测法律,还能以人类能够理解的方式解释其逻辑?
这项研究背后的研究人员(由来自印度大学的一个团队领导)意识到,虽然计算机在猜测方面做得很好,但在解释“为什么”它们会那样猜测方面却表现得很差。为了解决这个问题,他们构建了一个名为 PROSLEX 的系统。把 PROSLEX 想象成一个规模宏大、组织极其严密的计算机大脑训练营。他们从印度最高法院提取了 1,623 个真实的法律案例,并让真正的法律专家(人类教练)对这些案例进行处理。这些专家不仅为案例贴上了标签,还标出了故事中证明哪项法律适用的确切句子,并写下了背后的推理过程。总计,他们创建了 7,450 个详细的解释。这就像一位大师级厨师不仅向你展示一个做好的蛋糕,还注释了食谱中的每一个步骤,并解释了为什么需要精确地以 350 度进行烘焙。
有了这个全新的“训练营”后,团队对几种不同类型的计算机大脑进行了测试。他们要求这些计算机阅读一个法律故事,并完成两件事:猜出正确的法律,并为他们的猜测写下解释。他们尝试了不同的教学方法,比如先给计算机看几个例子(少样本学习/few-shot)、要求它进行逐步思考(思维链/Chain-of-Thought),甚至要求它探索多条推理路径,就像树枝一样向外延伸(思维树/Tree-of-Thoughts)。
以下是他们的发现。首先,那些专门针对法律文本进行过训练的计算机(如 InLegal-BERT)在单纯猜测正确法律方面表现最好,准确率达到了 82% 左右。然而,当涉及到编写“解释”时,那些大型通用 AI 模型(如 GPT-4)开始脱颖而出。当这些模型被要求进行逐步思考时,它们在预测法律以及编写听起来像真实律师的理由方面变得更加出色。事实上,GPT-4 是表现最好的,在专家评分的解释质量上得分最高。
但论文也发现了其中的难点。当计算机尝试使用“思维树”(向许多不同的想法分支)方法时,它们在猜测正确法律方面的表现反而变差了。看起来,同时尝试探索太多路径会让它们感到困惑。此外,研究人员还发现了一个隐蔽的问题:有时计算机猜对了法律,却给出了完全错误的理由。这就像一个学生在数学考试中得到了正确答案,但解题过程却是错的。论文表明,即使计算机找对了“成文法”,其推理过程也可能出错,这强调了我们不能在不检查其逻辑的情况下盲目信任计算机的答案。
最终,作者们建议,虽然我们正在接近目标,但尚未到达终点。最好的结果来自于将计算机的速度与类人推理步骤相结合,但该系统仍然需要人类专家来复核工作。这篇论文并不声称已经永久解决了法律 AI 的谜题;相反,它提供了一份高质量的新地图(PROSLEX 数据集),其他研究人员可以利用它来构建更好、更具解释性的法律工具。这是向前迈出的重要一步,证明了如果我们给计算机提供正确类型的训练数据——包含完整的专家解释——它们就能开始理解不仅是游戏规则,还有规则背后的精神。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。