← 最新论文
💻 computer science

Testing Frontier LLMs on Indian Statutory Interpretation: The Indian Construction Canon Benchmarking (ICCB) -Pilot Benchmark

本文介绍了用于评估前沿大语言模型在印度法律解释能力上的 ICCB-Pilot 基准测试,揭示了虽然模型通常能够预测正确的法律结果,但它们无法正确识别并应用底层的解释原则,这表明其推理依赖于表面模式匹配而非真正的法理理解。

原作者: Yashu Bansal, Gaurav Dahiya, Aditi Tiwari, Akshobhya N Saralaya, Dana Susan Kurian, Devyani Singh, Nidhi Singh K V

发布于 2026-09-22
📖 1 分钟阅读☕ 轻松阅读

原作者: Yashu Bansal, Gaurav Dahiya, Aditi Tiwari, Akshobhya N Saralaya, Dana Susan Kurian, Devyani Singh, Nidhi Singh K V

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在法律领域,阅读一项法令很少像查阅字典定义那样简单。当法官面对模糊或含混的法律时,他们并不仅仅是在猜测答案;他们遵循的是一套被称为“解释原则”(canons of construction)的特定思维工具。这些是指导文本应如何被理解的既定经验法则。例如,有一条规则可能会说,如果一项法律旨在惩罚某人,那么它应该被非常严格地、逐字逐句地解读。另一条规则可能会说,如果一项法律旨在帮助穷人,那么它应该被广泛解读,以涵盖尽可能多的人。这些工具的区别在于,让法官仅仅是回忆过去的案例,还是让法官真正对一个新问题进行推理。随着人工智能系统开始进入法庭和法律办公室,一个关键的问题出现了:这些机器是否真正理解如何使用这些工具,还是它们只是非常擅长根据以前见过的模式来猜测正确答案?

来自印度马尼帕尔高等教育学院(Manipal Academy of Higher Education)的一个研究小组致力于通过使用最新一代的人工智能模型来测试这个问题。他们创建了一个专门的测试,即他们称之为“基准测试”(benchmark),完全专注于这些机器如何解读印度法律。研究人员并没有要求计算机简单地预测案件的结果,而是要求它们解释自己的思考过程。该测试向模型展示了四十个源自真实印度法院判决的法律场景。在每个场景中,模型必须识别出应该使用哪种具体的解释规则,正确解释该规则,然后将其应用于事实以得出结论。研究人员从五个不同的维度对模型进行了评估:是否选择了正确的规则、是否根据印度法律传统准确描述了该规则、是否将其正确应用于事实、是否得出了正确的最终答案,以及整体推理过程是否清晰。

结果揭示了机器所能做到的与它们实现方式之间的显著差距。测试中最强大的人工智能模型在得出最终答案方面表现得惊人地好。在许多情况下,它们得出的结论与人类法官所达成的结论一致。然而,当研究人员观察它们是如何得出结论时,情况发生了变化。模型经常无法正确识别它们正在使用的特定法律规则。它们经常在不知道使用正确工具的情况下就得出了正确的结论,这表明它们是在将情境与熟悉的模式进行匹配,而不是遵循逻辑路径。这就像一名学生可以正确解出一道复杂的数学题,却无法解释使用了哪个公式或为什么这个公式有效。研究发现,当研究人员明确告知模型应使用哪种规则时,模型在命名该规则方面变得更好了,但它们解释或应用规则的能力并没有显著提高。这表明模型拥有这些法律规则的知识,但在没有直接提示的情况下,很难自主调用这些知识。

研究人员还观察到,模型根据问题的提问方式表现出不同的行为。当让它们独立解决问题时,模型往往会犹豫或拒绝回答,尤其是测试中的开源模型。然而,当研究人员给予关于规则类型的提示时,模型会更愿意参与其中。尽管在参与意愿方面有所提升,但核心问题依然存在:模型在“猜对结果”方面仍然比“构建正确的法律论证”更擅长。其中一个模型表现得尤为突出,它得出正确结果的频率始终高于正确识别法律原则的频率,但它在最终结论上仍会出现重大错误。这种正确答案与正确推理过程之间的脱节是一个重要的发现。这意味着,如果这些系统仅基于其预测结果的能力而被部署到真实的法律环境中,它们可能会出于错误的原因给出正确的答案,而在一个推理过程本身与结果同样重要的系统中,这可能是危险的。

研究得出结论,虽然这些人工智能系统是强大的工具,但它们尚未掌握法律解释所需的特定推理能力。它们似乎过度依赖模式识别,而非人类法官所使用的逐步应用法律规则的过程。研究人员强调,这并不意味着这项技术是无用的,但这也意味着我们不能仅仅因为它们能得到正确答案,就信任它们能像律师一样进行推理。这项研究作为一个试点,是一个旨在证明这种特定类型的评估是可行且必要的规模化测试。该团队计划在未来扩展这项工作,测试更多的模型和更多样化的法律,以观察这些模式是否在全局范围内成立。目前,研究结果提出了一个明确的警告:在复杂的法律世界中,得到正确答案是不够的;机器还必须能够展示其推导过程。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →