← 最新论文
💬 NLP

Figurative Justice: Detecting metaphors in Hindi judgements with qualitative assessment and transformers

本文介绍了印地语法律隐喻语料库(HiLeMe)以及一种基于 Transformer 的检测模型,旨在解决低资源印地语法律文本中缺乏隐喻分析的问题,以解码司法决策过程,并将自动化的法律话语工具扩展到其他印度语言。

原作者: Bhumika Bhattacharyya, Shouvik Kumar Guha, Indranil Dutta

发布于 2026-08-25
📖 1 分钟阅读☕ 轻松阅读

原作者: Bhumika Bhattacharyya, Shouvik Kumar Guha, Indranil Dutta

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

法庭上的语言很少仅仅是列举事实的中性工具。虽然法律常被想象为一套用平实墨水书写的僵化规则,但编写和解释法律的人——法官、律师和立法者——经常依赖比喻性语言来理解抽象概念。他们谈论分隔政教的“墙”、平衡正义的“秤”或合同的“根”。这些不仅仅是装饰性的修饰;它们是塑造法律概念如何被理解、辩论和裁决的强大认知工具。当法官将一种情况描述为“战争”,或将一项权利描述为“物体”时,他们不仅仅是在使用华丽的辞藻;他们是在构建案件的现实框架,这可能会影响惩罚的严厉程度或对人权的解释。这在印地语等语言中尤为关键,因为这类语言中隐喻的细微差别可能会改变整个法律论证的含义,然而直到现在,还没有人能建立一种方法让计算机自动识别印度法院文件中的这些隐喻。

来自爱沙尼亚和印度的研究团队迈出了解决这一问题的第一步,他们创建了一个专门的数据集和一个旨在发现印地语法律判决中隐喻的计算机模型。他们的工作题为“比喻的正义”(Figurative Justice),解决了人工智能领域的一个重大空白。虽然计算机在阅读和理解英语、西班牙语和其他主要语言方面已经变得非常出色,但在处理像印地语这样的“低资源”语言时,尤其是在这些语言被用于复杂且高风险的法律环境时,它们仍显得力不从心。研究人员首先从印度北方邦真实的地区法院判决书中收集了数千个句子。这些文件完全以印地语编写,包含了法律推理的原始素材。为了理解这些文本,团队聘请了六位法律专家担任计算机的人类教师。这些专家阅读句子,并根据一套严格的、既定的识别隐喻的方法,标记出每一个单词以比喻意义而非字面意义使用的实例。这一过程产生了一个新的数据集,研究人员将其命名为“印地语法律隐喻语料库”(Hindi Legal Metaphor Corpus),其中包含超过 7,000 个句子和近 162,000 个单词。

凭借这些精心标注的数据,研究人员训练了一个复杂的计算机模型来识别字面语言与比喻性语言之间的区别。他们使用了一种被称为“Transformer”的人工智能类型,这是一种能够理解句子中单词上下文关系的系统。该模型被输入印地语句子,并被教导去预测文本的特定部分是否包含隐喻。结果显示,计算机区分字面语言和比喻性语言的总准确率约为 72%。这是一个令人鼓舞的开端,证明了教会机器识别印地语法律文本中隐藏意义的可能性。然而,这项研究也揭示了任务的难度。当模型专门寻找隐喻时,它在做出判断时的正确率约为一半,并且漏掉了文中超过三分之二的实际隐喻。这表明,虽然计算机可以识别明显的例子,但它在面对那些经常出现在法律论证中、微妙、细腻且高度依赖语境的隐喻时仍然感到吃力。

研究人员发现,挑战部分在于法律语言本身的性质,即隐喻往往深植于论证结构之中,而非作为显而易见的比较而存在。在分析模型犯错的情况时,他们发现计算机有时会将标准的法律术语与隐喻混淆,有时则因为语境过于复杂而未能识别出隐喻。这项研究并不声称已经解决了检测印地语法律中隐喻的问题,而是建立了第一份可靠的领域地图。通过创建这个数据集并证明计算机模型可以达到一定的成功水平,该团队为未来的工作奠定了基础。他们的发现表明,要真正理解印地语的司法判决,并确保法官使用的比喻性语言不会无意中导致偏见,我们需要能够“读懂字里行间”的工具。这项研究为将类似技术应用于印度的其他二十一种法定语言打开了大门,旨在使法律隐喻的隐藏力量变得可见,并接受批判性的审查。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →