On Measuring Semantic Preservation in Legal Ontology Learning
本文提出并验证了一种新颖的评估框架,该框架通过比较大语言模型在源文档与结构化表示上的任务表现,量化了法律本体学习中的语义损失,从而揭示了语义保留程度会因特定的大语言模型与本体学习方法的组合而显著不同。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图教一个机器人理解一份复杂的法律合同。你有两个选择:你可以把原始的、混乱的人类编写文本喂给机器人,或者你可以将这些文本转化为一个超级有序、结构化的地图,称为“本体”(ontology)。把本体想象成一个巨大的、标签完美的分类档案柜,每一个概念都是一个抽屉,每一种关系都是一个清晰的标签。其核心思想是,这种结构化的地图应该能比直接处理混乱文本更好地帮助机器人进行推理。但问题在于,当你把一个充满汁水、富有细微差别的故事强行塞进一个僵硬的分类档案柜时,你可能会在无意中丢弃掉最关键的风味。这就是“语义损失”(semantic loss)的问题——在保留结构的同时丢失了意义。科学家们一直擅长检查档案柜是否构建正确(即抽屉的标签是否贴对),但他们一直缺乏一种好的方法来检查抽屉里的“内容物”是否依然足够“美味”,足以解决实际问题。这篇论文正是切入了这一空白,提出了一个简单但至关重要的问题:“将我们的文本转化为结构化地图,究竟是真正帮助了机器人,还是仅仅通过剥离细节让机器人变得更笨了?”
这篇论文的作者 Albert Sadowski 和 Jarosław A. Chudziak 决定使用一个非常特定且棘手的“游乐场”来测试这个想法:法律合并协议。这些是公司在收购另一家公司时签署的庞大且复杂的合同,其中充满了细则和微妙的法律条件。他们想看看将这些合同转化为本体是否能帮助大语言模型(LLM)——即我们今天使用的那些超智能 AI 聊天机器人——回答有关它们的问题。
为了实现这一目标,他们设计了一个巧妙的实验。首先,他们让六种不同的 AI 模型阅读原始的、混乱的合同,并回答 34 类不同的法律问题。这为他们提供了一个“基准”分数,代表了 AI 从原始文本中能理解信息的最大量。然后,他们将同样的合同通过三种不同的“本体学习”方法(LLMs4OL、NeOn-GPT 和 NeOn-CoT)转化为结构化地图。最后,他们要求同样的 AI 模型回答相同的问题,但这一次,它们只能查看结构化地图,而不能看原始文本。
结果令人震惊。研究发现,在几乎所有情况下,当 AI 模型必须使用结构化地图而非原始文本时,它们的表现都变差了。这就像是把一锅美味、复杂的炖菜,滤掉了所有的汤汁和香料,只剩下一份整齐的配料清单,然后要求一位厨师仅凭这份清单就还原出炖菜的味道。这种“语义损失”是真实存在且可衡测的。根据所使用的不同方法,AI 模型平均损失了 8.4 到 27.4 个百分点的准确率。其中,名为 LLMs4OL 的方法表现最差,导致信息流失最为严重,而 NeOn-GPT 则是“最不坏”的一个,保留了最多的意义。
然而,当你观察是谁在进行阅读时,故事变得更有趣了。论文发现,这种损失并非对所有人都是一样的;它在很大程度上取决于 AI 模型的“个性”以及用于构建地图的方法。例如,一个名为 Gemini 的模型在配合特定的 NeOn-CoT 方法时表现得惊人地好,在处理困难任务时保留了大约 86-88% 的原始意义。但如果将同样的方法与不同的模型配对,性能就会大幅下滑。这表明,不存在一种构建法律地图的“最佳”方式;相反,你必须找到 AI 大脑与制图工具之间的完美匹配。
作者还注意到,问题的类型也至关重要。如果问题很简单,比如“这是一个‘是’还是‘否’?”那么结构化地图的表现几乎完美,几乎没有信息损失。但如果问题需要理解微妙的法律细微差别——比如“极有可能”与“合理可能”之间的区别——结构化地图就会表现得一塌糊涂,往往会丢失高达 65% 的意义。本体这种僵硬的结构无法捕捉到律师赖以生存的概率中的微妙色彩。
最后,这篇论文并不是说我们应该停止使用本体。相反,它警告我们不要假设“结构化”自动意味着“更好”。作者建议,在我们信任一个结构化地图来辅助 AI 做出法律决策之前,我们需要先对其进行测试,看看它是否真的保留了我们所关注的意义。他们发现,对于复杂的法律推理,将文本转化为结构化地图的过程往往会剥离掉那些让答案变得正确的关键细节。因此,虽然本体在组织数据方面仍然有用,但我们需要小心,不要在整理过程中“把婴儿和洗澡水一起倒掉”,尤其是当那个“婴儿”是一个可能改变数十亿美元交易结果的微妙法律论点时。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。