← 最新论文
💻 computer science

Time as Structure: Temporal Dependency Graphs for Verifiable Deadline Computation over Legal Documents

本文提出了一种混合方法,将法律文档中的时间依赖性提取到图中,用于基于代码的截止日期计算,并证明该流水线在准确性和可验证性方面显著优于直接的语言模型回答,特别是通过避免算术错误,同时强调提取仍然是失败的主要来源。

原作者: Maryia Zhyrko, Lifeng Han, Suzan Verberne

发布于 2026-08-18
📖 1 分钟阅读☕ 轻松阅读

原作者: Maryia Zhyrko, Lifeng Han, Suzan Verberne

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在法律世界中,时间不仅仅是一个背景;它是一个决定索赔命运的结构性要素。法律文件通常必须在特定截止日期前提交,而该日期是根据某个起始事件(如终止雇佣关系或歧视事件)计算得出的。这些计算很少是简单的算术。它们涉及根据严格的法定规则计算天数,考虑时钟停止以进行强制调解的暂停期,并针对日历的特性进行调整,例如不同长度的月份或闰年。如果一项索赔即便只晚了一天提交,也往往会被永久剥夺追诉权,无论案件本身多么有力。这创造了一个高风险的环境,其中成功与失败的区别是以小时来衡司量的,然而包含必要日期的文件却往往埋藏在复杂的、嵌套的法律术语之中。

莱顿大学的研究人员致力于解决一个关于计算机应如何处理这一问题的基本问题。他们询问:是否应该信任大型语言模型(一种可以阅读和总结文本的人工智能类型)直接计算这些截止日期?或者,让计算机先从文本中提取出特定的日期及其关系,构建一个结构化的事实图谱,然后再使用一个独立的、僵化的计算器来进行数学运算,是否会更安全?该团队构建了一个将时间视为连接事实网络的系统,其中每个日期都是一个节点,而连接它们的规则则是边。他们使用真实的英国就业法庭判决书以及一组设计好的、已知正确答案的大规模模拟案例,将这种方法与原始的直接回答法进行了对比测试。

研究表明,虽然现代语言模型在阅读法律文本方面表现得相当出色,但在被要求执行法律截止日期所需的精确算术时,它们却表现得非常吃力。当研究人员要求一个强大的语言模型阅读一个案例并一次性输出一个截止日期时,即使模型的内部推理步骤是正确的,它也经常得出错误的最终结论。在一个引人注目的发现中,模型有时会计算出正确的总天数,但随后又在最后一句中自相矛盾,宣布一项逾期的索赔是及时的。在对测试的最强模型进行的 21 次尝试中,这种情况发生了 6 次。错误不在于数学本身,而在于模型无法使其最终结论与其刚刚完成的工作保持一致。

为了测试另一种方法,研究人员构建了一个流水线:首先将相关的日期及其依赖关系提取到一个图中(一种计算机可以观察一个日期如何导致另一个日期的视觉化结构),然后由一个独立的、确定性的引擎将严格的法律规则应用于该图。这个引擎并不进行猜测;它遵循一套固定的指令来计算月份、处理闰年以及应用强制性的调解暂停期。当这个结构化系统在相同的真实案例上进行测试时,它完美地还原了法官给出的日期,并在 7 个案例中的 6 个案例中匹配了法庭的裁决。该系统的可靠性极高,以至于当它无法在文本中找到明确的起点时,它只会拒绝回答并解释原因,而不是进行猜测。

研究人员随后通过创建 427 个新案例进一步推进了测试。他们采用了真实的判决书,并有系统地将起始日期移动了几天,从而跨越了使索赔性质从“及时”变为“逾期”的精确界限。这创造了一个正确答案具有绝对确定性的场景,因为该答案是由引擎本身计算出来的,而非由人工标注。在这项严苛的测试中,结构化流水线在尝试处理的案例中正确率达到了 90.2%,而直接使用语言模型的正确率仅为 61.2%。该结构化系统的优势在于其处理依赖链的能力;随着事件链条的增长,直接模型会变得越来越困惑,而基于图表的系统则能保持精确。

然而,研究也指出了这种新方法的局限所在。结构化系统的错误几乎从未出现在算术或截止日期的计算上。相反,失败发生在第一步:选择文本中哪个事件是正确的起始点。在复杂的法律文件中,多个事件可能看起来都像是潜在的起点,而系统有时会选错对象。这是一个理解法律语境的问题,而非进行数学计算的问题。研究人员发现,即使是最好的语言模型,在被要求提取这些事实时,也经常无法将正确的事件与正确的规则联系起来,这表明这项任务中最难的部分不是计算,而是对哪些事实具有重要意义的初步解读。

最终,这篇论文证明了对于需要严格遵守规则和精确计算的任务,混合方法效果最好。通过将阅读文本与执行数学运算分离,系统获得了一层纯语言模型所缺乏的可靠性。语言模型充当“翻译官”,将混乱的法律术语转化为清晰的一组事实;而引擎则充当“法官”,不带犹豫或矛盾地应用法律。这种分工协作使得系统能够承认自己的不确定性,并为自己的迟疑提供明确的理由,而不是给出一个自信但错误的答案。研究结果表明,对于法律截止日期这种单日之差便能改变一切的任务,最有效的工具不是一个试图包揽一切的模型,而是一个能够将问题拆解、检查自身工作并知道何时停止并寻求帮助的系统。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →