LexKairos: Benchmarking Legal Temporal Capabilities in LLMs
本文介绍了 LexKairos,这是一个旨在评估大语言模型在中文法律语境下,在法律条文知识、案例建模及推理方面的时序能力综合基准测试,研究结果表明,即使是性能顶尖的模型,在处理精确的时效性法律任务时仍然面临困难。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一个这样的世界:法律不仅仅是一座巨大的规则图书馆,而是一台活生生的、呼吸着的机器,只有在你于准确时刻转动正确的旋钮时才能运转。在这个世界里,一条法律今天可能是一个强大的工具,但昨天它可能是一个破碎的玩具,而明天它可能变成另一台完全不同的机器。这就是**法律时间能力(Legal Temporal Capabilities)**的领域。虽然计算机在阅读法律和理解其“含义”(即“是什么”)方面已经变得非常出色,但在理解这些规则何时适用(即“何时”)方面仍然面临困难。这就像一个知道所有街道名称,却会对每小时都在变化的交通灯和施工区域感到困惑的 GPS。如果计算机无法区分一条规则是现在生效还是去年已经过期,它就无法提供法律建议,否则会造成巨大的混乱。这就是为什么研究人员正在竞相教人工智能如何与法律保持完美的同步。
于是,由牛津大学、中山大学和清华大学的研究人员设计了一个名为 LexKairos 的全新“时空旅行测试”,旨在测试现代 AI 大脑处理中国法律体系中不断跳动的时钟的能力。他们不仅仅是让 AI 去猜测;他们构建了一个严苛的障碍赛道,包含九个不同的挑战,从关于法律何时开始生效的简单记忆测验,到复杂的谜题——AI 必须将法庭案件中的事实与规则手册中的严格截止日期结合起来。他们让八种不同的 AI 模型通过了这个试炼场,其中一些模型在回答前会进行沉默思考,而另一些则直接给出即时的猜测。
结果如何?这有点像是一场选手速度很快却总是在自己鞋带上绊倒的比赛,情况喜忧参半。表现最好的模型,如 Gemini-3-Flash 和 GPT-5.4,在允许使用“思考”模式时,分别取得了约 84.57% 和 82.75% 的成绩。这听起来令人印象深刻,但研究人员发现,即使是最聪明的模型,在被要求回忆关于某一天哪种版本的法律处于生效状态的具体细节时,也会表现得很糟糕。事实证明,虽然 AI 擅长理清故事中的事件顺序(例如在法庭案件中谁先做了什么),但在记住法律本身的精确“出生日期”和“失效日期”方面,它却出奇地糟糕。
其中一个最有趣的发现是这些 AI 模型是如何失败的。当被要求识别正确的法律版本时,模型的错误并非随机产生;它们的错误具有明显的“性格”。其中一个模型 GPT-5.4 就像一个害羞的学生,不敢轻易猜测,经常留下空白答案或完全遗漏版本标签(即“缺失标签”错误)。而另一个模型 LegalOne-8B 则像是一个过度自信的学生,会编造事实,虚构不存在的版本号(即“幻觉标签”错误)。当研究人员开启“思考模式”——让模型停下来推理问题时——那个害羞的模型开始更多地进行猜测(减少了缺失标签),但也开始制造更多的虚假版本;而那个过度自信的模型变得更加谨慎,但开始更多地出现缺失标签的情况。这就像是给它们更多思考时间并没有修复它们的记忆,而只是把一种错误类型转换成了另一种。
此外,这项研究表明,仅仅让 AI “大声思考”并不总是灵丹妙药。对于某些模型来说,思考过程过于漫长且曲折,以至于它们耗尽了空间而无法完成回答,在得出结论前就中断了。研究人员发现,通过给 AI 提供一个特定的、结构化的法律步骤清单(即“任务特定提示词”),我们可以获得同样好的结果,但答案的长度却能缩短至原来的 1/3.4。这表明,对于法律上的“时空旅行”,一次有引导的导览可能比让 AI 漫无目的地游荡效果更好。
最终,LexKairos 表明,尽管 AI 在法律推理方面正在进步,但法律中的“何时”部分仍然是一个顽固的挑战。即使是最优秀的模型,在涉及精确日期和程序性期限时,仍然容易出错。这篇论文并不是声称这个问题已经得到解决;相反,它强调了我们需要构建不仅要聪明,而且在时间上必须极其精准的 AI,因为在法律世界中,迟到一天可能意味着正义与败诉之间的差别。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。