← 最新论文
💬 NLP

By Their Fruits You Will Know Them: Comparing Formalizations of Law by the Decisions They Encode

本文提出了一种通过枚举并阐述法律形式化表述存在分歧的边界案例来系统比较这些表述的方法,结果表明结构相似性并不能保证行为一致性,且大语言模型生成的形式化表述可能产生具有法律意义的显著分歧。

原作者: Julius Vernie, Matthias Grabmair

发布于 2026-05-26
📖 1 分钟阅读☕ 轻松阅读

原作者: Julius Vernie, Matthias Grabmair

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你有一份用略显模糊的语言写成的、极其复杂的法律规则食谱。你请了九位不同的专家厨师(即人工智能模型)将这份食谱翻译成一份严格、循序渐进、可供机器人执行的流程图。

问题在于:即使这些厨师使用相同的食材,并按相似的顺序写下步骤,他们也可能对少数关键指令产生隐秘的不同解读。一位厨师可能认为“加盐”意味着“一小撮”,而另一位则认为意味着“一杯”。如果你只是将他们的流程图并排查看,它们可能看起来有 90% 是相同的。但是,如果你向机器人提供一组特定且棘手的食材组合,一位厨师的机器人可能会说“端上这道菜”,而另一位则会说“把这道菜扔掉”。

本文介绍了一种新方法,旨在在任何人受到伤害之前发现这些隐藏的分歧。

核心问题:“凭他们的果子,就可以认出他们”

标题源自一句古语:你不能仅凭树的外观来判断它,你必须品尝它的果实。在人工智能与法律的世界里,“树”是形式化的规则(即流程图),而“果实”则是该规则在具体案例中所做出的决定。

作者认为,仅仅比较两个由人工智能生成的法律规则的结构是不够的。两条规则在纸面上可能看起来几乎完全相同,但在现实场景中却会产生截然相反的结果。他们希望找到一种系统性的方法,来发现“边缘案例”——即当对同一法律的不同人工智能解释发生冲突时,那些怪异且具体的情境。

方法:三步侦探流程

研究人员构建了一个用于捕捉这些分歧的流程,他们称之为“凭他们的果子”。以下是其工作原理,使用一个简单的类比:

1. 翻译(形式化)
首先,他们选取了 10 部不同的欧盟法律(如《通用数据保护条例》或《人工智能法案》),并要求 9 个不同的一流人工智能模型将每部法律转化为“决策树”。这就像请九位不同的建筑师根据一段模糊的描述,为同一栋房子绘制蓝图。

2. 制图(匹配)
接下来,他们必须比较这些蓝图。但建筑师们为相同的房间使用了不同的标签。一位称之为“厨房”,另一位称之为“烹饪区”。研究人员利用人工智能充当翻译,将不同树中代表相同法律概念的节点(即步骤)进行匹配。他们构建了一张“共享地图”,标示出这些树的重叠之处。

3. 压力测试(SAT 求解器与边缘案例)
这是神奇的部分。一旦拥有了共享地图,他们就使用一种数学工具(SAT 求解器)充当压力测试工程师。他们问道:“什么样的绝对最小、最怪异的事实组合,会导致这两份蓝图给出不同的答案?”

该工具找到了这些“边缘案例”——即规则产生分歧的具体事实组合。例如,它可能会发现,只有当机器人被警方使用,且数据是合法收集的,但并非用于特定医疗目的时,规则才会产生分歧。

4. 故事化(语言化)
最后,原始的数学结果(看起来像是一系列“真/假”变量)既枯燥又难以让人理解。因此,他们利用另一款人工智能将这些数学问题转化为简短、逼真的故事。

  • 不再是: “输入 A=真,输入 B=假,输入 C=真。”
  • 而是得到: “一家公司向警方出售面部识别系统以识别种族。数据是合法收集的,但该系统并未用于筛选。”

他们的发现

当他们在 10 部欧盟法律和 9 个人工智能模型上运行这项实验时,发现了一些令人惊讶的结果:

  • 表象具有欺骗性: 规则在结构上的相似程度与其在结果上产生分歧的频率之间,几乎没有任何关联。两个模型可能拥有 95% 匹配的结构,但在 50% 的边缘案例上仍然存在分歧。
  • 真实的法律戏剧: “果实”(即边缘案例)揭示了在法律应如何解释方面存在的真实且根深蒂固的分歧。
    • 示例: 关于用于警务工作并按种族对人们进行分类的人工智能,人工智能模型的意见平分秋色。一半认为这是严格禁止的;另一半则认为,如果数据是合法收集的,则是允许的。这并非计算机错误,而是反映了人类法律专家之间关于法律实际含义的持续争论。
  • 隐藏的错误: 该方法还捕捉到了明显的错误。一个人工智能模型意外地添加了一条额外的规则,使得某项法律条件的满足难度远高于法律本意。“果实”(即边缘案例)立即暴露了这一错误。

结论

该论文得出结论:要真正理解人工智能是否正确解释了法律,你不能仅仅查看其代码或流程图。你必须针对具体且棘手的场景对其进行测试。

他们的方法就像一盏聚光灯,照亮了不同人工智能对法律的解释发生碰撞的确切时刻。它将抽象的数学差异转化为具体的人类律师可以阅读、理解并辩论的故事。它并不能告诉你哪个人工智能是“正确”的(那是人类专家的工作),但它确保你确切地知道它们在哪里以及为什么存在分歧。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →