Can LLMs Judge Legal Accuracy? Reliability of LLM Evaluators for High-Stakes Insurance QA in a Low-Resource Language
本文表明,尽管大语言模型可用于评估魁北克法语等低资源语言的法律准确性,但若缺乏人工监督,其可靠性不足以进行高风险部署,因为即使是最强大的模型也仅表现出中等程度的一致性,无法一致地捕捉到危险错误,并且能显著受益于逐步推理和集成方法。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在人工智能领域,出现了一种新工具来解决一个老问题:我们如何知道一台计算机是否在说实话?多年来,开发者一直依赖人类专家来阅读并评定这些智能机器生成的答案,但这个过程缓慢、昂贵且难以重复。为了提高速度,研究人员开始使用最智能的人工智能模型本身来充当裁判,对其他模型的表现进行评分。这种被称为“AI 评判”的方法因其快速且一致性高而变得流行。然而,我们对这些数字裁判的了解大多来自于针对英语进行的、关于写故事或回答常识性问题等通用主题的测试。我们尚未得知,当赌注很高、主题是复杂的法律、且语言是特定的地区方言时,这些裁判是否值得信任。
加拿大拉瓦尔大学的一个研究小组决定在他们能想象到的最具挑战性的环境中测试这些数字裁判。他们将重点放在魁北克省的汽车保险上,这里的规则是用一种独特的法语编写的,并受一套特定的法律体系管辖,该体系与加拿大其他地区及欧洲都不同。在这个体系中,车祸导致的身体伤害由一项公共的无过错计划处理,而财产损失则由私人保险公司处理。在解释这些规则时,哪怕是一个微小的错误,也可能误导公民了解其权利,或使公司面临法律风险。研究人员收集了 807 道用于认证保险专业人员的真实考试题目,以及正确答案和专家解释。随后,他们要求 52 个不同的人工智能模型充当裁判,检查针对这些问题的各种答案是正确还是错误。
结果令人清醒。即使是最强大、最先进的人工智能模型——那些被认为是世界上最好的模型——也无法被单独信任来评判这些法律答案。表现最好的模型也仅具有中等的可靠性,这意味着它仍然经常出错,以至于人类不会想盲目地依赖它。更重要的是,研究人员发现,一个模型的整体智能程度并不能预示其使用的安全性。一些非常聪明的模型表现得异常粗心,经常将错误的答案判定为正确。另一些模型则过于谨慎,仅仅为了保险起见就拒绝正确的答案。没有简单的方法可以根据模型的普遍声誉来挑选一个“好的”裁判;一个在综合质量上得分很高的模型,仍可能因为未能发现特定的、代价高昂的错误而变得危险。
研究还表明,这些数字裁判的行为会根据撰写答案者的身份而有所不同。在许多其他研究中,人工智能模型往往对其他机器编写的答案更加宽容,给出的分数通常高于人类编写的文本。但在这种严格的法律环境下,情况恰恰相反。这些裁判对人工智能编写的答案实际上比对人类编写的答案更为严苛。即使人类编写的干扰项明显错误,它们也不太可能接受机器生成的答案为正确。这表明这些模型的偏见并不是固定的;它会根据任务和给出的指令而改变。当被要求对法律保持精确时,模型变得更加严格,而不是更加宽容。
为了寻找前进的方向,研究人员测试了不同的策略,以使评判过程更加安全。他们发现,给裁判提供一份用于对比的参考文本会有所帮助,但仅对较弱的模型有效。最有效的解决方案是使用一个裁判小组而非单个裁判。通过让一小组最优秀的模型对一个答案进行投票,并要求它们在接受该答案为正确之前必须达成一致,研究人员大幅减少了危险错误的发生。这种“保守”的方法意味着,如果小组中的任何一个裁判发现了错误,该答案就会被拒绝。与仅使用单个表现最好的模型相比,这种方法将错误批准率降低了一半以上。
研究人员得出结论,对于高风险的法律问题,单个人工智能裁判不足以单独工作。机器批准错误法律答案的风险太大,不容忽视。相反,最好的方法是使用一小组智能模型进行初步筛选,但始终要有一位人类专家准备好对困难或高风险的案例做出最终决定。这创造了一个将人工智能的速度与人类监督的安全性相结合的系统。这项研究提出了一个警告:虽然这些工具功能强大,但它们并不是人类判断的完美替代品,尤其是在规则复杂且失误后果严重的领域。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。