Investigating Multi-Agent Deliberation in Law
本文研究了受法律程序启发的用于人工智能驱动法律推理的多智能体审议框架,证明了虽然这些框架取得了与基准大语言模型相当的性能,但它们在解决复杂案件和处理多视角批判性思维方面具有独特的优势。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下你正在试图解决一个非常棘手的法律谜题。在过去那种处理 AI 问题的方式中,你会要求一个非常聪明的机器人(一个“单体式”模型)来看待问题并给出一个答案。这就像是让一个人独自去解开一个谜团。他们可能很聪明,但也可能产生隧道视野(目光短浅)、遗漏线索,或者仅仅是固执己见。
这篇论文提出了一个简单的问题:如果不是由一个机器人,而是一整个机器人团队在给出答案之前先进行交流,情况会怎样?
来自格罗宁根大学和雅盖隆大学的研究人员通过使用“多智能体审议”(Multi-Agent Deliberation, MAD)测试了这个想法。他们想看看,让一组 AI 智能体进行争论、辩论和相互批判,是否会比单个 AI 独立工作带来更好的法律决策。
三种新的“团队”策略
研究人员并没有让机器人随机聊天。他们构建了三种特定的协作方式,其灵感源自现实世界中的人类互动:
“法庭”团队(3-Ply 框架):
这就像是一个微型审判。他们设置了三个智能体:- 原告: 一个唯一的任务是论证“是的,答案是肯定的”的智能体。
- 被告: 一个唯一的任务是论证“不,答案是否定的”的智能体。
- 法官: 一个中立的智能体,负责倾听双方的陈述并做出最终裁决。
- 类比: 这就像是一个辩论俱乐部,两个人为相反的立场进行战斗,而一名裁判决定谁的观点更胜一筹。
“鹦鹉”团队(Parrots 框架):
这个框架基于这样一个观点:AI 不应该仅仅是一个“随机鹦鹉”(只会盲目重复内容的鸟)。相反,他们创建了一个名为“Alex”的主智能体,它与四个具有特定性格的“鹦鹉”进行交谈:- 苏格拉底式鹦鹉: 提出尖锐的问题,例如:“你对那个定义确定吗?”
- 愤世嫉俗的鹦鹉: 试图拆解论点,寻找其中的缺陷和弱点。
- 杂糅式的鹦鹉: 提供你可能从未想过的各种奇特、替代性的想法。
- 亚里士多德式鹦鹉: 检查逻辑,确保推理过程确实站得住脚。
- 类比: 想象你在写一篇论文,有四个朋友在阅读你的草稿。一个质疑你的事实,一个攻击你的逻辑,一个建议新的角度,还有一个检查你的语法。然后你根据他们的反馈来重写你的论文。
标准的“群体思维”团队(MAD 框架):
这是一个更通用的方法,其中三个智能体只是互相交谈、阅读彼此的答案,并通过几轮讨论尝试达成共识,找到最佳答案。
他们的发现是什么?
研究人员在五组不同的问题集上测试了这些团队:其中四组关于法律(如税务规则、隐私政策和律师资格考试题目),一组关于纯逻辑。
以下是用通俗易懂的语言总结出的“底线”:
- 没有万能灵药: 出人意料的是,“团队”方法并没有比单个机器人获得更高的总分。如果你只看最终成绩,单个机器人和团队的表现大致相当。
- 不同的错误: 然而,团队犯下的错误与单个机器人不同。有时单个机器人答对了,而团队答错了;有时单个机器人感到困惑,但团队却搞清楚了。
- “无法解决”的案例: 最有趣的发现是,团队方法可以解决一些单个机器人完全无法回答的特定案例。这就像是团队拥有一个“安全网”,捕捉到了单个机器人错过的难题。
- 更好的解释: 当团队答对时,他们的推理通常更加细致入微。例如,在一次关于隐私政策的测试中,单个机器人因为字面意思的解读而感到困惑。然而,“法庭”和“鹦鹉”团队能够论证该文本暗示了更广泛的含义,从而导向正确的法律解释。
代价(成本 vs. 收益)
这里存在一个权衡。要求一个机器人思考需要一个“步骤”(一次计算机调用)。要求一个团队进行争论则需要许多步骤。
- “法庭”团队需要 4 个步骤。
- “标准团队”需要 9 个步骤。
- “鹦鹉”团队根据交谈时长,在 3 到 7 个步骤之间波动。
论文的结论是,虽然这些团队不一定能获得更高的分数,但它们之所以有价值,是因为它们提供了不同的视角。它们更擅长处理那些需要权衡多方论点的复杂且模糊的情况。它们充当了“第二意见”,可以捕捉到单个 AI 可能错过的错误,即使运行这些团队需要消耗更多的计算能力。
简而言之,一个聪明的 AI 很好,但一群像律师和哲学家一样争论的 AI 有时能看到第一个 AI 所忽略的东西,即便它们并不总是能在速度上胜出。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。