想象一下,你正试图在一本厚达 300 页的规则手册(《安大略省住宅租赁法》)中寻找一条精确的规则,来回答一个特定的问题,比如:“房东在进入我的公寓前需要提前通知多久?”
目标不是写一篇优美的文章,而是要指向确切的页码和段落编号(引用),以便普通人可以自行查阅。
这篇论文是一次“口味测试”,旨在探索教计算机完成这项任务的最佳方式。研究人员设置了一场由四种策略参与的比赛,使用一种智能 AI 模型(数字大脑)来观察哪种策略能在不编造内容的情况下找到正确的规则。
以下是四位参赛选手表现如何:
四位参赛选手
“原始大脑”(基础模型):
- 类比: 这就像是一个非常聪明但只读过一遍规则手册的学生。他们试图凭记忆猜测页码。
- 结果: 他们完全失败了。他们找不到正确的页码,而且 81% 的情况下,他们会编造一个不存在的虚假页码。对于这项工作来说,他们太不可靠了。
“记忆者”(仅进行微调):
- 类比: 这是同一个学生,但他们花了数周时间练习“问题 → 页码”的闪卡。他们掌握了格式并试图记住答案。
- 结果: 他们不再编造虚假页面,但具体的数字仍然错误。他们记住了规则的“概念”,但弄混了精确的章节编号。这就像知道规则是关于“噪音”的,却把页码猜成了第 50 页而不是第 52 页。
“图书管理员”(仅检索):
- 类比: 这个学生不尝试背诵任何东西。相反,他们有一个动作极快的图书管理员为他们搜索书籍。学生只能使用图书管理员递给他们的页面来回答问题。
- 结果: 这是一个巨大的进步。因为学生被迫查看真实的文本,他们从不编造虚假的页码(0% 的幻觉)。然而,有时图书管理员会递给他们一叠 10 页的资料,学生会因为不知道哪一页才是“确切”的正确页面而感到困惑。
“超级团队”(混合型:记忆者 + 图书管理员):
- 类比: 这个团队既做了闪卡练习,又有图书管理员协助。练习让他们在图书管理员递给他们一叠杂乱页面时,能成为一个更好的评判者。
- 结果: 这个团队赢得了比赛。他们找到确切页码的频率比其他任何人都要高。即使在页面堆很厚的情况下,“练习”也帮助他们挑选出了正确的页面。
大惊喜
- 规模并不总是更好: 研究人员尝试使用一个“超级图书管理员”(更复杂、更昂贵的搜索工具)来帮助学生。结果发现并没有帮助。简单的、廉价的图书管理员表现得一样好。这意味着你不需要昂贵、沉重的机械设备就能解决这个问题。
- 更多的学习并无帮助: 他们尝试给“记忆者”更多的闪卡去学习。但这并没有让他们变得更好。瓶颈不在于学习多少,而在于他们首先需要图书管理员来找到文本。
- “零幻觉”技巧: “图书管理员”和“超级团队”之所以从不编造虚假规则,是因为设计如此。系统设有一个安全门:如果页码不在图书管理员持有的页面中,系统就会拒绝回答。这是一个硬性规则,而不是一种习得的技能。
最终计分板
“超级团队”(混合型)得到了最高分,但他们还没有赢得金牌。
- 目标: 研究人员希望达到 0.70 的分数(即 70% 的情况下得到正确答案)。
- 现实: 他们得到了 0.48(大约一半的时间是对的)。
为什么没有达到 100%?
- 图书管理员漏掉了书: 有时图书管理员根本找不到正确的页面(大约 11% 的时间)。如果正确的页面不在那一叠资料中,学生就无法挑选出来。
- “细节”问题: 学生经常找到了正确的“节”(章节),但错过了具体的“款”(段落)。这就像找到了正确的章节,却找错了段落。这被视为“半对”的答案。
- 测试样本过小: 最后的测试只有 27 个问题。这就像根据一场比赛来评判整个赛季的运动队表现。结果虽然令人鼓舞,但样本量太小,无法 100% 确定。
核心结论
如果你想让计算机指引人们找到法律:
- 不要仅仅要求它死记硬背法律(它会瞎猜)。
- 不要仅仅要求它阅读法律(它会被过多的文本搞混)。
- 务必结合一个经过格式化训练的模型和一个能为你搜索法律的工具。
这种方法最准确,它永远不会在位置上撒谎,并且在不需要昂贵、沉重技术的情况下也能运行良好。然而,它仍需努力才能从“良好”(48% 准确率)提升到“卓越”(70% 准确率)。
技术摘要:训练、检索,还是两者兼有?针对安大略省《住宅租赁法》准确法定引用的四臂对照研究
问题定义
本文旨在解决一项特定任务:引导自理租客、房东及服务台工作人员,使其能够准确找到《2006年安大略省住宅租赁法》(RTA)及其核心条例中的特定法定条款。其目标并非生成流畅的法律建议,而是针对自然语言问题提供精确的引用(包括法案、条文及款项)。研究的核心问题是经验性的:对于此项任务,监督式微调(SFT)是否足够,还是必须采用混合检索增强生成(RAG)方法?本研究旨在最大限度地减少幻觉(引用不存在的条款),同时实现精确匹配引用的准确率最大化。
研究方法
作者以 Qwen2.5-7B-Instruct 模型为基座,进行了四臂对照评估。由于目前不存在针对该司法管辖区的公开“问题-引用”数据集,研究采用了基于 RTA 和 O. Reg. 516/06 构建的自定义数据集。
数据构建:
- 训练数据: 通过对法定条款进行改写,生成了 2,148 个合成的“问题-引用”对。数据进行了分组处理(按条文/部分进行分组感知)以防止数据泄露,最终得到 1,473 个训练样本、345 个合成测试样本以及 330 个未见过的条文切片。
- 评估集: 从租客法律网站中挖掘出的 27 个真实世界问题集,这些问题明确引用了 RTA 条款。该集合目前处于“人工验证待定”状态。
- 语料库: 将 RTA 及其条例解析为 358 个条款,每个条款作为一个单一的、具备结构感知的 RAG 分块(chunk)。该清单同时也作为幻觉检查的确定性白名单。
实验臂:
- 基础模型(零样本): 未经微调或检索的指令微调模型。
- 仅 SFT(SFT-Only): 在合成对上进行 LoRA(秩为 32,α=64)监督式微调,不使用检索。
- 仅 RAG(RAG-Only): 提示基座模型仅从检索到的上下文中进行引用,使用混合 BM25 +
bge-small 检索器。通过“从上下文中引用”的护栏机制执行硬性的存在性检查。
- SFT+RAG 混合模式: 使用经过 LoRA 微调的模型,提示其从检索到的候选对象中选择正确的引用。
消融实验与变量:
- 检索深度 (k): 测试了 k=5 和 k=10 两种情况。
- 检索强度: 对比了廉价的
bge-small 混合方案与更重的流水线(使用 bge-large + 交叉编码器重排序器)。
- 训练规模: 测试了改进/更大的训练集(2,645 个配对)。
指标:
- 引用精确匹配(Exact-Match): 要求匹配工具、条文及款项。仅匹配条文的部分得分 0.5。
- 幻觉率: 通过与固定清单进行确定性检查;任何不在清单中的引用均视为幻觉。
- F1 值: 基于预测值与标准答案引用集的计算。
主要结果
研究报告了在 27 项真实评估集上的结果(单次运行点估计,由于 n 值较小,结果属于初步结论)。
- 基座模型: 完全失败(精确匹配率为 0.00),幻觉率为 81%。
- 仅 SFT: 学习了引用格式,但在特定条文编号上表现挣扎,精确匹配率为 0.148,并将幻觉率降低至 14.8%。它未能有效记忆精确的条文编号。
- 仅 RAG: 证明了其必要性。在 k=5 时实现了 0.44 的精确匹配,并通过构造性手段(由于存在性检查护栏)将幻觉率降至 0.00。
- SFT+RAG 混合模式: 在 k=10 时取得了最高的 0.481 精确匹配(F1 为 0.574)且幻觉率为 0.00。
- “SFT ×k”效应: 增加检索深度(k)会损害零样本 RAG 模型(从 k=5 时的 0.44 下降到 k=10 时的 0.37),这可能是由于干扰项导致的。相反,SFT 模型随着 k 的增加而提升(从 k=5 时的 0.333 提升到 k=10 时的 0.481),这表明 SFT 使模型在面对噪声更高、召回率更高的候选集时更具鲁棒性。
- 效率发现:
- 使用更重的
bge-large + 交叉编码器重排序器替换廉价的 bge-small 检索器并未提高性能(RAG-only 和混合模式得分均为 0.37)。
- 增加训练数据规模并未带来可衡量的收益(0.444 对比 0.481)。
意义与主张
本文针对法定引用的“训练 vs. 检索”辩论提供了客观且基于经验的回答:
- 检索是必不可少的: 单纯的微调不足以实现准确的法定引用;需要通过检索来为模型提供依据并消除幻觉。
- 混合模式的优越性(有条件的): SFT+RAG 混合模式表现最佳,主要是因为 SFT 使模型在面对可能使零样本 RAG 模型产生困惑的“噪声”较大的候选集时,表现得更加稳健。
- 效率优于复杂度: 对于像 RTA 这样篇幅较短的法典,复杂的专业检索模型(更大的嵌入模型、重排序器)和更大的训练数据集并不会比轻量级的
bge-small 混合方案和标准合成数据带来可衡量的提升。
- 局限性与目标: 该系统达到了三个中的四个成功门槛:它消除了幻觉、相对于基座模型实现了显著提升,并回答了操作员的问题。然而,它未能达到 0.70 精确匹配的愿景目标,最终得分仅为 0.481。作者将这一差距归因于检索召回率上限(约 0.89)、款项层级的难度以及评估集规模较小。
结论
作者得出结论,虽然该人工制品成功实现了幻觉清零并跨过了超越基座模型的门槛,但 27 项测试集上的 0.481 精确匹配得分仍是初步的。在带有检索功能的模型臂之间(例如 0.481 对比 0.44)的细微差异可能处于统计误差范围内。其主要贡献在于证明了:对于此类任务,一种廉价的、混合式的 SFT+RAG 方法是足够的,其表现优于纯微调或更复杂的检索流水线,尽管若要达到更高的准确性目标,仍需进一步的工作以及更大规模的人工验证评估集。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。