← 最新论文
🤖 machine learning

Train, Retrieve, or Both? A Four-Arm Head-to-Head for Correct Statutory Citation on the Ontario Residential Tenancies Act

本文通过一项四臂评估表明,经过微调的 Qwen2.5-7B 模型结合检索(SFT+RAG)在引用安大略省《住宅租赁法》方面实现了最高的准确率并消除了幻觉,其表现优于单纯的微调或仅检索的方法,且无需专门的检索模型或更大的数据集。

原作者: Ali Asaria, Tony Salomone, Deep Gandhi

发布于 2026-06-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Ali Asaria, Tony Salomone, Deep Gandhi

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图在一本厚达 300 页的规则手册(《安大略省住宅租赁法》)中寻找一条精确的规则,来回答一个特定的问题,比如:“房东在进入我的公寓前需要提前通知多久?”

目标不是写一篇优美的文章,而是要指向确切的页码和段落编号(引用),以便普通人可以自行查阅。

这篇论文是一次“口味测试”,旨在探索教计算机完成这项任务的最佳方式。研究人员设置了一场由四种策略参与的比赛,使用一种智能 AI 模型(数字大脑)来观察哪种策略能在不编造内容的情况下找到正确的规则。

以下是四位参赛选手表现如何:

四位参赛选手

  1. “原始大脑”(基础模型):

    • 类比: 这就像是一个非常聪明但只读过一遍规则手册的学生。他们试图凭记忆猜测页码。
    • 结果: 他们完全失败了。他们找不到正确的页码,而且 81% 的情况下,他们会编造一个不存在的虚假页码。对于这项工作来说,他们太不可靠了。
  2. “记忆者”(仅进行微调):

    • 类比: 这是同一个学生,但他们花了数周时间练习“问题 \rightarrow 页码”的闪卡。他们掌握了格式并试图记住答案。
    • 结果: 他们不再编造虚假页面,但具体的数字仍然错误。他们记住了规则的“概念”,但弄混了精确的章节编号。这就像知道规则是关于“噪音”的,却把页码猜成了第 50 页而不是第 52 页。
  3. “图书管理员”(仅检索):

    • 类比: 这个学生不尝试背诵任何东西。相反,他们有一个动作极快的图书管理员为他们搜索书籍。学生只能使用图书管理员递给他们的页面来回答问题。
    • 结果: 这是一个巨大的进步。因为学生被迫查看真实的文本,他们从不编造虚假的页码(0% 的幻觉)。然而,有时图书管理员会递给他们一叠 10 页的资料,学生会因为不知道哪一页才是“确切”的正确页面而感到困惑。
  4. “超级团队”(混合型:记忆者 + 图书管理员):

    • 类比: 这个团队既做了闪卡练习,又有图书管理员协助。练习让他们在图书管理员递给他们一叠杂乱页面时,能成为一个更好的评判者。
    • 结果: 这个团队赢得了比赛。他们找到确切页码的频率比其他任何人都要高。即使在页面堆很厚的情况下,“练习”也帮助他们挑选出了正确的页面。

大惊喜

  • 规模并不总是更好: 研究人员尝试使用一个“超级图书管理员”(更复杂、更昂贵的搜索工具)来帮助学生。结果发现并没有帮助。简单的、廉价的图书管理员表现得一样好。这意味着你不需要昂贵、沉重的机械设备就能解决这个问题。
  • 更多的学习并无帮助: 他们尝试给“记忆者”更多的闪卡去学习。但这并没有让他们变得更好。瓶颈不在于学习多少,而在于他们首先需要图书管理员来找到文本。
  • “零幻觉”技巧: “图书管理员”和“超级团队”之所以从不编造虚假规则,是因为设计如此。系统设有一个安全门:如果页码不在图书管理员持有的页面中,系统就会拒绝回答。这是一个硬性规则,而不是一种习得的技能。

最终计分板

“超级团队”(混合型)得到了最高分,但他们还没有赢得金牌。

  • 目标: 研究人员希望达到 0.70 的分数(即 70% 的情况下得到正确答案)。
  • 现实: 他们得到了 0.48(大约一半的时间是对的)。

为什么没有达到 100%?

  1. 图书管理员漏掉了书: 有时图书管理员根本找不到正确的页面(大约 11% 的时间)。如果正确的页面不在那一叠资料中,学生就无法挑选出来。
  2. “细节”问题: 学生经常找到了正确的“节”(章节),但错过了具体的“款”(段落)。这就像找到了正确的章节,却找错了段落。这被视为“半对”的答案。
  3. 测试样本过小: 最后的测试只有 27 个问题。这就像根据一场比赛来评判整个赛季的运动队表现。结果虽然令人鼓舞,但样本量太小,无法 100% 确定。

核心结论

如果你想让计算机指引人们找到法律:

  • 不要仅仅要求它死记硬背法律(它会瞎猜)。
  • 不要仅仅要求它阅读法律(它会被过多的文本搞混)。
  • 务必结合一个经过格式化训练的模型和一个能为你搜索法律的工具。

这种方法最准确,它永远不会在位置上撒谎,并且在不需要昂贵、沉重技术的情况下也能运行良好。然而,它仍需努力才能从“良好”(48% 准确率)提升到“卓越”(70% 准确率)。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →