← 最新论文
💬 NLP

Do Small Models Use the Law You Give Them? Context-Injected Fine-Tuning for Legal QA in Bangladesh

本文表明,通过在注入上下文的法律案例上对小型双语语言模型进行微调,可以显著提高它们正确应用检索到的孟加拉国法定条款以及保持语言一致性的能力,尽管这些增益随模型规模的变化而变化,且并不统一惠及较大的模型。

原作者: Moniruzzaman Mahadi, Abrar Mohammed Tanzim Alam, Sayma Siddika Monalisa, Mir Mohammad Asif Abdullah, Swakkhar Shatabda, Md Adnan Arefeen

发布于 2026-07-28
📖 1 分钟阅读☕ 轻松阅读

原作者: Moniruzzaman Mahadi, Abrar Mohammed Tanzim Alam, Sayma Siddika Monalisa, Mir Mohammad Asif Abdullah, Swakkhar Shatabda, Md Adnan Arefeen

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一个这样的世界:计算机就像是那些读遍了图书馆几乎所有书籍、速度极快且极其聪明的学生。这些被称为“大语言模型”的学生非常擅长聊天、写故事和解谜,但他们有一个棘手的习惯:有时会胡编乱造,或者忘记正在进行的比赛规则。在人工智能领域,研究人员一直在努力教导这些数字学生如何停止瞎猜,转而开始严格遵守规则。一种流行的方法是“检索”,这就像是在学生参加考试前,递给他们教科书中的特定页面,希望他们能阅读该内容并利用这些信息来正确回答问题。但这里有一个大问题:如果你交给一个规模较小、能力较弱的学生那页教科书,他们真的会去读它并使用它吗?还是会直接忽略它并继续瞎猜?这是孟加拉国科学家们试图解决的谜题,尤其是在那里的法律体系依赖于同时以英文和孟加拉文编写的具体法律,而答错问题可能会产生严重的现实后果。

这项研究背后的研究人员决定测试一个聪明的想法:与其只是在考试时希望学生看书,不如在从一开始就让他们面前放着书的情况下进行训练,会怎样呢?他们创建了一个特殊的训练集,包含 2,165 个法律问题和答案,其中每一个问题都附带了用于解决该问题的确切法律条文,并将其写在紧邻问题的位置。随后,他们选取了一个名为 Qwen3.5 的小型开源“计算机大脑”,并提供了三种不同的规模:一个只有 0.8 亿参数的微型版本、一个 20 亿参数的中型版本,以及一个稍大的 40 亿参数版本。他们使用这种“上下文注入”的方法来训练这些模型,即法律条文始终是课程的一部分。

训练完成后,他们使用来自孟加拉国律师协会(负责测试律师的机构)的真实考试题目对模型进行了测试。他们再次向模型提供相同的题目,但这一次,他们不仅仅是让模型去猜;他们还尝试通过两种不同的搜索方法(BM25 和 FAISS)提供相关的法律条文,以观察模型是否真的能够使用所提供的信息。结果既有巨大的成功,也有令人惊讶的困惑。对于最小的模型(0.8B),这种训练效果如同魔法一般。在训练前,当提供法律条文时,它几乎答不对任何问题,得分仅为 100 分中的 2 分。训练后,它的得分跃升至 100 分中的 34 分。中型模型(2B)也取得了显著进步,表明它学会了真正阅读所给的法律条文。

然而,对于最大的模型(4B),故事发生了变化。虽然它在用正确语言回答问题方面变得稍微好了一点,但在提供法律条文时,它回答英文问题的表现反而变差了,这表明对于这个规模的模型来说,这种训练可能造成了困扰而非帮助。训练的另一个巨大胜利是修复了一个愚蠢的错误:在训练前,当被问及孟加拉文问题时,模型经常忽略语言,在 44% 到 53% 的情况下用英文进行回答。训练后,这个错误几乎消失了,降到了 1% 以下。这项研究表明,对于较小的模型来说,教导它们使用所给的法律是一场游戏规则的改变;但对于较大的模型来说,这并不是一个万能的解决方案,仅仅拥有正确的信息并不足够,如果模型不知道如何使用它的话。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →