← 最新论文
💬 NLP

SteuerLLM: Local specialized large language model for German tax law analysis

本文介绍了 SteuerLLM,一个专门的 28B 参数德国税法模型,以及 SteuerEx,首个源自真实大学考试的开放基准测试,证明了领域特定适配和合成数据生成在复杂的法律推理任务中显著优于通用模型。

原作者: Sebastian Wind, Jeta Sopa, Laurin Schmid, Quirin Jackl, Sebastian Kiefer, Fei Wu, Martin Mayr, Harald Köstler, Gerhard Wellein, Andreas Maier, Soroosh Tayebi Arasteh

发布于 2026-06-23
📖 1 分钟阅读☕ 轻松阅读

原作者: Sebastian Wind, Jeta Sopa, Laurin Schmid, Quirin Jackl, Sebastian Kiefer, Fei Wu, Martin Mayr, Harald Köstler, Gerhard Wellein, Andreas Maier, Soroosh Tayebi Arasteh

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教导一位非常聪明、博学多才的学生,如何通过一场极其困难且高风险的德国税法考试。问题在于,普通的“聪明”学生(标准的通用大语言模型)擅长写论文或聊天,但当规则变得严苛、术语变得精准、且一个错误的数字就可能毁掉整个答案时,他们往往会失败。

这篇论文介绍了两个主要内容,旨在解决这个问题:一个新的、非常困难的考试,以及一个专为通过该考试而设计的专业化学生

1. 新的考试:“SteuerEx”

研究人员创建了第一个开放基准测试,名为 SteuerEx。可以把这看作是 AI 的一场“期末考试”,但它使用的不是虚假问题,而是过去十年中来自真实德国大学税法考试的 115 个真实题目。

  • 运作方式: 在普通考试中,你可能会得到简单的“对或错”的评分。但在税法领域,一名学生可能掌握了正确的法律概念,却漏掉了一个具体的引证;或者数学计算正确,但逻辑错误。
  • 评分系统: 研究人员将每个答案分解成微小的“构建块”(陈述句)。一个 AI 评分器(第二个 AI)会对每个块进行单独检查。如果你只答对了一半的逻辑,你就能得到一半的分数。这模拟了真实教授的评分方式:即使最终答案不完美,也会因良好的推理过程而给予部分分数。
  • 难度: 该考试涵盖了六个领域,如公司税、所得税和增值税。它的设计初衷是极其严苛的;大多数通用 AI 模型得分都非常低,这证明了税法是一个极难攻克的难题。

2. 特化学生:“SteuerLLM”

为了应对这场考试,团队构建了 SteuerLLM。想象一下,你拿走一个通用的天才(一个拥有 240 亿参数的 AI),并专门为税法为其进行了一次“大脑移植”或安装了“专项训练轮”。

  • 训练方法: 他们不仅仅是喂给它一本教科书。他们采用了“喷泉式”(Water Fountain)方法。他们提取了一组真实的考试题目,并利用计算机程序,基于真实的德国法律自动生成了数千个全新的、逼真的练习题及其答案。这就像是给学生提供了一个庞大且无穷无尽的练习题库,其形式与真实考试完全一致。
  • 架构: 他们并没有重新训练整个大脑(因为这可能会让 AI 忘记如何进行正常的语言交流),而是添加了专门针对税法的“神经元”层。这就像是在不改变学生走路或说话方式的前提下,在学生的背包里放入了一个专业的计算器和一本法律词典。
  • 结果: 这个拥有 280 亿参数的专业化学生,击败了几乎所有其他的通用 AI 模型,甚至包括一些规模比它大 20 倍的模型(如 6710 亿参数的模型)。这证明了对于税法而言,专业化训练比单纯的规模大小更重要。

3. 对比:AI vs. 真人学生

研究人员将他们的 AI 学生与参加这些考试的真人学生进行了对比。

  • 差距: 平均而言,人类学生的得分仍然远高于 AI。AI 目前还无法取代税务律师或顶尖学生。
  • 进展: 然而,在某些类别中,AI 的表现优于表现最差的人类学生。它展示了自己能够产生能够获得实际考试分数的“部分正确”的法律推理,而不是仅仅胡编乱造。

4. “开放”与“封闭”的秘密

团队还发布了一个名为 Open-SteuerLLM 的版本。这个版本与冠军模型完全相同,唯一的区别是他们移除了一小部分无法公开分享的私有训练数据。

  • 发现: 开放版表现得几乎与封闭版一样好。这表明,生成训练数据的这种方法(即“喷泉式”流水线)才是真正的核心秘诀,而不仅仅是使用了哪些特定的私有文档。

总结

论文指出,对于像税法这样高度结构化、规则密集的领域,你不需要一个更大、更昂贵的 AI。你需要一个更小、更聪明、且经过特定数据训练的 AI,并辅以精准的评分机制。他们已经向公众发布了他们的考试、训练数据以及模型,以便他人可以从中学习,并在未来构建更好的法律 AI。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →