← 最新论文
💬 NLP

TaxPraBen: A Scalable Benchmark for Structured Evaluation of LLMs in Chinese Real-World Tax Practice

本文提出了 TaxPraBen,这是首个针对中国税务实践的大规模结构化评估基准,涵盖 10 项传统任务与 3 项真实场景(如风险防控、稽查分析与策略规划),通过可扩展的解析评估范式对 19 个大语言模型进行了系统评测,揭示了闭源大模型及中文模型(如 Qwen2.5)在该领域的显著优势与现有微调模型的局限性。

原作者: Gang Hu, Yating Chen, Haiyan Ding, Wang Gao, Jiajia Huang, Min Peng, Qianqian Xie, Kun Yu

发布于 2026-04-13
📖 1 分钟阅读☕ 轻松阅读

原作者: Gang Hu, Yating Chen, Haiyan Ding, Wang Gao, Jiajia Huang, Min Peng, Qianqian Xie, Kun Yu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一个名为 TaxPraBen 的新工具,你可以把它想象成是给大语言模型(AI)在中国税务领域进行的一次“全真模拟实战大考”。

为了让你更容易理解,我们可以用几个生动的比喻来拆解这篇论文的核心内容:

1. 为什么要搞这个考试?(背景与痛点)

以前的 AI 考试(比如通用的语文或数学题),就像是在游泳池里教游泳。AI 在泳池里游得挺快,背得也熟。但是,真实的税务工作就像是在波涛汹涌的大海里救火

  • 以前的问题:很多现有的考试只考 AI 能不能背出税法条文(像背单词),或者能不能做简单的选择题。但这不够!真实的税务师不仅要懂法,还要会算账(数字推理),要能识别风险(像侦探),还要能出谋划策(像军师)。
  • 现状:很多 AI 在泳池里是冠军,一下海(面对真实复杂的税务场景)就晕了,要么算错数,要么给不出实用的建议。

2. TaxPraBen 是什么?(核心创新)

TaxPraBen 就是为了解决这个问题,专门设计的一套“海上生存与救援模拟系统”。

  • 题库来源:它不是从网上随便抓的数据,而是由真正的税务专家(像老船长)和 AI 助手一起,从真实的税务书籍、官方文件、甚至税务稽查案例中,精心挑选和整理的 7300 道 题目。
  • 三大关卡(基于布鲁姆分类法):
    1. 记忆关(Knowledge Memorization):考你能不能像“活字典”一样,准确背诵税法条款。
    2. 理解关(Knowledge Understanding):考你能不能读懂复杂的税务新闻,把核心意思提炼出来。
    3. 应用关(Knowledge Application):这是最难的!考你能不能真的干活。比如:
      • 风险预防:像“排雷兵”,提前发现企业哪里可能违规。
      • 稽查分析:像“法医”,从一堆乱糟糟的案情里提取关键证据。
      • 税务筹划:像“精算师”,帮企业合法地省税,还要算出具体能省多少钱。

3. 怎么打分?(独特的评分系统)

以前的考试,AI 只要文字写得通顺就给高分。但 TaxPraBen 引入了一个“双重校验机制”:

  • 比喻:想象你在做一道数学应用题。
    • 旧方法:只要你的解题思路(文字)写得好,哪怕最后答案算错了,老师也可能给你及格。
    • TaxPraBen 方法:它要求 AI 必须把答案填进一个标准的“表格”(JSON 格式)里。
      • 文字分:你的解释通不通顺?(用 BERTScore 衡量)
      • 数字分:你算的税钱对不对?(用精确匹配衡量)
    • 结果:如果 AI 写了一大堆漂亮的废话,但税钱算错了,或者格式填错了,直接不及格。这就像要求医生开药方,不仅药名要对,剂量(数字)也必须精准,否则就是医疗事故。

4. 考试结果如何?(主要发现)

他们找了 19 个 著名的 AI 模型(包括 ChatGPT、文心一言、通义千问等)来参加考试,结果很有意思:

  • 闭源大模型(如 ERNIE-3.5, GPT-4o):表现最好。就像那些经验丰富的老船长,参数大、见识广,在复杂的海况下更稳。
  • 中文模型(如 Qwen2.5):比那些“万国通用”的模型(Multilingual)表现更好。这说明懂中文的语境、懂中国的“行话”(税务术语)非常重要。
  • 专门的税务 AI(YaYi2):让人意外的是,这个专门学过税务数据的模型,表现并没有比通用模型好多少。
    • 原因:就像只背了题库的“书呆子”,遇到稍微变通一点的真实案例就懵了。这说明光有数据不够,还得有真正的推理能力
  • 最大的短板:所有模型在需要多步计算和逻辑推理的任务上(比如复杂的税务筹划),都表现得很吃力。它们擅长“说话”,但不擅长“算账”。

5. 这个考试有什么用?(意义)

TaxPraBen 不仅仅是一个考试,它更像是一个行业标准的“试金石”

  • 对开发者:告诉他们,别光盯着让 AI 说话更流利,要让它算得更准、逻辑更严密
  • 对税务行业:提供了一个安全、可靠的工具,用来评估 AI 能不能真正帮人类处理税务风险、做税务规划,而不是只会“一本正经地胡说八道”。
  • 对其他领域:这套“文字 + 数字”的双重评估方法,以后也可以用到法律(判案 + 罚金)、医疗(诊断 + 药量)等领域。

总结

简单来说,这篇论文就是告诉大家:别再用简单的“背课文”来测试 AI 的税务能力了。TaxPraBen 建立了一个高难度的实战考场,要求 AI 既要懂中文的“潜台词”,又要能像精算师一样精准计算。只有通过了这个考试的 AI,才真正有资格进入中国税务的“深水区”工作。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →