← 最新论文
📊 statistics

Where A Small Language Model Helps in Invoice Categorisation, Understood Through Embedding Geometry

本文通过证明在单个 GPU 上对小型语言模型(SBERT)进行微调,利用与供应商身份相关的局部各向同性嵌入聚类,实现了发票分类的高准确率,从而证明了内部小型语言模型是大型语言模型的一种具有成本效益、安全且通用的替代方案,同时也揭示了对人类有益的结构化输入未必能提高模型的性能。

原作者: Emma Ceccherini, Daniel Lawson, Anjulika Salhan

发布于 2026-08-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Emma Ceccherini, Daniel Lawson, Anjulika Salhan

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

任何购买或销售商品的业务都必须对每一笔交易进行精确的记录。当公司收到发票时,必须由人类会计师决定该项支出属于哪个特定类别,这一任务被称为分配总账(General Ledger)代码。这不仅仅是一个简单的分类工作;它需要专业的判断力,以理解一项采购是属于日常运营、资本投资,还是企业主的个人支出。做到这一点是准确财务报告和税务合规的基础。如果这些代码出错,小企业将面临不必要的罚款,而政府也会损失数十亿的税收收入。多年来,人们一直希望人工智能能够实现这一复杂工作的自动化,但该技术往往难以达到受过训练的人类会计师那样的细微洞察力。

布里斯托大学与 System Holdings Limited 的研究人员最近探索了一条不同的路径。他们没有使用那些需要大量计算能力并引发数据隐私担忧的大型复杂人工智能系统,而是测试了较小的专用语言模型是否能有效地胜任这项工作。这些较小的模型可以在单台计算机上运行,从而将敏感的财务数据保存在公司自身的防火墙内。该团队不仅想了解这些模型是否有效,还想了解它们是如何“思考”的。他们观察了计算机内部信息的数学“形状”,检查模型如何在内部内存中将相似的发票进行分组。他们发现,这些较小模型组织信息的方式出奇地高效,而且这种组织方式正是其成功的关键。

研究人员使用了一个来自英国某会计师事务所七个不同客户的、包含两千多张发票的真实世界数据集进行研究。每张发票都已由专业会计师进行了正确的分类。团队将这些数据输入到两种不同类型的 AI 模型中:一种是名为 SBERT 的小型高效模型,另一种是名为 DeBERTa 的大型复杂模型。他们使用不同版本的发票文本对模型进行了测试。一个版本仅包含供应商名称、日期和价格;另一个版本包含了购买物品的完整清单;第三个版本则添加了显式标签,例如“供应商名称:”或“价格:”,使文本看起来对人类读者更具结构化。

结果揭示了一个关于机器如何阅读的反直觉真相。对于人类来说最容易阅读的版本——即带有清晰标签和结构化格式的版本——实际上反而让 AI 更难区分不同类型的发票。当计算机看到“供应商名称”和“价格”这些词在每一份文档中重复出现时,这些文档的内部数学表示变得过于相似,从而模糊了彼此之间的界限。当模型接收到发票的原始、非结构化文本时,表现最为出色,就像人类会计师扫一眼凌乱的收据那样。较小的模型 SBERT 被证明是更优的选择。在仅经过几百个样本训练后,它就达到了很高的准确度,在正确分类发票方面远优于规模大得多的模型或未经此特定任务训练的标准“零样本”(zero-shot)AI。

对计算机内部内存的深入观察解释了为什么较小的模型成功了,而较大的模型却失败了。研究人员发现,较大模型的内部数据表示出现了“坍缩”。随着文本变得更长、更详细,模型区分不同含义的能力逐渐消失,开始主要依赖于文本的长度而非其内容。相比之下,较小的模型维持了一个丰富的多维空间,使不同类型的发票占据不同的区域。甚至在针对特定任务进行训练之前,该模型就能自然地按发行公司对发票进行分组,显示出它理解文档来源的能力。更重要的是,只要它见过足够的示例,即使在文本相似的情况下,它也能区分不同的财务类别。

这种泛化能力在团队测试模型处理从未见过的全新客户数据时至关重要。较大的模型表现挣扎,需要数百个新示例才能开始正常工作。然而,较小的模型适应速度极快,仅需约一百张新发票就能达到很高的准确度。这表明较小的模型学习到的是一种更稳健的文本理解方式,而非仅仅是记忆模式。它可以将学到的知识从一家企业转移到另一家企业,识别出对于一个客户而言是“汽车维修”的项目,对于新客户而言同样属于同一类别,而不论具体的供应商是谁。

该研究得出结论:对于像发票分类这样的任务,一个较小的、内部部署的模型通常比一个庞大的、通用的模型是更好的工具。它在成本、安全性和性能之间提供了切实的平衡。通过在单台计算机上运行,它可以保护敏感的财务数据隐私;由于规模较小,其运行成本也更低。研究还表明,为文本添加额外的结构并不会带来帮助;事实上,原始文本往往更为有效。这一发现简化了业务流程,因为企业无需花费时间和金钱在将发票输入系统前对其进行重新格式化。这项工作证明,只要系统设计旨在理解数据的几何结构而非仅仅是文本的容量,人工智能完全可以处理会计领域中那种细致且专业的判断工作。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →