Machine Learning versus Deep Learning for Public Financial Report Classification and Popularity Prediction: A Feasibility Study on Ghana's Controller and Accountant-General's Department
本可行性研究评估了经典机器学习与深度学习模型在加纳会计师长部财务报告上的表现,结果显示,尽管经过微调的 XGBoost 实现了完美的类别分类,但随后的消融实验表明关键词特征显著夸大了这些结果,从而强调了在公共部门背景下部署此类工具之前进行严格特征验证的至关重要性。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
世界各地的政府正越来越多地将其财务记录搬到网上。这种转变旨在提高透明度,让公民和审计人员无需前往实体办公室即可了解公共资金的支出情况。然而,随着这些数字档案的增长,管理变得日益困难。一个政府部门可能在几年内发布数百份文件,从年度预算声明到薪资通告不等。手动分类这些文件既缓慢又容易出错,而弄清楚人们真正想读哪些报告则更加困难。为了解决这个问题,各机构正寻求利用计算机来为他们进行分类和预测。这就是机器学习发挥作用的地方。这些是能够学习识别数据中模式(例如文档标题中的词汇)的计算机程序,从而做出诸如“这是一份薪资报告”或“这份报告将被频繁下载”之类的决策。但问题在于:这些程序通常需要成千上万个示例才能学好。当一个政府部门只有几百份文件时,目前尚不清楚这些智能工具是否真的有效,还是仅仅基于幸运的捷径在进行猜测。
在加纳,总会计师部持有大量的公共财务报告。两位研究人员,Emmanuel Osei-Dwomoh 和 Gabriel Osei Forkuo,决定测试自动化工具是否可以组织这一特定集合并预测其受欢迎程度。他们收集了 2019 年至 2024 年间发布的 131 份官方报告。这些文件包括从会计科目表版本到国际会计准则材料的一切内容。研究人员着手构建了两种不同类型的计算机模型来处理这项工作。第一种类型依赖于“经典”机器学习,其中人类分析师会仔细创建一组特定的线索,例如计算“预算”一词出现的次数或记录文件的长度。第二种类型使用了“深度学习”,这是一种更复杂的方法,计算机逐个字符地阅读标题和描述的原始文本,试图在没有人类帮助的情况下自行寻找模式。他们在三个特定任务上测试了这些模型:将报告正确分类、猜测一份报告是否会被下载次数高于平均水平,以及预测确切的下载次数。
结果令人惊讶,并揭示了这些系统学习过程中的一个隐藏陷阱。当研究人员第一次运行测试时,经典机器学习模型看起来近乎完美。它正确地将测试组中的每一份报告都分入了正确的类别,取得了完美的得分。深度学习模型在这一任务上也表现得非常好。然而,研究人员怀疑这种完美的得分并不是因为计算机真正理解了报告的内容。他们注意到,他们提供给经典模型的线索包含了与类别名称几乎完全相同的关键词。例如,如果一份报告的标题是“2024 年薪资通告”,模型会被赋予一个标记,即“存在‘薪资’(payroll)这个词”。既然类别就是“薪资”,那么模型实际上是在开始之前就已经知道了答案。
为了证明这一点,研究人员移除了那些特定的关键词线索并重新进行了测试。完美的得分消失了。模型的准确率显著下降,虽然仍处于相当不错的水平,但远非完美。这证实了最初的成功很大程度上归功于一个捷径:报告的标题中经常包含它们自身的类别名称。直接读取文本的深度学习模型也发现了这个捷径,并取得了类似的极高分数,这证明了原始文本本身就包含了答案,而不一定是对文档结构的深度理解。当研究人员观察其他任务时,情况发生了变化。预测哪些报告会受欢迎要困难得多。经典模型表现得相当不错,能正确识别大约四分之三的热门报告,而深度学习模型则表现得更为吃力。深度学习模型还表现出一种奇怪的行为:当研究人员试图通过给予更多训练时间来“微调”它们时,它们的表现反而变差了。这表明,对于这样一个规模较小的文件集,复杂的深度学习模型过于敏感,开始记忆训练数据而非学习通用规则。
研究结论指出,对于像这样规模较小的政府档案,简单的经典机器学习工具比复杂的深度学习系统是一个更好的起点。这些简单的工具更容易理解,且在数据有限时不太容易失效。然而,研究人员警告说,任何使用这些工具的人必须小心不要依赖捷径。如果一个模型被训练为通过标题中出现“薪资”一词来识别类别,那么当一份新报告使用不同的措辞时,它可能会完全失效。这项工作的最诚实的启示是,虽然计算机可以帮助组织这些财务记录,但它们还不是魔法。当数据清晰且线索真实时,它们的效果最好;但在规模较小、不完美的数据库上,它们令人印象深刻的分数有时会掩盖缺乏真正理解的事实。研究人员建议,在任何政府门户网站部署此类系统之前,必须对其进行严格测试,以确保它学习的是正确的东西,而不仅仅是在复制标签。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。