From NER to Business Process Automation: Comparative Evaluation of CNN, LSTM, and Transformer Models for Address Intelligence
本研究对五种神经架构(WordCNN、WordLSTM、BERT、DistilBERT 和 ELECTRA)在业务流程自动化中的地址提取能力进行了对比评估,结果表明 ELECTRA 实现了最高的准确率和效率,而较轻量级的模型则为延迟敏感型应用提供了可行的替代方案。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
每天,企业都在处理海量的纸质和数字记录,从运输包裹到管理学生入学信息。这项工作中一个至关重要的环节是读取地址。人类可以扫一眼凌乱的手写笔记或打印的文本行,并瞬间识别出城市、州和邮政编码;但对计算机而言,一段文字仅仅是一串没有内在含义的字符序列。为了让企业实现业务流程自动化——即让软件在无需人工干预的情况下处理任务——他们需要一种方法,将这些非结构化的文本行转化为整齐、有序的数据。这正是人工智能领域中一个被称为“命名实体识别”(Named Entity Recognition)的技术所发挥作用的地方。你可以把它想象成一个数字荧光笔,能够扫描句子并为特定的词汇贴上“城市”、“州”或“国家”的标签。对于工程师来说,挑战在于寻找一种合适的“数字大脑”,能够快速且准确地完成这种标注工作,尤其是在地址来源各异且格式迥异的情况下。
印度贝内特大学(Bennett University)的一个研究小组致力于解决这个特定的难题。他们想知道在五种最流行的神经网络类型中——这些系统旨在模仿人类大脑学习模式的方式——哪一种最适合拆解地址。他们测试了三类截然不同的模型家族:一种是寻找局部微观模式的模型;一种是像读句子一样按顺序追踪单词关系的模型;以及最新、最强大的能够一次性理解全句语境的模型。研究人员不仅关注哪个模型获得的正确答案最多,还测量了每个模型做出决策所需的时间,因为在商业自动化的现实世界中,速度与准确性同样重要。他们在两组截然不同的真实世界数据上测试了这些系统:一组来自航空航天供应商的记录,另一组则是美国大规模的公立学校名单。
研究始于向这些模型输入数千行地址。研究人员通过确保测试的公平性,将数据进行拆分,使模型在一些地址上进行训练,而在完全不同的、从未见过的地址上进行测试,从而防止计算机仅仅是死记硬背答案。他们还在不同条件下测试了模型,有时只给它们一半的数据进行学习,有时则提供全量数据。这有助于他们了解每个系统在信息匮乏与信息丰富时各自的学习能力。其目标是找到一个既能处理混乱的商业数据,又不会拖慢整个运营流程的系统。
结果清晰地展示了其中的权衡关系。那些依赖按顺序逐词阅读文本的模型(被称为 LSTM 网络)表现良好,并且比仅寻找局部模式的简单模型更擅长理解单词之间的关系。然而,表现最出色的还是基于 Transformer 的模型,这类模型旨在一次性理解整个句子的语境。在这些模型中,一个名为 ELECTRA 的模型脱颖而出,成为了最高效的选择。当研究人员提供全量数据进行处理时,ELECTRA 在航空航天数据上的识别准确率达到了 99.4%,在学校数据上的准确率达到了 99.6%。
ELECTRA 的价值不仅在于其高分,更在于其速度。虽然最著名且功能最强大的模型 BERT 取得了类似的准确率,但它处理每个地址所需的时间明显更长。在测试中,ELECTRA 的处理速度大约是 BERT 的六倍,完成一项工作仅需约 56 毫秒,而后者则需要超过 300 毫秒。对于需要实时处理数百万条记录的企业来说,这种差异至关重要。研究人员发现,虽然较简单、较快的模型足以应对非常标准化的地址,但面对复杂数据时,它们无法达到先进系统的精准度。反之,除非选择像 ELECTRA 这样的模型,否则最强大的系统往往难以胜任高吞吐量的任务。
研究还表明,拥有更多数据有助于所有模型的提升,但先进的 Transformer 模型受益最为显著。当研究人员提供 100% 的可用数据而非仅 50% 时,顶尖模型的准确率攀升得更高,而较简单的模型增幅则相对温和。这表明,对于最困难的地址解析任务,增加计算能力来使用先进模型是值得的投资,前提是使用像 ELECTRA 这样快速的版本。研究人员指出,这些发现是针对他们测试的结构化数据而言的,这些数据大多遵循北美地址格式。他们提醒道,如果要求这些模型去阅读凌乱的手写笔记或来自其他国家、遵循不同规则的地址,结果可能会有所不同。
最终,这项研究为试图实现数据处理自动化的企业提供了一份实用的指南。它表明,并没有一种适用于所有情况的“最佳”模型。如果一家公司需要快速处理数百万个标准化地址,一个更简单、轻量级的模型可能是明智之选;如果地址非常复杂且需要深度理解,那么 Transformer 模型则是必不可少的。然而,对于那些既追求高准确度又追求高速度的人来说,ELECTRA 在这次对比中成为了明显的赢家。研究证实,虽然人工智能现在已经可以近乎完美地处理这些任务,但成功的自动化关键在于选择合适的工具,并在精度与速度之间取得平衡。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。