← Neueste Arbeiten
💻 computer science

From NER to Business Process Automation: Comparative Evaluation of CNN, LSTM, and Transformer Models for Address Intelligence

Diese Studie liefert eine vergleichende Bewertung von fünf neuronalen Architekturen (WordCNN, WordLSTM, BERT, DistilBERT und ELECTRA) für die Adress-Extraktion in der Geschäftsprozessautomatisierung und zeigt auf, dass ELECTRA die höchste Genauigkeit und Effizienz erreicht, während leichtere Modelle praktikable Alternativen für latenzsensitive Anwendungen bieten.

Ursprüngliche Autoren: Saurabh Kumar Srivastava, Vikas Jalodia, Divya Srivastava

Veröffentlicht 2026-09-22
📖 5 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Saurabh Kumar Srivastava, Vikas Jalodia, Divya Srivastava

Originalarbeit lizenziert unter CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). ✨ Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Jeden Tag bewegen Unternehmen Berge von Papier- und digitalen Datensätzen, von Versandpaketen bis hin zur Verwaltung von Schüleranmeldungen. Ein kritischer Teil dieser Arbeit ist das Lesen von Adressen. Während Menschen mit einem Blick auf eine unordentliche handschriftliche Notiz oder eine getippte Textzeile sofort Stadt, Bundesland und Postleitzahl erkennen können, haben Computer oft Schwierigkeiten damit. Für eine Maschine ist eine Zeichenfolge von Wörtern nur eine Sequenz von Zeichen ohne inhärente Bedeutung. Damit Unternehmen ihre Arbeitsabläufe automatisieren können – also Software Aufgaben ohne menschliche Hilfe erledigen lassen können – benötigen sie einen Weg, diese unstrukturierten Textzeilen in ordentliche, organisierte Daten umzuwandeln. Hier kommt ein Bereich der künstlichen Intelligenz namens Named Entity Recognition (Benennung von Entitäten) ins Spiel. Stellen Sie sich dies als einen digitalen Textmarker vor, der einen Satz scannt und bestimmte Wörter als „Stadt“, „Bundesland“ oder „Land“ markiert. Die Herausforderung für Ingenieure besteht darin, die richtige Art von digitalem Gehirn zu finden, um dieses Markieren schnell und präzise durchzuführen, insbesondere wenn die Adressen aus unterschiedlichen Quellen stammen und sehr verschieden voneinander aussehen.

Ein Forscherteam an der Bennett University in Indien machte sich daran, genau dieses Rätsel zu lösen. Sie wollten wissen, welcher der fünf populärsten Typen von neuronalen Netzen – Computersysteme, die darauf ausgelegt sind, die Art und Weise, wie das menschliche Gehirn aus Mustern lernt, nachzuahmen – am besten geeignet ist, um Adressen zu zerlegen. Sie testeten drei verschiedene Familien von Modellen: solche, die nach kleinen, lokalen Mustern suchen; solche, die Text wie einen Satz lesen und dabei die Reihenfolge der Wörter berücksichtigen; und den neuesten, leistungsfähigsten Typ, der den vollen Kontext eines Satzes auf einmal versteht. Die Forscher schauten nicht nur darauf, welches Modell die meisten richtigen Antworten lieferte. Sie maßen auch, wie lange jedes Modell für eine Entscheidung benötigte, denn in der realen Welt der Geschäftsautomatisierung ist Geschwindigkeit genauso wichtig wie Genauigkeit. Sie testeten diese Systeme an zwei sehr unterschiedlichen Datensätzen aus der realen Welt: Datensätzen von Luftfahrtzulieferern und einer massiven Liste öffentlicher Schulen in den Vereinigten Staaten.

Die Studie begann damit, diese Modelle mit tausenden Adresszeilen zu füttern. Die Forscher waren sorgfältig dabei, einen fairen Test zu gewährleisten. Sie teilten die Daten so auf, dass die Modelle an einigen Adressen trainiert wurden und an völlig anderen, die sie noch nie zuvor gesehen hatten, getestet wurden, um zu verhindern, dass die Computer einfach die Antworten auswendig lernen. Sie testeten die Modelle auch unter verschiedenen Bedingungen, indem sie ihnen manchmal nur die Hälfte der Daten zum Lernen gaben und ein anderes Mal den vollständigen Satz. Dies half ihnen zu verstehen, wie gut jedes System lernen konnte, wenn Informationen knapp versus wenn sie im Überfluss vorhanden waren. Das Ziel war es, ein System zu finden, das die unordentliche Realität von Geschäftsdaten bewältigen kann, ohne den gesamten Betrieb zu verlangsamen.

Die Ergebnisse zeichneten ein klares Bild der Kompromisse. Die Modelle, die darauf basieren, Text Wort für Wort in einer Sequenz zu lesen, bekannt als LSTM-Netzwerke, schnitten gut ab und waren besser darin, die Beziehung zwischen Wörtern zu verstehen, als die einfacheren Modelle, die nur nach lokalen Mustern suchten. Die leistungsfähigsten Ergebnisse kamen jedoch von den Transformer-basierten Modellen, die darauf ausgelegt sind, den gesamten Kontext eines Satzes gleichzeitig zu erfassen. Unter diesen stach ein Modell namens ELECTRA als das effizienteste hervor. Als die Forscher den Modellen die volle Menge an Daten zur Verfügung stellten, identifizierte ELECTRA die Adresskomponenten zu 99,4 % der Zeit für die Luftfahrtdaten und zu 99,6 % der Zeit für die Schuldaten korrekt.

Was ELECTRA besonders wertvoll machte, war nicht nur seine hohe Punktzahl, sondern auch seine Geschwindigkeit. Während das berühmteste und leistungsfähigste Modell, BERT, eine ähnliche Genauigkeit erreichte, benötigte es signifikant länger, um jede Adresse zu verarbeiten. In den Tests war ELECTRA etwa sechsmal schneller als BERT und schloss seine Arbeit in etwa 56 Millisekunden ab, verglichen mit über 300 Millisekunden beim anderen. Dieser Unterschied ist entscheidend für Unternehmen, die Tausende von Datensätzen in Echtzeit verarbeiten müssen. Die Forscher fanden heraus, dass die einfacheren, schnelleren Modelle zwar für sehr standardisierte Adressen gut genug waren, aber die Präzision der fortgeschritteneren Systeme bei komplexen Daten nicht erreichen konnten. Umgekehrt waren die leistungsstärksten Systeme oft zu langsam für Aufgaben mit hohem Volumen, es sei denn, ein Modell wie ELECTRA wurde gewählt.

Die Studie zeigte auch, dass mehr Daten allen Modellen halfen, sich zu verbessern, wobei die fortgeschrittenen Transformer-Modelle am meisten profitierten. Als die Forscher den Modellen 100 % der verfügbaren Daten statt nur 50 % zur Verfügung stellten, stieg die Genauigkeit der Top-Modelle noch weiter an, während die einfacheren Modelle eher moderate Zuwächse verzeichneten. Dies deutet darauf an, dass für die schwierigsten Aufgaben der Adressanalyse die zusätzliche Rechenleistung der fortgeschrittenen Modelle die Investition wert ist, sofern eine schnelle Version wie ELECTRA verwendet wird. Die Forscher merkten an, dass diese Erkenntnisse spezifisch für die getesteten strukturierten Daten sind, die größtenteils nordamerikanischen Adressformaten folgten. Sie warnten, dass die Ergebnisse anders aussehen könnten, wenn die Modelle gebeten würden, unordentliche, handschriftliche Notizen oder Adressen aus anderen Ländern mit anderen Regeln zu lesen.

Letztendlich bietet diese Forschung einen praktischen Leitfaden für Unternehmen, die versuchen, ihre Datenverarbeitung zu automatisieren. Sie zeigt, dass es nicht das eine „beste“ Modell für jede Situation gibt. Wenn ein Unternehmen Millionen von standardisierten Adressen schnell verarbeiten muss, könnte ein einfacheres, leichtgewichtiges Modell die richtige Wahl sein. Wenn die Adressen komplex sind und ein tiefes Verständnis erfordern, ist ein Transformer-Modell notwendig. Wer jedoch das Beste aus beiden Welten sucht – hohe Genauigkeit und hohe Geschwindigkeit – für den ELECTRA in diesem Vergleich als klarer Sieger hervorging. Die Studie bestätigt, dass die künstliche Intelligenz diese Aufgaben zwar nun mit nahezu perfekter Genauigkeit bewältigen kann, der Schlüssel zu erfolgreicher Automatisierung jedoch darin liegt, das richtige Werkzeug für die spezifische Aufgabe zu wählen und dabei das Gleichgewicht zwischen Präzision und Geschwindigkeit zu halten.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →