From NER to Business Process Automation: Comparative Evaluation of CNN, LSTM, and Transformer Models for Address Intelligence
यह अध्ययन बिजनेस प्रोसेस ऑटोमेशन में एड्रेस एक्सट्रैक्शन के लिए पांच न्यूरल आर्किटेक्चर (WordCNN, WordLSTM, BERT, DistilBERT, और ELECTRA) का एक तुलनात्मक मूल्यांकन प्रदान करता है, जो यह दर्शाता है कि ELECTRA उच्चतम सटीकता और दक्षता प्राप्त करता है जबकि हल्के मॉडल लेटेंसी-संवेदनशील अनुप्रयोगों के लिए व्यवहार्य विकल्प प्रदान करते हैं।
मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
हर दिन, व्यवसाय कागज़ और डिजिटल रिकॉर्डों के पहाड़ों को इधर-उधर करते हैं, चाहे वह शिपिंग पैकेज हों या छात्र नामांकन का प्रबंधन। इस काम का एक महत्वपूर्ण हिस्सा पतों (addresses) को पढ़ना है। जबकि इंसान एक बिखरे हुए हस्तलिखित नोट या लिखे हुए टेक्स्ट की एक पंक्ति को देखकर तुरंत शहर, राज्य और ज़िप कोड को पहचान सकते हैं, कंप्यूटर अक्सर संघर्ष करते हैं। एक मशीन के लिए, शब्दों की एक श्रृंखला बिना किसी अंतर्निहित अर्थ के केवल वर्णों (characters) का एक क्रम है। व्यवसायों के लिए अपने वर्कफ़्लो को स्वचालित करने के लिए—यानी सॉफ़्टवेयर को मानवीय सहायता के बिना कार्यों को संभालने देने के लिए—उन्हें इन असंरचित टेक्स्ट लाइनों को व्यवस्थित, सुव्यवस्थित डेटा में बदलने का एक तरीका चाहिए। यहीं पर आर्टिफिशियल इंटेलिजेंस का एक क्षेत्र 'नेम्ड एंटिटी रिकग्निशन' (Named Entity Recognition) काम आता है। इसे एक डिजिटल हाइलाइटर के रूप में सोचें जो एक वाक्य को स्कैन करता है और विशिष्ट शब्दों को "शहर", "राज्य" या "देश" के रूप में टैग करता है। इंजीनियरों के लिए चुनौती इस हाइलाइटिंग को तेज़ी से और सटीकता से करने के लिए सही प्रकार के 'डिजिटल मस्तिष्क' को खोजने में है, खासकर जब पते विभिन्न स्रोतों से आते हैं और एक-दूसरे से बहुत अलग दिखते हैं।
भारत में बेनेट यूनिवर्सिटी के शोधकर्ताओं की एक टीम ने इस विशिष्ट पहेली को सुलझाने का प्रयास किया। वे जानना चाहते थे कि पाँच सबसे लोकप्रिय प्रकार के न्यूरल नेटवर्क में से कौन सा—जो मानव मस्तिष्क के पैटर्न से सीखने के तरीके की नकल करने के लिए डिज़ाइन किए गए कंप्यूटर सिस्टम हैं—पतों को तोड़ने के लिए सबसे अच्छा काम करता है। उन्होंने तीन अलग-अलग मॉडल परिवारों का परीक्षण किया: वे जो छोटे, स्थानीय पैटर्न खोजते हैं; वे जो टेक्स्ट को एक वाक्य की तरह पढ़ते हैं और शब्दों के क्रम को याद रखते हैं; और नवीनतम, सबसे शक्तिशाली प्रकार जो एक साथ पूरे वाक्य के पूर्ण संदर्भ (context) को समझता है। शोधकर्ताओं ने केवल इस बात पर ध्यान नहीं दिया कि किस मॉडल ने सबसे अधिक उत्तर सही दिए। उन्होंने यह भी मापा कि प्रत्येक मॉडल को निर्णय लेने में कितना समय लगा, क्योंकि व्यावसायिक स्वचालन (automation) की वास्तविक दुनिया में, गति सटीकता जितनी ही महत्वपूर्ण है। उन्होंने इन प्रणालियों का परीक्षण डेटा के दो बहुत अलग सेटों पर किया: एयरोस्पेस आपूर्तिकर्ताओं के रिकॉर्ड और संयुक्त राज्य अमेरिका के सार्वजनिक स्कूलों की एक विशाल सूची।
अध्ययन की शुरुआत इन मॉडलों को हजारों एड्रेस लाइनों को फीड करने के साथ हुई। शोधकर्ता यह सुनिश्चित करने के लिए सावधान थे कि परीक्षण निष्पक्ष हो। उन्होंने डेटा को इस तरह विभाजित किया कि मॉडलों को कुछ पतों पर प्रशिक्षित किया गया और फिर पूरी तरह से अलग पतों पर उनका परीक्षण किया गया जिन्हें उन्होंने पहले कभी नहीं देखा था, ताकि कंप्यूटर केवल उत्तरों को रट न सकें। उन्होंने मॉडलों का परीक्षण विभिन्न स्थितियों में भी किया, कभी उन्हें सीखने के लिए केवल आधा डेटा दिया, तो कभी पूरा सेट दिया। इससे उन्हें यह समझने में मदद मिली कि सूचना की कमी बनाम प्रचुरता के दौरान प्रत्येक प्रणाली कितनी अच्छी तरह सीख सकती है। लक्ष्य एक ऐसी प्रणाली खोजना था जो व्यावसायिक डेटा की अव्यवस्थित वास्तविकता को संभाल सके बिना पूरे संचालन की गति धीमी किए।
परिणामों ने व्यापार-समझौतों (trade-offs) की एक स्पष्ट तस्वीर पेश की। वे मॉडल जो अनुक्रम में शब्द-दर-शब्द टेक्स्ट पढ़ने पर निर्भर थे, जिन्हें LSTM नेटवर्क कहा जाता है, उन्होंने अच्छा प्रदर्शन किया और वे उन सरल मॉडलों की तुलना में शब्दों के बीच संबंध को समझने में बेहतर थे जो केवल स्थानीय पैटर्न देखते हैं। हालांकि, सबसे शक्तिशाली परिणाम ट्रांसफार्मर-आधारित मॉडलों से आए, जो एक साथ एक वाक्य के पूरे संदर्भ को समझने के लिए डिज़ाइन किए गए हैं। इनमें से, ELECTRA नामक एक मॉडल सबसे कुशल बनकर उभरा। जब शोधकर्ताओं ने मॉडलों को उपलब्ध डेटा की पूरी मात्रा दी, तो ELECTRA ने एयरोस्पेस डेटा के लिए 99.4% बार और स्कूल डेटा के लिए 99.6% बार पते के घटकों को सही ढंग से पहचाना।
ELECTRA को जो चीज़ विशेष रूप से मूल्यवान बनाती थी, वह केवल इसका उच्च स्कोर नहीं था, बल्कि इसकी गति भी थी। जबकि सबसे प्रसिद्ध और शक्तिशाली मॉडल, BERT, समान सटीकता प्राप्त करता था, उसे प्रत्येक पते को प्रोसेस करने में काफी अधिक समय लगा। परीक्षणों में, ELECTRA अन्य की तुलना में लगभग छह गुना तेज़ था, जिसने दूसरे के 300 मिलीसेकंड से अधिक समय लेने के मुकाबले लगभग 56 मिलीसेकंड में अपना काम पूरा कर लिया। यह अंतर उन व्यवसायों के लिए महत्वपूर्ण है जिन्हें वास्तविक समय (real-time) में हजारों रिकॉर्ड प्रोसेस करने की आवश्यकता होती है। शोधकर्ताओं ने पाया कि जबकि सरल, तेज़ मॉडल मानकीकृत पतों के लिए पर्याप्त अच्छे थे, वे जटिल डेटा के मामले में उन्नत प्रणालियों की सटीकता का मुकाबला नहीं कर सके। इसके विपरीत, सबसे शक्तिशाली प्रणालियाँ अक्सर उच्च-मात्रा वाले कार्यों के लिए बहुत धीमी थीं, जब तक कि ELECTRA जैसा मॉडल नहीं चुना जाता।
अध्ययन से यह भी पता चला कि अधिक डेटा होने से सभी मॉडलों में सुधार हुआ, लेकिन उन्नत ट्रांसफार्मर मॉडल को सबसे अधिक लाभ हुआ। जब शोधकर्ताओं ने मॉडलों को उपलब्ध डेटा का केवल 50% के बजाय 100% डेटा दिया, तो शीर्ष मॉडलों की सटीकता और भी बढ़ गई, जबकि सरल मॉडलों में मामूली लाभ देखा गया। यह सुझाव देता है कि सबसे कठिन एड्रेस पार्सिंग कार्यों के लिए, उन्नत मॉडलों की अतिरिक्त कम्प्यूटेशनल शक्ति में निवेश करना सार्थक है, बशर्ते कि ELECTRA जैसा तेज़ संस्करण उपयोग किया जाए। शोधकर्ताओं ने नोट किया कि ये निष्कर्ष उनके द्वारा परीक्षण किए गए संरचित डेटा के लिए विशिष्ट हैं, जो मुख्य रूप से उत्तरी अमेरिकी पते के प्रारूपों का पालन करते हैं। उन्होंने चेतावनी दी कि यदि मॉडलों को बिखरे हुए, हस्तलिखित नोट्स या अलग-अलग नियमों वाले अन्य देशों के पते पढ़ने के लिए कहा जाए, तो परिणाम अलग दिख सकते हैं।
अंततः, यह शोध उन व्यवसायों के लिए एक व्यावहारिक मार्गदर्शिका प्रदान करता है जो अपने डेटा प्रोसेसिंग को स्वचालित करने की कोशिश कर रहे हैं। यह दिखाता है कि हर स्थिति के लिए कोई एक "सर्वश्रेष्ठ" मॉडल नहीं है। यदि किसी कंपनी को लाखों मानकीकृत पतों को तेज़ी से प्रोसेस करने की आवश्यकता है, तो एक सरल, हल्का मॉडल सही विकल्प हो सकता है। यदि पते जटिल हैं और उनके लिए गहरी समझ की आवश्यकता है, तो एक ट्रांसफार्मर मॉडल आवश्यक है। हालाँकि, उन लोगों के लिए जिन्हें दोनों दुनियाओं का सर्वश्रेष्ठ—उच्च सटीकता और तेज़ गति—चाहिए, ELECTRA इस तुलना में स्पष्ट विजेता के रूप में उभरा। अध्ययन इस बात की पुष्टि करता है कि हालांकि आर्टिफिशियल इंटेलिजेंस अब इन कार्यों को लगभग पूर्ण सटीकता के साथ संभाल सकता है, सफल स्वचालन की कुंजी सटीक उपकरण का चुनाव करने में निहित है, जो सटीकता की आवश्यकता और गति की आवश्यकता के बीच संतुलन बनाता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।