← नवीनतम पेपर
💬 NLP

A System for Name and Address Parsing with Large Language Models

यह शोधपत्र एक प्रॉम्प्ट-संचालित, सत्यापन-केंद्रित ढांचे को प्रस्तुत करता है जो इनपुट सामान्यीकरण, बाधित डिकोडिंग और सख्त नियम-आधारित सत्यापन को एकीकृत करके, फाइन-ट्यूनिंग के बिना बड़े भाषा मॉडल (लार्ज लैंग्वेज मॉडल्स) का लाभ उठाते हुए, असंरचित नाम और पते वाले टेक्स्ट को विश्वसनीय रूप से एक सुसंगत 17-क्षेत्रों वाले स्कीमा में परिवर्तित करता है।

मूल लेखक: Adeeba Tarannum, Muzakkiruddin Ahmed Mohammed, Mert Can Cakmak, Shames Al Mandalawi, John Talburt

प्रकाशित 2026-01-27
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Adeeba Tarannum, Muzakkiruddin Ahmed Mohammed, Mert Can Cakmak, Shames Al Mandalawi, John Talburt

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास हाथ से लिखे पत्रों का एक विशाल, अस्त-व्यस्त ढेर है। कुछ अंग्रेजी में लिखे हैं, कुछ स्पेनिश में, कुछ में स्याही फैली हुई है, और कुछ में कॉमा गायब है या "123 Main St Apt 4B" को "123MainStApt4B" की तरह गलत तरीके से लिखा गया है। आपका लक्ष्य इस अराजक ढेर को एक व्यवस्थित स्प्रेडशीट में बदलना है जहाँ जानकारी का हर हिस्सा (नाम, सड़क, शहर, ज़िप कोड) अपने विशिष्ट कॉलम में हो।

यह दस्तावेज़ बताता है कि इस काम को करने का एक नया तरीका क्या है, जिसमें एक बहुत ही स्मार्ट कंप्यूटर दिमाग (जिसे लार्ज लैंग्वेज मॉडल या LLM कहा जाता है) का उपयोग किया जाता है, लेकिन इसमें एक ट्विस्ट है: कंप्यूटर को शून्य से एक नई भाषा सिखाने के बजाय (जो कि एक नए कर्मचारी को काम पर रखने और उसे महीनों तक प्रशिक्षित करने जैसा है), लेखकों ने इसके चारों ओर एक सख्त "चेकलिस्ट और सुपरवाइजर" प्रणाली बनाई है।

यहाँ बताया गया है कि उनका सिस्टम कैसे काम करता है, जिसे सरल चरणों में विभाजित किया गया है:

1. "प्रेप शेफ" (इनपुट नॉर्मलाइजेशन)

स्मार्ट कंप्यूटर के डेटा को देखने से पहले, एक "प्रेप शेफ" इसे साफ करता है।

  • समस्या: कच्चा डेटा अस्त-व्यस्त है। किसी ने "Ave." लिखा और किसी ने "Avenue."। किसी ने "N.E." लिखा और किसी ने "NE."।
  • समाधान: सिस्टम स्वचालित रूप से सब कुछ मानकीकृत (standardize) कर देता है। यह सभी संक्षिप्त शब्दों (abbreviations) को पूरे शब्दों में बदल देता है, कैपिटलाइजेशन ठीक करता है, और अजीब प्रतीकों को हटा देता है। यह एक शेफ की तरह है जो खाना पकाने से पहले सभी सब्जियों को बिल्कुल एक ही आकार में काट देता है, ताकि रेसिपी हर बार सही ढंग से काम करे।

2. "सख्त रेसिपी" (प्रॉम्प्ट असेंबली)

कंप्यूटर दिमाग को अंदाज़ा लगाने देने के बजाय, लेखक उसे एक बहुत ही विशिष्ट, अपरिवर्तनीय रेसिपी कार्ड देते हैं।

  • समस्या: यदि आप बस एक स्मार्ट कंप्यूटर से पूछते हैं, "यह एक पता है, इसके हिस्से बताओ," तो वह तथ्य बना सकता है या हर बार अलग प्रारूप में उत्तर दे सकता है।
  • समाधान: रेसिपी कार्ड कहता है: "आप एक विशेषज्ञ पार्सर हैं। आपको ठीक 17 फील्ड्स इसी क्रम में आउटपुट करने होंगे। यदि आप कुछ नहीं जानते हैं, तो उसे खाली छोड़ दें। डेटा खुद से न बनाएं।" यह एक रोबोट को सख्त असेंबली मैनुअल देने जैसा है: "पेच यहाँ लगाएं, बोल्ट वहाँ लगाएं। अपनी मर्जी से कुछ न करें।"

3. "असेंबली लाइन" (कन्स्ट्रेंड इन्फरेंस)

कंप्यूटर डेटा को छोटे, निश्चित समूहों (16 के बैच) में प्रोसेस करता है, ठीक वैसे ही जैसे एक असेंबली लाइन एक बार में 16 कारों को आगे बढ़ाती है।

  • लक्ष्य: यह सुनिश्चित करता है कि कंप्यूटर "रचनात्मक" न हो जाए या थके नहीं। यह सेटिंग्स को लॉक रखता है ताकि यदि आप एक ही काम को दो बार चलाएं, तो आपको बिल्कुल वही परिणाम मिले। यह एक फैक्ट्री मशीन की तरह है जिसकी गति या सेटिंग्स कभी नहीं बदलतीं।

4. "क्वालिटी कंट्रोल इंस्पेक्टर" (वैलिडेशन)

कंप्यूटर अपना काम पूरा करने के बाद, एक सख्त "क्वालिटी कंट्रोल इंस्पेक्टर" हर एक लाइन की जांच करता है।

  • नियम:
    • क्या ज़िप कोड राज्य (State) से मेल खाता है? (उदाहरण के लिए, कैलिफोर्निया का ज़िप कोड न्यूयॉर्क में नहीं हो सकता)।
    • क्या कंप्यूटर ने ऐसी सड़क का नाम बना लिया जो अस्तित्व में ही नहीं है?
    • क्या ठीक 17 फील्ड्स हैं?
  • परिणाम: यदि कंप्यूटर कोई गलती करता है, तो इंस्पेक्टर उसे तुरंत पकड़ लेता है। यदि कंप्यूटर अनिश्चित है, तो सिस्टम इसे बाद में इंसान द्वारा देखे जाने के लिए फ्लैग (चिह्नित) कर देता है। यह सुनिश्चित करता है कि अंतिम स्प्रेडशीट लगभग दोषरहित हो।

उन्होंने क्या पाया?

लेखकों ने 1,500 विभिन्न पते वाले रिकॉर्ड्स पर इस सिस्टम का परीक्षण किया, जिनमें अमेरिका, प्यूर्टो रिको और अन्य देशों के अस्त-व्यस्त रिकॉर्ड शामिल थे।

  • स्कोर: सिस्टम 99.8% बार सही रहा।
  • तुलना: यह पुराने, नियम-आधारित सिस्टम (जो कठोर निर्देश मैनुअल की तरह हैं) की तुलना में थोड़ा बेहतर प्रदर्शन करता है और इसे नए काम करने के लिए "री-ट्रेन" करने या नई चीजें सिखाने की आवश्यकता नहीं थी।
  • आत्मविश्वास: सिस्टम ने यह भी बताया कि वह अपने उत्तर के बारे में कितना आश्वस्त था। जब इसने 90%+ प्रतिशत दावे के साथ उत्तर दिया, तो यह लगभग हमेशा सही था।

मुख्य निष्कर्ष

लेखक तर्क देते हैं कि अस्त-व्यस्त डेटा को ठीक करने के लिए आपको महंगे, कस्टम AI मॉडल को प्रशिक्षित करने की आवश्यकता नहीं है। इसके बजाय, आप एक शक्तिशाली, रेडीमेड AI मॉडल का उपयोग कर सकते हैं और उसे एक सख्त, नियम-आधारित सुरक्षा जाल के भीतर रख सकते हैं।

इसे एक प्रतिभाशाली, रचनात्मक लेखक (AI) को टैक्स फॉर्म भरने के लिए काम पर रखने जैसा समझें। यदि आप उन्हें बस लिखने देंगे, तो वे नंबर खुद से बना सकते हैं। लेकिन यदि आप उन्हें सख्त बॉक्स, नियमों की एक चेकलिस्ट और एक सुपरवाइजर देते हैं जो सबमिट करने से पहले हर बॉक्स की जांच करता है, तो आपको हर बार एक परफेक्ट टैक्स फॉर्म मिलता है, बिना लेखक को टैक्स के बारे में शुरू से सिखाए।

यह दृष्टिकोण हर नए देश या भाषा के लिए AI को फिर से प्रशिक्षित किए बिना, अस्त-व्यस्त, वास्तविक दुनिया के टेक्स्ट को साफ, विश्वसनीय डेटा में तेजी से और सस्ते में बदलना संभव बनाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →