← नवीनतम पेपर
💻 computer science

DocAnnot -- Accelerating the Creation of Key Information Extraction Datasets with GenAI-Powered Auto-annotation

DocAnnot एक GenAI-संचालित फ्रेमवर्क है जो लार्ज विजन लैंग्वेज मॉडल्स, OCR और एक नवीन स्पेशियली इन्फॉर्म्ड कॉन्टेक्स्टुअल मैचिंग एल्गोरिदम को जोड़कर की-इन्फॉर्मेशन एक्सट्रैक्शन डेटासेट निर्माण को गति प्रदान करता है, जिससे उच्च-गुणवत्ता वाले ऑटो-एनोटेशन उत्पन्न होते हैं जो मैन्युअल प्रयास को महत्वपूर्ण रूप से कम करते हुए प्रभावी डाउनस्ट्रीम मॉडल ट्रेनिंग को सक्षम बनाते हैं।

मूल लेखक: Siddartha Reddy, Harikrishnan P M, Goutham Vignesh, Varun V, Vishal Vaddina

प्रकाशित 2026-07-29
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Siddartha Reddy, Harikrishnan P M, Goutham Vignesh, Varun V, Vishal Vaddina

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को एक बिखरे हुए, हाथ से लिखे रसीद या एक जटिल बीमा फॉर्म को पढ़ना सिखाने की कोशिश कर रहे हैं। आप चाहते हैं कि रोबोट "Total" (कुल राशि), "Date" (तारीख), और "Store Name" (दुकान का नाम) को ढूँढे और उन्हें एक साफ सूची में लिख दे। इसे Key Information Extraction (KIE) कहा जाता है। लंबे समय तक, रोबोट को यह ट्रिक सिखाने का एकमात्र तरीका यह था कि एक इंसान हजारों दस्तावेजों में से हर एक शब्द और नंबर को मैन्युअल रूप से इंगित करे। यह लाखों रसीदों से डेटा को कॉपी-पेस्ट करने के लिए लोगों की एक टीम को काम पर रखने जैसा है—जो धीमा, महंगा और उबाऊ है।

हाल ही में, एक नए प्रकार के सुपर-स्मार्ट कंप्यूटर दिमाग, जिसे Large Vision Language Model (LVLM) कहा जाता है, का आगमन हुआ है। इसे एक ऐसे रोबोट के रूप में सोचें जो न केवल टेक्स्ट पढ़ सकता है बल्कि दस्तावेज़ की तस्वीर को भी "देख" सकता है, जिससे वह समझ पाता है कि पेज पर शब्दों की व्यवस्था कैसी है। हालांकि, ये रोबोट अभी भी थोड़े अति-उत्साही इंटर्न की तरह हैं: वे कहानी समझने में तो बहुत अच्छे हैं लेकिन कभी-कभी इस बात को लेकर भ्रमित हो जाते हैं कि ठीक कौन सा नंबर किस लेबल का है, या वे ऐसी बातें बना सकते हैं जो वहां मौजूद ही नहीं हैं (एक घटना जिसे "hallucinating" या मतिभ्रम कहा जाता है)। बड़ा सवाल जो वैज्ञानिक पूछ रहे हैं, वह यह है: क्या हम इन स्मार्ट रोबोट्स का उपयोग हमारे लिए डेटा को लेबल करने के काम के लिए कर सकते हैं, ताकि हम अन्य रोबोटों को तेजी से और सस्ते में प्रशिक्षित कर सकें, बिना किसी इंसान द्वारा हर एक लाइन की जांच किए?

यही वह जगह है जहाँ DocAnnot नामक शोध पत्र काम आता है। शोधकर्ताओं ने एक नया सिस्टम बनाया है जो प्रशिक्षण डेटा (training data) बनाने के लिए एक सुपर-एफिशिएंट असेंबली लाइन की तरह काम करता है। शब्दों के चारों ओर बॉक्स बनाने के लिए इंसान द्वारा हाथ से निशान लगाने के बजाय, उनका सिस्टम इसे स्वचालित रूप से करने के लिए तीन चरणों वाले एक नृत्य (dance) का उपयोग करता है। पहले, एक "विज़न रोबोट" (LVLM) दस्तावेज़ को देखता है और अनुमान लगाता है कि महत्वपूर्ण लेबल और वैल्यू क्या हैं, जैसे कि "Total" को ढूँढना और उसके बगल में लिखी संख्या को पहचानना। दूसरा, एक क्लासिक "टेक्स्ट स्कैनर" (OCR) पेज पर मौजूद हर एक शब्द को पढ़ता है और प्रत्येक शब्द के स्थान के चारों ओर एक सटीक बॉक्स बनाता है।

यहीं पर जादू होता है: तीसरा चरण, एक नया एल्गोरिदम जिसे SICM (Spatially Informed Contextual Matching) कहा जाता है। कल्पना कीजिए कि विज़न रोबोट कहता है, "कुल राशि 100 डॉलर है," लेकिन टेक्स्ट स्कैनर देखता है कि पेज पर "100" नंबर तीन बार आया है। सिस्टम को कैसे पता चलेगा कि कौन सा "100" सही वाला है? SICM एल्गोरिदम एक स्केल (रूलर) का उपयोग करने वाले जासूस की तरह काम करता है। यह उस "Key Text" (मुख्य शब्द) को देखता है जिसे विज़न रोबोट ने पाया है, सभी संभावित "100" की दूरी को मापता है, और उस एक को चुनता है जो "Total" शब्द के भौतिक रूप से सबसे करीब है। यह रोबोट के "दिमाग" (अर्थ समझने की क्षमता) को एक "स्केल" (लेआउट समझने की क्षमता) के साथ जोड़ता है ताकि सही चुनाव किया जा सके।

टीम ने इस सिस्टम का परीक्षण दो प्रसिद्ध रसीद डेटा सेट्स पर किया, जिन्हें CORD और SROIE कहा जाता है। परिणाम उत्साहजनक थे लेकिन पूर्ण नहीं। जब सिस्टम ने रसीदों को अपने आप लेबल करने की कोशिश की, तो CORD डेटासेट पर इसकी सटीकता स्कोर (जिसे F1-score कहा जाता है) लगभग 0.679 और SROIE डेटासेट पर 0.846 था। इसे समझने के लिए, एक मानव विशेषज्ञ का स्कोर 0.9 या उससे अधिक होगा, इसलिए रोबोट अच्छा है, लेकिन अभी तक पूर्ण नहीं है।

हालांकि, असली आश्चर्य तब आया जब उन्होंने इन रोब-निर्मित लेबल्स का उपयोग एक नए, छोटे रोबोट को प्रशिक्षित करने के लिए किया। उन्होंने पूछा: "यदि हम केवल DocAnnot द्वारा बनाए गए डेटा पर एक मॉडल को प्रशिक्षित करते हैं, तो क्या वह अभी भी सीख सकता है?" उत्तर एक सतर्क "हाँ" था। पूरी तरह से ऑटो-एनोटेटेड डेटा पर प्रशिक्षित एक मॉडल ने CORD टेस्ट सेट पर 0.6765 का स्कोर प्राप्त किया। जबकि यह मानव-निर्मित सटीक डेटा पर प्रशिक्षित मॉडल (जिसने 0.9141 स्कोर किया था) से कम है, यह एक सम्मानजनक प्रदर्शन है जो बताता है कि आपको सिस्टम चलाने के लिए हर दस्तावेज़ को लेबल करने के लिए इंसानों की आवश्यकता नहीं है।

शोध पत्र यह भी सुझाव देता है कि उनके सिस्टम का "Spatially Informed" (स्थानिक रूप से सूचित) हिस्सा अत्यंत महत्वपूर्ण है। जब उन्होंने "रूलर" (SICM एल्गोरिदम) के बिना सिस्टम चलाया, तो CORD डेटासेट पर उनकी सटीकता काफी गिर गई, 0.679 से घटकर 0.571 रह गई। यह साबित करता है कि केवल एक स्मार्ट रोबोट होना ही काफी नहीं है; आपको यह जानने के लिए स्थानिक तर्क (spatial logic) की आवश्यकता है कि कौन सा शब्द किस लेबल का है।

अंत में, शोधकर्ताओं ने एक "हाइब्रिड" दृष्टिकोण आजमाया। उन्होंने रोबोट के काम को बस थोड़े से मानवीय सहयोग के साथ मिलाया—विशेष रूप से, उन्होंने रोबोट के डेटा में 10%, 20%, या 30% मानव-लेबल वाला डेटा जोड़ा। इस छोटे से उछाल ने प्रदर्शन को ऊपर धकेल दिया, जिसमें केवल 30% मानवीय मदद के साथ F1-स्कोर बढ़कर 0.7241 हो गया। यह सुझाव देता है कि भविष्य सबसे अच्छा "पूरी तरह से रोबोट" या "पूरी तरह से इंसान" नहीं होगा, बल्कि एक ऐसी टीम होगी जहाँ रोबोट भारी काम करेगा और इंसान बस कठिन हिस्सों को ठीक करने के लिए हस्तक्षेप करेगा।

संक्षेप में, DocAnnot यह दावा नहीं करता कि उसने पूर्ण स्वचालन (automation) की समस्या को हल कर लिया है। इसके बजाय, यह एक व्यावहारिक, लागत बचाने वाला उपकरण प्रदान करता है जो मॉडलों को प्रशिक्षित करने के लिए "पर्याप्त अच्छा" डेटा उत्पन्न कर सकता है, या एक शक्तिशाली सहायक के रूप में काम कर सकता है जो इंसानों के उबाऊ कागजी काम के समय को कम कर देता है। यह दस्तावेज़ प्रसंस्करण को तेज़ और सस्ता बनाने की दिशा में एक कदम है, भले ही हमें काम को दोबारा जांचने के लिए अभी भी एक इंसान की आवश्यकता हो।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →