Beyond Logprobs: A Multi-Signal Confidence Engine for LLM-Based Document Field Extraction
यह शोधपत्र ExtractConf को प्रस्तुत करता है, जो एक क्रॉस-डोमेन कॉन्फिडेंस इंजन है जो दो संरचनात्मक रूप से भिन्न निष्कर्षण रणनीतियों (एक फील्ड-गाइडेड "हंटर" और एक डॉक्यूमेंट-गाइडेड "मैपर") के संकेतों को इमेज और लेआउट फीचर्स के साथ जोड़कर LLM-आधारित डॉक्यूमेंट फील्ड एक्सट्रैक्शन की विश्वसनीयता में महत्वपूर्ण सुधार करता है, जिससे विश्वसनीय निष्कर्षणों को मतिभ्रम (hallucinations) से प्रभावी ढंग से अलग किया जा सके, और इस प्रकार सुरक्षित ह्यूमन-इन-द-लूप ऑटोमेशन को सक्षम बनाया जा सके।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक व्यस्त फैक्ट्री चला रहे हैं जो हर दिन हजारों व्यावसायिक दस्तावेजों, जैसे कि इनवॉइस (invoices) और रसीदों को प्रोसेस करती है। आपने एक सुपर-स्मार्ट AI रोबोट (एक LLM) को काम पर रखा है जो इन दस्तावेजों को पढ़कर कुछ विशिष्ट नंबर निकाल सकता है, जैसे कि "कुल राशि" (Total Amount) या "टैक्स आईडी" (Tax ID)।
समस्या क्या है? कभी-कभी रोबोट गलती कर देता है। वह आत्मविश्वास के साथ एक ऐसा नंबर लिख सकता है जो मौजूद ही नहीं है, या किसी धुंधले निशान को शून्य (zero) समझ सकता है। एक उच्च-जोखिम वाली फैक्ट्री में, एक "साइलेंट मिस्टेक" (जहाँ रोबोट गलत उत्तर देता है लेकिन ऐसा व्यवहार करता है जैसे वह पूरी तरह निश्चित हो) उस स्थिति से भी बदतर है जहाँ रोबोट बस यह कह दे, "मैं इसे पढ़ नहीं सकता।"
यह पेपर EXTRACTCONF नामक एक नई प्रणाली पेश करता है। इसे केवल एक बेहतर 'रीडर' के रूप में नहीं, बल्कि एक सुपर-स्मार्ट क्वालिटी कंट्रोल इंस्पेक्टर के रूप में समझें जो रोबोट के बगल में खड़ा होकर यह निर्णय लेता है: "क्या हम इस उत्तर पर भरोसा कर सकते हैं, या हमें इसे जांचने के लिए किसी इंसान के पास भेजना चाहिए?"
यह कैसे काम करता है, इसे सरल अवधारणाओं में यहाँ दिया गया है:
1. "दो-सिर वाली" रणनीति (शिकारी बनाम मैपर)
अधिकांश सिस्टम AI से एक ही सवाल पूछते हैं: "कुल राशि क्या है?" यदि AI अनुमान लगाता है, तो वह गलत हो सकता है।
EXTRACTCONF AI को दस्तावेज़ को दो बार पढ़ने के लिए कहता है, लेकिन दो बिल्कुल अलग तरीकों से:
- द हंटर (The Hunter - शिकारी): यह एक जासूस की तरह है जो एक विशिष्ट संदिग्ध की तलाश कर रहा है। इसे कहा जाता है, " 'कुल राशि' वाले फील्ड को खोजो।" क्योंकि यह उस विशिष्ट स्थान को खोजने के दबाव में होता है, इसलिए यदि फील्ड धुंधला या गायब है, तो यह गलती से "हैलुसिनेट" (मनगढ़ंत नंबर बनाना) कर सकता है।
- द मैपर (The Mapper - मैपर): यह एक पर्यटक की तरह है जो एक मानचित्र देख रहा है। इसे कहा जाता है, "पूरे दस्तावेज़ को स्कैन करें और मुझे बताएं कि आपको कौन से महत्वपूर्ण नंबर दिख रहे हैं।" यह केवल वही रिपोर्ट करता है जो यह वास्तव में देखता है। यदि "कुल राशि" गायब है या धुंधली है, तो मैपर चुप रहता है।
जादुई बात: यदि शिकारी कहता है "कुल राशि 500" पर सहमत हैं, तो सिस्टम बहुत अधिक आश्वस्त महसूस करता है। यह "असहमति" एक बड़ा संकेत है कि कागज पढ़ने में कठिन है या उत्तर पेचीदा है।
2. सिर्फ रोबोट को नहीं, बल्कि कागज को देखना
पेपर का तर्क है कि रोबोट का आत्मविश्वास (कि वह कितना निश्चित महसूस करता है) अक्सर एक झूठ होता है। यदि कागज धुंधला है, तो रोबोट अभी भी गलत उत्तर के बारे में बहुत आश्वस्त हो सकता है।
इसलिए, EXTRACTCONF केवल रोबोट की बात नहीं सुनता। यह यह भी जाँचता है:
- "कैमरा" (OCR): वास्तविक इमेज पर टेक्स्ट कितना स्पष्ट है? यदि कैमरा एक धब्बे को देखता है, तो सिस्टम जानता है कि उत्तर जोखिम भरा है, भले ही रोबोट कहे कि वह 100% निश्चित है।
- "मैप" (स्थानिक लेआउट): रोबोट ने कहाँ देखा? यदि शिकारी ने ऊपर-बाएँ कोने को देखा और मैपर ने नीचे-दाएँ कोने को देखा, तो वे अलग-अलग चीजों को देख रहे हैं। यह एक चेतावनी का संकेत (red flag) है।
- "टेक्सचर" (इमेज क्वालिटी): क्या कागज का वह विशिष्ट क्षेत्र जहाँ नंबर होना चाहिए, धुंधला या फीका है?
3. अंतिम फैसला
इन सभी सुरागों को (दो अलग-अलग रीडिंग, कैमरा क्वालिटी, स्थान और रोबोट का आंतरिक आत्मविश्वास) एक ट्रैफिक लाइट सिस्टम में डाला जाता है।
- ग्रीन लाइट (हरी बत्ती): रोबोट और इंस्पेक्टर सहमत हैं, कागज स्पष्ट है, और स्थान समझ में आता है। इसे ऑटोमेट करें! (इसे कंप्यूटर के पास भेजें)।
- रेड लाइट (लाल बत्ती): रोबोट और इंस्पेक्टर असहमत हैं, या कागज धुंधला है। रुकें! (इसे जांचने के लिए इंसान के पास भेजें)।
उन्होंने क्या पाया?
शोधकर्ताओं ने हजारों वास्तविक इनवॉइस पर इसका परीक्षण किया। यहाँ क्या हुआ:
- पुराना तरीका: यदि वे केवल रोबोट के "कॉन्फिडेंस स्कोर" पर भरोसा करते, तो सिस्टम लगभग सब कुछ ऑटोमेट करने की कोशिश करता, जिसमें गलतियाँ भी शामिल होतीं। यह एक ऐसी ट्रैफिक लाइट की तरह होता जो हमेशा हरी बत्ती पर अटकी रहती है।
- नया तरीका (EXTRACTCONF): "दो-सिर वाली" रणनीति और कागज की गुणवत्ता की जाँच करके, वे गलत उत्तरों को फ़िल्टर कर सके।
- जब उन्होंने "ग्रीन लाइट" वाले उत्तरों को ऑटोमेट करने दिया, तो 99.1% सही थे।
- बिना इस सिस्टम के, रोबोट केवल 73.3% बार सही था।
- उन्होंने पुराने तरीकों की तुलना में गलती करने के जोखिम को 70% तक कम कर दिया।
"जीरो-शॉट" सरप्राइज
सबसे दिलचस्प बात यह है कि उन्होंने इस सिस्टम को इनवॉइस पर प्रशिक्षित किया, और फिर इसे रसीदों (बिल्कुल अलग प्रकार का कागज) पर टेस्ट किया, बिना इसे कुछ नया सिखाए। यह उतना ही अच्छा काम करता है। यह साबित करता है कि सिस्टम केवल यह याद नहीं कर रहा है कि इनवॉइस कैसा दिखता है; बल्कि यह वास्तव में यह सीख रहा है कि यह कैसे पहचाना जाए कि कोई भी दस्तावेज़ पढ़ने में कठिन है।
संक्षेप में
EXTRACTCONF एक सुरक्षा जाल (safety net) है। यह AI को बेहतर ढंग से पढ़ने के लिए प्रशिक्षित नहीं करता; इसके बजाय, यह एक स्मार्ट जज बनाता है जो जानता है कि AI कब अनुमान लगा रहा है और कब वह वास्तव में सच्चाई देख रहा है। यह आसान चीजों को ऑटोमेट करके और कठिन चीजों को इंसानों के पास भेजकर पैसा बचाता है, जिससे यह सुनिश्चित होता है कि कोई भी गलत नंबर दरारों से बाहर न निकल पाए।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।