← नवीनतम पेपर
🤖 AI

DocVAL: Validated Chain-of-Thought Distillation for Grounded Document VQA

DocVAL एक वैलिडेटेड चेन-ऑफ-थॉट डिस्टिलेशन फ्रेमवर्क है जो एक नियम-आधारित ड्यूल-मोड वैलिडेटर और इटरेटिव रिफाइनमेंट का उपयोग करके बड़े टीचर मॉडल्स से स्पष्ट स्थानिक तर्क (स्पेशियल रीजनिंग) को कॉम्पैक्ट स्टूडेंट VLMs में स्थानांतरित करता है, जिससे बिना इन्फरेंस के OCR के उपयोग के डॉक्यूमेंट VQA के लिए उत्तर सटीकता और पिक्सेल-लेवल लोकलाइजेशन दोनों में महत्वपूर्ण सुधार प्राप्त होता है।

मूल लेखक: Ahmad Mohammadshirazi, Pinaki Prasad Guha Neogi, Ser-Nam Lim, Rajiv Ramnath

प्रकाशित 2026-04-17
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ahmad Mohammadshirazi, Pinaki Prasad Guha Neogi, Ser-Nam Lim, Rajiv Ramnath

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक छात्र हैं जो किसी जटिल और अव्यवस्थित दस्तावेज़—जैसे कि रसीद, मेडिकल बिल, या कानूनी अनुबंध—में विशिष्ट जानकारी ढूँढना सीख रहे हैं। आपको दो काम करने की आवश्यकता है:

  1. प्रश्न का सही उत्तर दें (जैसे, "कुल राशि क्या है?")।
  2. ठीक से बताएं कि वह उत्तर पृष्ठ पर कहाँ है (जैसे, "यह नीचे दाहिने कोने में, इस लाल बॉक्स के अंदर है")।

यह डॉक्यूमेंट विजुअल क्वेश्चन अनस्विंग (VQA) की चुनौती है।

समस्या: "जीनियस" बनाम "स्पीडस्टर"

वर्तमान में, इस काम के लिए हमारे पास दो प्रकार के AI मॉडल हैं:

  • "जीनियस" (बड़े मॉडल): ये एक बुद्धिमान प्रोफेसर की तरह हैं। वे दस्तावेज़ को पढ़ सकते हैं, उत्तर ढूँढ सकते हैं और पूर्ण सटीकता के साथ सटीक स्थान की ओर इशारा कर सकते हैं। लेकिन वे धीमे हैं, महंगे हैं, और उन्हें चलाने के लिए एक सुपरकंप्यूटर की आवश्यकता होती है। आप उन्हें फोन या छोटे सर्वर पर नहीं डाल सकते।
  • "स्पीडस्टर" (कॉम्पैक्ट मॉडल): ये चतुर इंटर्न की तरह हैं। वे तेज़ हैं, सस्ते हैं और कहीं भी चल सकते हैं। लेकिन जब आप उन्हें उत्तर की ओर इशारा करने के लिए कहते हैं, तो वे अक्सर अनुमान लगाते हैं। वे सही नंबर तो बता सकते हैं, लेकिन गलत लाइन की ओर इशारा कर सकते हैं, या वे "हैलुसिनेट" (भ्रमित होना/मनगढ़ंत जानकारी देना) कर सकते हैं।

उद्योग में बड़ा अंतर यह है: हम "स्पीडस्टर" को "जीनियस" जितना सटीक बनाने के लिए क्या करें, बिना उसकी गति कम किए?

समाधान: DocVAL (एक "वेरिफाइड ट्यूटर" सिस्टम)

लेखकों ने DocVAL नामक एक नई विधि बनाई है। इसे एक विशेष प्रशिक्षण शिविर के रूप में समझें जहाँ "स्पीडस्टर" "जीनियस" से सीखता है, लेकिन एक सख्त गुणवत्ता नियंत्रण प्रणाली के साथ।

यह इस प्रकार काम करता है (एक सरल उपमा का उपयोग करते हुए):

चरण 1: "जीनियस" एक स्टडी गाइड लिखता है

सबसे पहले, बड़ा "जीनियस" मॉडल एक दस्तावेज़ को देखता है और अपनी विचार प्रक्रिया को चरण-दर-चरण लिखता है (इसे चेन-ऑफ-थॉट कहा जाता है)।

  • सामान्य AI: बस कहता है, "उत्तर $50 है।"
  • DocVAL का जीनियस: कहता है, "मैं नीचे के पास 'Total' शब्द देख रहा हूँ। मैं उसके ठीक बगल में संख्या '50' देख रहा हूँ। मैं इन दोनों के चारों ओर एक बॉक्स बनाऊँगा ताकि आपको दिखा सकूँ कि मैंने इसे कहाँ पाया।"

चरण 2: "रूलबुक इंस्पेक्टर" (द वैलिडेटर)

यही असली सफलता का मंत्र है। इससे पहले कि "स्पीडस्टर" "जीनियस" से सीखे, एक सख्त रूलबुक इंस्पेक्टर (जिसे VAL कहा जाता है) जीनियस के काम की जाँच करता है।

  • इंस्पेक्टर केवल अनुमान नहीं लगाता; वह कठोर नियमों का उपयोग करता है (जैसे एक गणित का शिक्षक उत्तर कुंजी की जाँच करता है)।
  • वह पूछता है: "क्या जीनियस ने वास्तव में सही शब्द ढूँढा? क्या बॉक्स सही पिक्सेल के चारों ओर बनाया गया है? क्या तर्क तार्किक है?"
  • यदि जीनियस ने गलती की (जैसे, गलत लाइन की ओर इशारा किया), तो इंस्पेक्टर उस उदाहरण को फेंक देता है या उसे एक नोट के साथ सुधार देता है: "आपने 'Tax' शब्द छोड़ दिया; बॉक्स को 5 पिक्सेल बाईं ओर ले जाएँ।"

यह क्यों महत्वपूर्ण है? आमतौर पर, जब हम AI को सिखाते हैं, तो हम बस उस पर डेटा का एक विशाल ढेर डाल देते हैं, इस उम्मीद में कि वह सीख जाएगा। लेकिन यदि डेटा गलतियों से भरा है, तो छात्र गलतियाँ सीखेगा। DocVAL कहता है, "नहीं! केवल पूरी तरह से सत्यापित उदाहरण ही छात्र तक पहुँचेंगे।"

चरण 3: "स्पीडस्टर" सीखता है और सुधार करता है

"स्पीडस्टर" (छोटा मॉडल) इस साफ, सत्यापित, उच्च-गुणवत्ता वाले डेटा पर प्रशिक्षित होता है।

  • चरण 1: यह जीनियस की चरण-दर-चरण तर्क प्रक्रिया की नकल करना सीखता है।
  • चरण 2: यह अभ्यास करता है, और इंस्पेक्टर इसे इसकी गलतियों पर फीडबैक देता है। मॉडल उन विशिष्ट त्रुटियों को ठीक करने के लिए खुद को अपडेट करता है।

परिणाम: एक सुपर-इंटर्न

प्रशिक्षण के बाद, "स्पीडस्टर" एक शुद्ध VLM बन जाता है।

  • यह एक दस्तावेज़ को देख सकता है और कह सकता है, "कुल राशि $50 है," और इसके चारों ओर एक सटीक बॉक्स बना सकता है।
  • महत्वपूर्ण बात: इसे अब "जीनियस" की आवश्यकता नहीं है। इसे टेक्स्ट पढ़ने (OCR) या बॉक्स खोजने के लिए बाहरी उपकरणों की आवश्यकता नहीं है। इसने यह सब अपने दिमाग के भीतर ही करना सीख लिया है, केवल सत्यापित उदाहरणों का अध्ययन करके।

यह क्यों मायने रखता है (द "आहा!" मोमेंट)

यह पेपर एक आश्चर्यजनक तथ्य सिद्ध करता है: गुणवत्ता, मात्रा से बेहतर है।

  • यदि आप एक मॉडल को 100,000 अस्त-व्यस्त, unverifed उदाहरणों पर प्रशिक्षित करते हैं, तो यह भ्रमित हो जाता है और गलत स्थानों की ओर इशारा करता है।
  • यदि आप इसे 95,000 पूरी तरह से जाँचे गए उदाहरणों पर प्रशिक्षित करते हैं, तो यह अविश्वसनीय रूप से सटीक हो जाता है।

उन्होंने सफलता को मापने का एक नया तरीका भी पेश किया है। केवल यह पूछने के बजाय कि "क्या आपने सही नंबर प्राप्त किया?" (जो आसान है), वे अब पूछते हैं "क्या आपने सही स्थान की ओर इशारा किया?" (जो कठिन है)। वे इसे mAP (मीन एवरेज प्रिसिजन) कहते हैं, जो छात्र को केवल उत्तर के लिए नहीं, बल्कि अपना काम दिखाने की उसकी क्षमता के लिए ग्रेड देने जैसा है।

संक्षेप में सारांश

DocVAL एक ऐसी विधि है जो छोटे, तेज़ AI मॉडल को दस्तावेज़ों में चीजों को अत्यंत सटीकता के साथ ढूँढना सिखाती है। यह इसे निम्नलिखित तरीके से करता है:

  1. एक बड़े, स्मार्ट मॉडल से यह समझाना कि वह चीजें कैसे ढूँढता है।
  2. यह सुनिश्चित करने के लिए एक सख्त रोबोट इंस्पेक्टर का उपयोग करना कि वे स्पष्टीकरण 100% सही हैं।
  3. छोटे मॉडल को केवल उन पूर्ण स्पष्टीकरणों पर प्रशिक्षित करना।

परिणामस्वरूप, एक तेज़, सस्ता AI मिलता है जिसे आप फोन या सर्वर पर रख सकते हैं, जो दस्तावेज़ों में जानकारी खोजने में इतना सक्षम है कि बैंकिंग, स्वास्थ्य सेवा और कानून जैसे उच्च-जोखिम वाले कार्यों में उस पर भरोसा किया जा सकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →