← नवीनतम पेपर
🤖 AI

Doc-CoB: Enhancing Document Understanding with Visual Chain-of-Boxes Reasoning

Doc-CoB एक ऐसा फ्रेमवर्क है जो एक 'कोर्स-टू-फाइन विजुअल चेन-ऑफ-बॉक्सेस' रीजनिंग रणनीति का उपयोग करके मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स में डॉक्यूमेंट अंडरस्टैंडिंग को बढ़ाता है, जो वैश्विक संदर्भ (ग्लोबल कॉन्टेक्स्ट) को सुरक्षित रखते हुए धीरे-धीरे क्वेरी-प्रासंगिक लेआउट क्षेत्रों पर ध्यान केंद्रित करता है, जिसे 249k प्रशिक्षण नमूनों के एक नए डेटासेट द्वारा समर्थित किया गया है।

मूल लेखक: Ye Mo, Kai Ye, Xianwei Mao, Zirui Shao, Gang Huang, Bo Zhang, Hangdi Xing, Kehan Chen, Huan Zhou, Zixu Yan, Jiajun Bu, Sheng Zhou

प्रकाशित 2026-05-27
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ye Mo, Kai Ye, Xianwei Mao, Zirui Shao, Gang Huang, Bo Zhang, Hangdi Xing, Kehan Chen, Huan Zhou, Zixu Yan, Jiajun Bu, Sheng Zhou

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप डिब्बों से भरे एक विशाल, बिखरे हुए गोदाम के अंदर किसी विशिष्ट जानकारी को खोजने की कोशिश कर रहे हैं। यह गोदाम एक दस्तावेज़ छवि (document image) है (जैसे कि कोई रसीद, फॉर्म, या रिपोर्ट), और वह "बिखराव" सारा अतिरिक्त टेक्स्ट, लोगो और रेखाएं हैं जो आपके प्रश्न के लिए प्रासंगिक नहीं हैं।

समस्या: "एक-बार में सब कुछ पढ़ने" की गलती (The "One-Pass" Mistake)

इन दस्तावेज़ों को पढ़ने की कोशिश करने वाले वर्तमान AI मॉडल ऐसे हैं जैसे कोई व्यक्ति गोदाम में प्रवेश करता है और एक ही समय में हर एक डिब्बे को पढ़ने की कोशिश करता है, यह मानकर कि सब कुछ समान रूप से महत्वपूर्ण है।

  • परिणाम: वे शोर (noise) से घबरा जाते हैं। यदि आप पूछते हैं, "आवेदक कहाँ रहता है?", तो AI किसी पास के पते से विचलित हो सकता है जो दिखने में समान है लेकिन वास्तव में किसी अन्य व्यक्ति का है, जिससे गलत उत्तर मिल सकता है।
  • दूसरा छोर: कुछ अन्य तरीके इसे ठीक करने के लिए बहुत अधिक ज़ूम इन करने की कोशिश करते हैं। यह एक अकेले डिब्बे को गोदाम से बाहर निकालने और उसे अलग से देखने जैसा है। आप यह संदर्भ खो देते हैं कि वह डिब्बा बाकी सब के सापेक्ष कहाँ स्थित है, जो दस्तावेज़ को समझने के लिए अक्सर महत्वपूर्ण होता है।

समाधान: Doc-CoB (चेन-ऑफ़-बॉक्सेस)

यह शोध पत्र Doc-CoB पेश करता है, जो AI को दस्तावेज़ पढ़ने का तरीका सिखाने का एक नया तरीका है। Doc-CoB को एक स्मार्ट जासूस के रूप में सोचें जो केवल अनुमान लगाने के बजाय, रहस्य को सुलझाने के लिए दो-चरणीय प्रक्रिया का उपयोग करता है।

चरण 1: "हाइलाइटर" चरण (मुख्य बॉक्स चयन - Key Box Selection)

पूरे पेज को एक साथ पढ़ने के बजाय, AI पहले पूरे दस्तावेज़ को देखता है और हर विशिष्ट अनुभाग (जैसे पैराग्राफ, टेबल, या फॉर्म फील्ड) पर एक क्रमांकित स्टिकर (numbered sticker) लगा देता है।

  • जासूस की चाल: AI से पूछा जाता है, "इन क्रमांकित स्टिकरों में से कौन से प्रासंगिक हैं?"
  • उपमा: यह एक शिक्षक द्वारा छात्र से एक लंबे निबंध में तीन सबसे महत्वपूर्ण वाक्यों को गोला लगाने के लिए कहने जैसा है, इससे पहले कि वह क्विज़ के प्रश्न का उत्तर दे। AI अभी तक पूरे निबंध को गहराई से नहीं पढ़ता है; यह केवल उम्मीदवारों की पहचान करता है।

चरण 2: "ज़ूम-इन" चरण (केंद्रित उत्तर देना - Focused Answering)

एक बार जब AI ने प्रासंगिक क्रमांकित बॉक्स चुन लिए हों, तो वह मूल छवि पर वापस जाता है। इस बार, वह केवल उन चयनित बॉक्सों के चारों ओर लाल बॉर्डर खींचता है, लेकिन पृष्ठभूमि में पूरा पेज दिखाई देता रहता है।

  • जासूस की चाल: अब AI को प्रश्न का उत्तर देने के लिए कहा जाता है, लेकिन उसे बताया जाता है, "इन लाल बॉक्सों पर विशेष ध्यान दें।"
  • उपमा: यह एक लंबे निबंध के घेरे गए वाक्यों पर आवर्धक लेंस (magnifying glass) रखने जैसा है, जबकि बाकी पेज भी दिखाई दे रहा हो। यह AI को उत्तर के विवरणों को पढ़ने की अनुमति देता है बिना स्थानिक संदर्भ (spatial context) खोए (जैसे, यह जानना कि उत्तर "ऊपरी दाएं" कोने में है)।

प्रशिक्षण: जासूस को सिखाना

इसे काम करने के योग्य बनाने के लिए, शोधकर्ताओं को केवल AI की मौजूदा बुद्धिमत्ता पर भरोसा नहीं किया जा सकता था। उन्हें इसे विशेष रूप से एक जासूस बनने के लिए प्रशिक्षित करना पड़ा।

  • "बॉक्स पहचान" कार्य (The "Box Recognition" Task): उन्होंने AI को स्क्रीन पर एक विशिष्ट बॉक्स को उसके नंबर (ID) के साथ मिलाने के लिए सिखाया। यह एक बच्चे को "बॉक्स नंबर 5" की ओर इशारा करने के लिए कहने जैसा है।
  • "बॉक्स तर्क" कार्य (The "Box Reasoning" Task): उन्होंने AI को यह समझाने के लिए सिखाया कि एक विशिष्ट बॉक्स क्यों महत्वपूर्ण है। उदाहरण के लिए, "बॉक्स नंबर 7 महत्वपूर्ण है क्योंकि इसमें नया पता है, जबकि बॉक्स नंबर 2 केवल पुराना पता है।"
  • डेटा: उन्होंने वास्तविक दस्तावेज़ों के मिश्रण और एक स्वचालित प्रणाली का उपयोग करके 2,49,000 अभ्यास समस्याओं की एक विशाल लाइब्रेरी बनाई, जो एक शिक्षक के रूप में कार्य करती थी।

परिणाम: स्मार्ट और तेज़

शोधकर्ताओं ने चार अलग-अलग AI मॉडलों का उपयोग करके सात अलग-अलग बेंचमार्क (दस्तावेज़ पढ़ने के लिए एक मानकीकृत परीक्षण की तरह) पर इस पद्धति का परीक्षण किया।

  • परिणाम: Doc-CoB का उपयोग करने वाले मॉडलों ने काफी बेहतर स्कोर प्राप्त किया। वास्तव में, इस पद्धति का उपयोग करने वाला एक छोटा, सस्ता मॉडल, एक बहुत बड़े, अधिक महंगे "सुपर-मॉडल" (GPT-4o) को सभी सात परीक्षणों में हरा गया।
  • यह क्यों काम करता है: यह AI को अप्रासंगिक टेक्स्ट से विचलित होने से रोकता है और उसे अपने "दिमागी बल" (brainpower) को सही जगहों पर केंद्रित करने के लिए मजबूर करता है, वह भी पूरे दृश्य को ध्यान में रखते हुए।

मुख्य निष्कर्ष (The Bottom Line)

Doc-CoB एक सरल लेकिन शक्तिशाली तकनीक है: एक साथ सब कुछ पढ़ने की कोशिश न करें। पहले, सही स्थानों को खोजें, उन्हें हाइलाइट करें, और फिर पूरे पेज को दृष्टि में रखते हुए उन्हें ध्यान से पढ़ें। यह दृष्टिकोण AI को उसके अंतर्निहित मस्तिष्क संरचना को बदले बिना जटिल दस्तावेज़ों को समझने में बहुत बेहतर बनाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →