← नवीनतम पेपर
🤖 AI

DOSA: A Tree-Guided, Self-Regressive Framework for Long Document Structure Analysis

यह शोध पत्र DOSA का प्रस्ताव करता है, जो एक ट्री-गाइडेड (tree-guided), सेल्फ-रिग्रेसिव (self-regressive) फ्रेमवर्क है जो लंबी दूरी की निर्भरताओं (long-range dependencies) और विषम लेआउट्स (heterogeneous layouts) को प्रभावी ढंग से कैप्चर करने के लिए बहु-पृष्ठ दस्तावेजों को चंक-दर-चंक (chunk-by-chunk) प्रोसेस करके दस्तावेज़-स्तरीय सिमेंटिक पेड़ों को क्रमिक रूप से पुनर्गठित करता है, जिससे दस्तावेज़ संरचना विश्लेषण बेंचमार्क पर अत्याधुनिक प्रदर्शन प्राप्त होता है।

मूल लेखक: Bohou Li, Benjamin Sowell, Mehul Shah, Mark Lindblad, Henry Lindeman

प्रकाशित 2026-07-28
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Bohou Li, Benjamin Sowell, Mehul Shah, Mark Lindblad, Henry Lindeman

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक विशाल, बहु-खंडीय विश्वकोश (एन्साइक्लोपीडिया) को समझने की कोशिश कर रहे हैं, जो कागज के बिखरे हुए पन्नों पर छपा हुआ है और एक विशाल फर्श पर फैला हुआ है। कुछ पन्नों पर चित्र हैं, कुछ में सूचियाँ हैं, और कुछ में बड़े बोल्ड शीर्षक हैं। इस बिखराव को समझने के लिए, आप केवल शब्दों को नहीं पढ़ते; आपको यह समझना होता है कि वे हिस्से एक-दूसरे में कैसे फिट बैठते हैं। क्या वह चित्र ऊपर दिए गए पैराग्राफ का हिस्सा है? क्या वह सूची किसी शीर्षक की उप-श्रेणी (child) है, या वह एक अलग खंड है? यह "विजुअली-रिच डॉक्यूमेंट्स" (दृश्य रूप से समृद्ध दस्तावेज़ों) की दुनिया है, जहाँ जानकारी केवल शब्दों का प्रवाह नहीं है, बल्कि आकारों, स्थितियों और शैलियों की एक जटिल पहेली है। कंप्यूटरों के लिए इन दस्तावेज़ों को वास्तव में "पढ़ने" के लिए—चाहे वे कानूनी अनुबंध हों, वैज्ञानिक शोध पत्र हों, या स्लाइड डेक—उन्हें "डॉक्यूमेंट स्ट्रक्चर एनालिसिस" नामक एक विशिष्ट पहेली को हल करने की आवश्यकता होती है। उन्हें एक "सिमेंटिक ट्री" (अर्थपूर्ण वृक्ष) बनाना होता है, जो दस्तावेज़ के हिस्सों के लिए एक वंशावली वृक्ष (फैमिली ट्री) की तरह है, जो यह दिखाता है कि किसका जनक (parent) कौन है और क्रम में किसे कैसे पढ़ा जाना चाहिए। इसके बिना, एक कंप्यूटर एक शीर्षक और एक पैराग्राफ को दो असंबंधित अजनबियों के रूप में देख सकता है, यह समझे बिना कि वे वास्तव में एक जनक और संतान के संबंध में हैं।

यहाँ DOSA (डॉक्यूमेंट स्ट्रक्चर एनालाइज़र) आता है, जो ग्लीन टेक्नोलॉजीज के शोधकर्ताओं द्वारा लंबे, बहु-पृष्ठीय दस्तावेज़ों के लिए इस पहेली को हल करने हेतु प्रस्तावित एक नई विधि है। 1,000 टुकड़ों वाले लेगो (LEGO) महल को एक साथ बनाने की कोशिश करने के बारे में सोचें; यह बहुत भारी काम है, और यदि आप शुरुआत में कोई गलती करते हैं, तो पूरा ढांचा ढह सकता है। पिछली विधियों ने पूरे दस्तावेज़ को एक साथ देखने की कोशिश की, जो एक पूरे महल को बनाने के दौरान उसे अपने हाथों में पकड़ने की कोशिश करने जैसा है—यह बहुत भारी हो जाता है और कंप्यूटर भ्रमित हो जाता है। DOSA एक अलग दृष्टिकोण अपनाता है: यह महल को एक-एक करके छोटे हिस्सों में बनाता है। यह दस्तावेज़ को "चंक्स" (टुकड़ों) में प्रोसेस करता है, जैसे महल के अगले हिस्से पर जाने से पहले एक कमरा तैयार करना। लेकिन यहाँ एक चतुर मोड़ है: जैसे-जैसे यह प्रत्येक नया कमरा बनाता है, यह केवल अपने हाथ में मौजूद ईंटों को ही नहीं देखता; बल्कि यह पहले से बनाए जा चुके महल की "सबसे दाहिनी शाखा" (rightmost branch) को भी देखता है। यह एक मार्गदर्शक के रूप में कार्य करता है, जो कंप्यूटर को बताता है कि पिछले कमरों के कौन से हिस्से नए कमरों के लिए प्रासंगिक हैं। इस "ट्री-गाइडेड" (वृक्ष-निर्देशित) मानचित्र का उपयोग करके, DOSA दस्तावेज़ के विशाल आकार में खो जाने से बच जाता है।

शोधकर्ताओं ने पाया कि यह चरण-दर-चरण, स्व-निर्देशित विधि अविश्वसनीय रूप से प्रभावी है। जब उन्होंने DOSA का परीक्षण पांच अलग-अलग डेटासेट्स पर किया, जिसमें DocHieNet नामक एक बहुत ही कठिन और जटिल, बहु-पृष्ठीय लेआउट वाला डेटासेट भी शामिल था, तो इसने वर्तमान सर्वोत्तम विधियों को पीछे छोड़ दिया। उस चुनौतीपूर्ण बेंचमार्क पर, DOSA ने F1 स्केल पर 4 अंक और TEDS (जो कंप्यूटर के वृक्ष की वास्तविक वृक्ष से समानता को मापता है) पर लगभग 20 अंकों तक सुधार किया। इससे भी अधिक प्रभावशाली बात यह है कि इसने Gemini-2.5-Pro और GPT-5.2 जैसे शक्तिशाली, सामान्य-उद्देश्य वाले AI मॉडलों को भी मात दी, जो यह सुझाव देता है कि दस्तावेज़ के वृक्ष बनाने के इस विशिष्ट कार्य के लिए, एक विशेष, संरचित दृष्टिकोण केवल एक विशाल AI से संरचना का "अनुमान" लगाने के लिए पूछने से बेहतर है। शोध पत्र सुझाव देता है कि विजुअल सुरागों (जैसे कि पेज पर एक बॉक्स कहाँ स्थित है), टेक्स्ट सामग्री और वस्तुओं के आकार को जोड़कर, DOSA उच्च सटीकता के साथ दस्तावेज़ के तर्क को पुनर्गठित कर सकता है, भले ही उसे एक बार में पूरे दस्तावेज़ को याद रखने की आवश्यकता न हो। हालाँकि, लेखक यह भी नोट करते हैं कि हालांकि यह विधि मजबूत है, लेकिन यह पूर्ण नहीं है; यह वर्तमान में केवल ट्री स्ट्रक्चर पर केंद्रित है और अभी तक जटिल वेब-जैसे संबंधों (जैसे उद्धरण/साइटेशन) को नहीं संभाल सकती है, और यदि यह शुरुआत में कोई गलती करती है, तो इसे बाद में सुधारने में कठिनाई हो सकती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →