← नवीनतम पेपर
💬 NLP

HPD-Parsing: Hierarchical Parallel Document Parsing

HPD-Parsing एक पदानुक्रमित समानांतर डिकोडिंग प्रतिमान (hierarchical parallel decoding paradigm) पेश करता है जो वैश्विक लेआउट विश्लेषण को समवर्ती ब्लॉक-स्तरीय सामग्री निर्माण और प्रगतिशील मल्टी-टोकन भविष्यवाणी के साथ जोड़ता है, जिससे प्रतिस्पर्धी सटीकता बनाए रखते हुए 4,752 टोकन-प्रति-सेकंड का थ्रूपुट (मौजूदा मॉडलों से 2.62 गुना तेज़) प्राप्त होता है।

मूल लेखक: Shu Wei, Jingjing Wu, Lingshu Zhang, Qunyi Xie, Hao Zou, Le Xiang, Xu Fan, Yangliu Xu, Manhui Lin, Xiaolong Ma, Cheng Cui, Tengyu Du, YY

प्रकाशित 2026-07-22
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Shu Wei, Jingjing Wu, Lingshu Zhang, Qunyi Xie, Hao Zou, Le Xiang, Xu Fan, Yangliu Xu, Manhui Lin, Xiaolong Ma, Cheng Cui, Tengyu Du, YY

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक विशाल, जटिल पुस्तकालय की किताब पढ़ने की कोशिश कर रहे हैं जो चिपकाकर बंद कर दी गई है। इसे समझने के लिए, आपको पहले पन्ने से आखिरी पन्ने तक, एक-एक करके हर शब्द को बिना आगे बढ़े पढ़ना होगा। आज के कई आधुनिक कंप्यूटर प्रोग्राम इसी तरह दस्तावेज़ों (जैसे PDF या स्कैन किए गए कागजात) को "पढ़ने" की कोशिश करते हैं। वे विजन-लैंग्वेज मॉडल (VLM) नामक एक प्रकार के आर्टिफिशियल इंटेलिजेंस का उपयोग करते हैं, जो एक सुपर-स्मार्ट रोबोट की तरह काम करता है जो छवियों को देख सकता है और साथ ही टेक्स्ट भी पढ़ सकता है। हालांकि ये रोबोट दस्तावेज़ की समझ विकसित करने में अविश्वसनीय रूप से कुशल होते जा रहे हैं, लेकिन वे अक्सर बहुत धीमे होते हैं। यह एक विशाल जिग्सॉ पहेली (jigsaw puzzle) को हल करने जैसा है जहाँ आप केवल एक बार में एक टुकड़े को देखते हैं, और अगले टुकड़े को छूने से पहले पिछले टुकड़े को सही जगह रखने का इंतज़ार करते हैं। जैसे-जैसे दस्तावेज़ लंबे और टेक्स्ट, टेबल या गणितीय सूत्रों से अधिक भरे हुए होते जाते हैं, यह "एक-एक करके" वाला तरीका एक ट्रैफिक जाम बन जाता है, जिससे हजारों दस्तावेज़ों को तेज़ी से प्रोसेस करना मुश्किल हो जाता है।

यहीं पर HPD-Parsing नामक एक नया विचार आता है। इस प्रोजेक्ट के पीछे के शोधकर्ताओं ने महसूस किया कि जबकि एक दस्तावेज़ को एक वैश्विक योजना (जैसे अध्यायों का क्रम जानने) की आवश्यकता होती है, प्रत्येक अनुभाग को पढ़ने के लिए सख्त क्रम की आवश्यकता नहीं होती है। वे एक स्मार्ट तरीका प्रस्तावित करते हैं: एक पूरे दस्तावेज़ को क्रमिक रूप से पढ़ने के बजाय, वे एक टीम का उपयोग करते हैं। एक "मैनेजर" रोबोट लेआउट का पता लगाता है और विभिन्न अनुभागों की ओर इशारा करता है, जबकि "वर्कर" रोबोटों की एक टीम उन अनुभागों को एक साथ पढ़ती है। उन्होंने एक ऐसी ट्रिक भी जोड़ी है जहाँ रोबोट एक साथ कई शब्दों का अनुमान लगा सकते हैं, जिससे हर शब्द के बाद रुककर सोचने की आवश्यकता समाप्त हो जाती है। इसका परिणाम एक ऐसा सिस्टम है जो नाटकीय रूप से तेज़ है—प्रति सेकंड 4,752 से अधिक शब्दों को प्रोसेस करता है—बिना दस्तावेज़ को सही ढंग से समझने की अपनी क्षमता खोए।

समस्या: एक धीमी, सिंगल-फाइल लाइन

एक पारंपरिक दस्तावेज़ पार्सर को एक विशाल, बहु-कोर्स दावत खाने की कोशिश करने वाले एक अकेले व्यक्ति के रूप में सोचें। उन्हें सूप खत्म करने के बाद ही सलाद छूने का मौका मिलेगा, और सलाद के बाद मुख्य भोजन का। भले ही सूप सरल हो, वे सलाद शुरू करने से पहले सूप खत्म होने का इंतज़ार नहीं कर सकते। कंप्यूटर विज्ञान की दुनिया में, इसे ऑटोरिग्रेसिव जनरेशन (autoregressive generation) कहा जाता है। कंप्यूटर आउटपुट (वह टेक्स्ट जो वह दस्तावेज़ से पढ़ रहा है) को एक समय में एक टोकन (शब्द का एक छोटा हिस्सा) करके बनाता है। यह देखता है कि इसने अभी क्या लिखा, तय करता है कि आगे क्या आना चाहिए, उसे लिखता है, और यही प्रक्रिया दोहराता है।

छोटे नोट्स के लिए, यह ठीक है। लेकिन चार्ट, गणितीय समीकरणों और घने टेक्स्ट से भरे 50 पन्नों के दस्तावेज़ के लिए, यह सिंगल-फाइल लाइन एक बड़ी बाधा बन जाती है। कंप्यूटर अपना अधिकांश समय खुद को पिछला कदम पूरा करने के लिए इंतज़ार करने में बिता देता है। शोधकर्ताओं ने पाया कि लंबे दस्तावेज़ों के लिए, टेक्स्ट को डिकोड करने में लगने वाला समय पेज की तस्वीर देखने में लगने वाले समय से लगभग 500 गुना अधिक था। यह सेब चुनने के एक मिनट के काम के लिए पाँच घंटे गाड़ी चलाने जैसा है।

समाधान: सुपर-रीडर्स की एक टीम

HPD-Parsing के लेखकों ने इस सिंगल-फाइल लाइन को तोड़ने का निर्णय लिया। उन्होंने Hierarchical Parallel Decoding की अवधारणा पेश की। कल्पना कीजिए कि एक निर्माण स्थल पर एक फोरमैन (लेआउट ब्रांच) एक मचान पर खड़ा होकर पूरी इमारत को देख रहा है। फोरमैन हर ईंट नहीं रखता; इसके बजाय, वे दीवार के विभिन्न हिस्सों की ओर इशारा करते हैं और कहते हैं, "तुम, किचन बनाओ! तुम, बेडरूम बनाओ! तुम, बाथरूम बनाओ!"

इस नए सिस्टम में:

  1. मैनेजर (लेआउट ब्रांच): AI का यह हिस्सा पहले पूरे दस्तावेज़ की छवि को देखता है। यह संरचना को समझता है: "यहाँ एक शीर्षक है, यहाँ एक पैराग्राफ है, यहाँ एक टेबल है, और यहाँ एक गणितीय सूत्र है।" यह दस्तावेज़ का एक नक्शा तैयार करता है।
  2. वर्कर्स (कंटेंट ब्रांचेस): जैसे ही मैनेजर एक अनुभाग की पहचान करता है, वह केवल उस अनुभाग को पढ़ने के लिए एक स्वतंत्र "वर्कर" AI को तैनात करता है। महत्वपूर्ण बात यह है कि ये सभी वर्कर्स अपने सौंपे गए अनुभागों को एक ही समय में पढ़ना शुरू करते हैं। वे बेडरूम शुरू करने से पहले किचन के खत्म होने का इंतज़ार नहीं करते।
  3. साझा मेमोरी (Shared Memory): समय बचाने के लिए, ये सभी वर्कर्स मूल छवि और मैनेजर के नक्शे की एक ही "मेमोरी" साझा करते हैं। उन्हें पूरी तस्वीर को दोबारा पढ़ने की आवश्यकता नहीं होती; वे बस अपने विशिष्ट कार्य पर ध्यान केंद्रित करते हैं।

गुप्त हथियार: भविष्य का अनुमान लगाना

वर्कर्स की एक टीम होने के बावजूद, एक-एक शब्द पढ़ना अभी भी थोड़ा धीमा है। इसलिए, शोधकर्ताओं ने गति की एक दूसरी परत जोड़ी जिसे Progressive Multi-Token Prediction (P-MTP) कहा जाता है।

कल्पना कीजिए कि आप एक वाक्य पढ़ रहे हैं: "बिल्ली चटाई पर..."
एक सामान्य पाठक "पर" के बाद रुकता है और सोचता है कि आगे क्या होगा। वह शायद "बैठी" का अनुमान लगाएगा। फिर वह अगले शब्द के बारे में सोचने के लिए फिर से रुक जाएगा।
P-MTP सिस्टम एक ऐसे पाठक की तरह है जो "बिल्ली चटाई पर" को देखता है और आत्मविश्वास से एक साथ अगले तीन शब्दों का अनुमान लगाता है: "बैठी थी और सो गई।" फिर वह जाँच करता है कि क्या उसके अनुमान सही हैं। यदि वे सही हैं, तो वह एक ही बार में उन सभी को लिख देता है। यदि नहीं, तो वह खुद को सुधारता है और फिर से प्रयास करता है।

HPD-Parsing सिस्टम में, प्रत्येक वर्कर (और मैनेजर) इस ट्रिक का उपयोग करता है। एक-एक कदम उठाने के बजाय, वे बड़े कदम उठाते हैं, एक साथ कई शब्दों का अनुमान लगाते हैं। पेपर रिपोर्ट करता है कि औसतन, यह सिस्टम एक स्टेप में केवल एक के बजाय लगभग 6.6 शब्दों को स्वीकार करने की अनुमति देता है।

परिणाम: तेज़ और सटीक

शोधकर्ताओं ने इस नए सिस्टम का परीक्षण OmniDocBench V1.6 नामक एक मानक बेंचमार्क पर किया, जिसमें जटिल लेआउट, गणित और टेबल वाले विभिन्न प्रकार के दस्तावेज़ शामिल हैं।

  • गति (Speed): नए HPD-Parsing सिस्टम ने 4,752 टोकन प्रति सेकंड की गति प्राप्त की। यह मानक "एक-एक करके" वाले तरीके से 3.06 गुना तेज़ है और वर्तमान में उपलब्ध सबसे तेज़ दस्तावेज़ पार्सर से 2.62 गुना तेज़ है।
  • सटीकता (Accuracy): इतनी तेज़ होने के बावजूद, सिस्टम ढीला नहीं पड़ा। इसने 94.91 का प्रतिस्पर्धी सटीकता स्कोर बनाए रखा, जो वास्तव में अन्य शक्तिशाली मॉडलों से भी अधिक है जो बहुत बड़े और धीमे हैं।
  • गलतियों को संभालना (Handling Errors): टीम ने दिखाया कि यह तरीका अधिक मजबूत भी है। यदि एक पारंपरिक सिस्टम शुरुआत में गलती करता है, तो वह अक्सर भ्रमित हो जाता है और दस्तावेज़ के बाकी हिस्से के लिए उसी गलती को दोहराता रहता है। क्योंकि H-PD-Parsing काम को स्वतंत्र शाखाओं में विभाजित करता है, इसलिए एक अनुभाग (जैसे टेबल) में हुई गलती उसी अनुभाग तक सीमित रहती है और बाकी दस्तावेज़ को खराब नहीं करती है।

यह क्यों मायने रखता है

यह पेपर सुझाव देता है कि हमें गति और सटीकता के बीच किसी एक को चुनने की आवश्यकता नहीं है। यह महसूस करके कि दस्तावेज़ों की एक स्वाभाविक संरचना होती है—एक वैश्विक लेआउट जिसे एक मस्तिष्क द्वारा प्रबंधित किया जा सकता है, जबकि स्थानीय सामग्री को एक साथ काम करने वाले कई मस्तिष्क द्वारा पढ़ा जा सकता है—हम जानकारी को बहुत अधिक कुशलता से प्रोसेस कर सकते हैं।

शोधकर्ताओं ने केवल एक तेज़ कंप्यूटर नहीं बनाया; उन्होंने कंप्यूटर के पढ़ने के तरीके को बदल दिया। एक अकेले, धीमे चलने वाले के बजाय, उन्होंने स्प्रिंटर्स (तेज़ धावकों) की एक समन्वित टीम बनाई है। उनका तर्क है कि यह दृष्टिकोण दस्तावेज़ों के विशाल पुस्तकालयों को वास्तविक समय में प्रोसेस करने का द्वार खोलता है, जिससे AI के लिए सूचना निष्कर्षण, अनुसंधान और डेटा पुनर्प्राप्ति को उस स्तर पर संभव बनाना आसान हो जाता है जो पहले असंभव था। पेपर निष्कर्ष निकालता है कि यह "हाइरार्किकल पैरेलल" शैली दस्तावेज़ पार्सिंग के भविष्य के लिए एक शक्तिशाली नया दिशा है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →