← नवीनतम पेपर
🤖 AI

Prefix-Adaptive Block Diffusion for Efficient Document Recognition

यह शोध पत्र प्रिफिक्स-एडेप्टिव ब्लॉक डिफ्यूजन मॉडल (PA-BDM) का प्रस्ताव करता है, जो सूचना प्रवाह की विसंगतियों को हल करने के लिए निश्चित ब्लॉक सीमाओं को गतिशील प्रिफिक्स कमिटमेंट और कॉज़ल डिनोइजिंग से बदलकर कुशल दस्तावेज़ पहचान को बढ़ाता है, जिससे मौजूदा मॉडलों की तुलना में बेहतर सटीकता और 71.6% अधिक इन्फरेंस थ्रूपुट प्राप्त होता है।

मूल लेखक: Mingxu Chai, Ziyu Shen, Chenyu Liu, Kaidi Zhang, Jiazheng Zhang, Dingwei Zhu, Zhiheng Xi, Ruoyu Chen, Jun Long, Jihua Kang, Tao Gui, Qi Zhang

प्रकाशित 2026-05-19
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Mingxu Chai, Ziyu Shen, Chenyu Liu, Kaidi Zhang, Jiazheng Zhang, Dingwei Zhu, Zhiheng Xi, Ruoyu Chen, Jun Long, Jihua Kang, Tao Gui, Qi Zhang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक दस्तावेज़ की छवि से एक जटिल, हस्तलिखित गणितीय सूत्र या एक सघन तालिका को कंप्यूटर-पठनीय प्रारूप में ट्रांसक्राइब करने का प्रयास कर रहे हैं।

पुराना तरीका (द "रिजिड ब्लॉक" समस्या)
वर्तमान कुशल AI मॉडल (जिन्हें ब्लॉक डिफ्यूजन मॉडल कहा जाता है) को शिफ्ट में काम करने वाली लिपिकों (scribes) की एक टीम के रूप में सोचें। वे पृष्ठ को निश्चित आकार के टुकड़ों में विभाजित करते हैं, जैसे कि एक बार में 32 शब्द।

  • बाधा (The Bottleneck): वे उन सभी 32 शब्दों पर एक साथ काम करते हैं (जो तेज़ है), लेकिन वे उन 32 शब्दों के पूरे समूह के समाप्त होने तक अपनी प्रगति को सहेज नहीं सकते या किसी भी शब्द को "लॉक इन" नहीं कर सकते।
  • भ्रम (The Confusion): उस ब्लॉक के भीतर, लिपिक बाएं से दाएं और दाएं से बाएं, दोनों तरफ से एक-दूसरे के काम को देख सकते हैं। हालांकि यह मददगार लगता है, लेकिन जब वे अगले ब्लॉक पर जाते हैं तो यह एक गड़बड़ी पैदा करता है। अगला ब्लॉक केवल वही जानता है जो उससे पहले आया था (बाएं से दाएं), लेकिन पिछला ब्लॉक दिशाओं का एक मिला-जुला मिश्रण था। यह विसंगति गणितीय सूत्रों या तालिकाओं जैसी चीजों की संरचना को सही करने में कठिनाई पैदा करती है।
  • बर्बादी (The Waste): जैसे-जैसे वे एक ब्लॉक के भीतर शब्दों को पूरा करते हैं, "समानांतर" (parallel) काम धीमा हो जाता है क्योंकि अनुमान लगाने के लिए कम शब्द बचते हैं। यह एक फैक्ट्री असेंबली लाइन की तरह है जो आधे उत्पाद बनने के बाद कुशल नहीं रह जाती।

नया समाधान: PA-BDM (द "एडेप्टिव स्क्राइब")
लेखक एक नया तरीका प्रस्तावित करते हैं जिसे प्रिफिक्स-एडेप्टिव ब्लॉक डिफ्यूजन (PA-BDM) कहा जाता है। यहाँ बताया गया है कि यह सरल उपमाओं का उपयोग करके खेल को कैसे बदल देता है:

1. "कैंडिडेट रेंज" बनाम "फिक्स्ड बॉक्स"

एक ब्लॉक के 32 शब्दों को एक कठोर बॉक्स के रूप में मानने के बजाय, जिसे आगे बढ़ने से पहले पूरी तरह से भरना ही होगा, PA-BDM इसे एक अधिकतम कैंडिडेट रेंज के रूप में मानता है।

  • उपमा: कल्पना करें कि आप एक बाल्टी भर रहे हैं। पुराना तरीका कहता है, "आपको स्टोरेज टैंक में पानी डालने से पहले पूरी बाल्टी भरनी होगी।" PA-BDM कहता है, "जितना हो सके बाल्टी भरें, और जैसे ही आपको यकीन हो जाए कि पानी का एक कप साफ और सुरक्षित है, उसे तुरंत स्टोरेज टैंक में डाल दें।"
  • परिणाम: AI पूरे ब्लॉक के खत्म होने का इंतजार नहीं करता। यह "विश्वसनीय" हिस्से (प्रिफिक्स) को पकड़ता है और उसे तुरंत सहेज लेता है।

2. कॉज़ल फ्लो (द "वन-वे स्ट्रीट")

पुराने तरीके में लिपिकों को एक ब्लॉक के भीतर पीछे और आगे देखने की अनुमति थी, जिससे चीजों का क्रम भ्रमित हो जाता था। PA-BDM सभी को केवल आगे (बाएं से दाएं) देखने के लिए मजबूर करता है, ठीक वैसे ही जैसे एक किताब पढ़ते समय होता है।

  • उपमा: पुराने सिस्टम में, एक वाक्य के बीच में बैठा लिपिक बीच के हिस्से का अनुमान लगाने के लिए वाक्य के अंत में झांक सकता था। यह अनौपचारिक बातचीत के लिए तो ठीक था लेकिन गणितीय समीकरणों जैसी सख्त संरचनाओं के लिए विफल रहा जहाँ क्रम महत्वपूर्ण होता है। PA-BDM एक सख्त "वन-वे स्ट्रीट" नियम लागू करता है, यह सुनिश्चित करता है कि AI हर बार सही अनुक्रम सीखे।

3. प्रोग्रेसिव प्रिफिक्स कमिटमेंट (PPC) – द "कॉन्फिडेंस चेक"

यह नए सिस्टम का इंजन है। जैसे-जैसे AI अगले शब्दों के बैच का अनुमान लगाता है, यह अपने स्वयं के आत्मविश्वास की जांच करता है।

  • यह कैसे काम करता है: यदि AI 32-शब्दों के एक ब्लॉक के पहले 10 शब्दों के बारे में 99% आश्वस्त है, तो यह उन 10 शब्दों को तुरंत "कमिट" (लॉक इन) कर देता है। फिर यह शेष 22 अनुमानों को हटा देता है और उन 10 लॉक किए गए शब्दों के आधार पर 32 अनुमानों का एक नया बैच शुरू करता है।
  • लाभ: यह "पैरेलल स्पेस" को रीसेट करता है। 22, 10, फिर 5 शब्दों की घटती सूची पर काम करने के बजाय, AI बार-बार 32 अनुमानों के एक ताज़ा, पूर्ण सेट पर काम करता है। इससे गति उच्च बनी रहती है।

4. कॉन्फिडेंस-गेटेड स्ट्रक्चरल लॉस (CSL) – द "स्ट्रिक्ट टीचर"

ट्रेनिंग के दौरान, AI गलतियों को सुधारने की कोशिश करके सीखता है। पुराना तरीका AI को सभी गलतियों से सीखने के लिए मजबूर करता था, भले ही वाक्य की शुरुआत ही अस्थिर हो।

  • समाधान: PA-BDM एक "कॉन्फिडेंस गेट" का उपयोग करता है। यदि AI वाक्य की शुरुआत को लेकर अनिश्चित है, तो शिक्षक (ट्रेनिंग एल्गोरिदम) वाक्य के बाकी हिस्से को ग्रेड करने से रुक जाता है। यह केवल उस हिस्से को ग्रेड करता है जिसके बारे में AI आश्वस्त है।
  • उपमा: कल्पना करें कि एक शिक्षक गणित के टेस्ट को ग्रेड कर रहा है। यदि छात्र ने पहला चरण गलत किया है, तो शिक्षक अंतिम उत्तर को ग्रेड करने में समय बर्बाद नहीं करेगा क्योंकि वह एक गलत आधार पर आधारित है। शिक्षक तब तक इंतजार करता है जब तक छात्र पहला चरण सही नहीं कर लेता, उसके बाद ही बाकी हिस्से को ग्रेड करता है। यह AI को "नॉइज़ी" या खराब पैटर्न सीखने से रोकता है।

परिणाम

पेपर का दावा है कि यह नया दृष्टिकोण, PA-BDM, एक बड़ा अपग्रेड है:

  • गति: यह पिछले सर्वश्रेष्ठ डिफ्यूजन मॉडल (MinerU-Diffusion) की तुलना में 71.6% तेज़ है और मानक ऑटोरेग्रेसिव मॉडल (जो एक बार में एक शब्द लिखते हैं) की तुलना में लगभग 8 गुना तेज़ है।
  • सटीकता: यह गणितीय सूत्रों, तालिकाओं और आरेखों जैसी जटिल संरचनाओं को पहचानने में अधिक सटीक है क्योंकि यह टोकन के सख्त क्रम का सम्मान करता है।
  • दक्षता: यह पुराने मॉडलों की तरह ही मेमोरी का कुशलतापूर्वक उपयोग करता है लेकिन उसी समय में बहुत अधिक काम करता है।

संक्षेप में, PA-BDM AI को "परफेक्ट ब्लॉक्स" का इंतजार करने के बजाय "पर्याप्त अच्छे" प्रोग्रेस को तुरंत लॉक करने की अनुमति देता है, जिससे असेंबली लाइन बिना सटीकता खोए पूरी गति से चलती रहती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →