← नवीनतम पेपर
💬 NLP

GLM-OCR Technical Report

GLM-OCR एक संक्षिप्त 0.9B-पैरामीटर वाला मल्टीमॉडल मॉडल है जो वास्तविक दुनिया के दस्तावेज़ समझ संबंधी कार्यों में अत्याधुनिक दक्षता और प्रदर्शन प्राप्त करने के लिए मल्टी-टोकन प्रेडिक्शन मैकेनिज्म और एक टू-स्टेज पाइपलाइन का लाभ उठाता है, जो इसे एज और बड़े पैमाने पर परिनियोजन दोनों के लिए उपयुक्त बनाता है।

मूल लेखक: Shuaiqi Duan, Yadong Xue, Weihan Wang, Zhe Su, Huan Liu, Sheng Yang, Guobing Gan, Guo Wang, Zihan Wang, Shengdong Yan, Dexin Jin, Yuxuan Zhang, Guohong Wen, Yanfeng Wang, Yutao Zhang, Xiaohan Zhang, W
प्रकाशित 2026-03-12
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Shuaiqi Duan, Yadong Xue, Weihan Wang, Zhe Su, Huan Liu, Sheng Yang, Guobing Gan, Guo Wang, Zihan Wang, Shengdong Yan, Dexin Jin, Yuxuan Zhang, Guohong Wen, Yanfeng Wang, Yutao Zhang, Xiaohan Zhang, Wenyi Hong, Yukuo Cen, Da Yin, Bin Chen, Wenmeng Yu, Xiaotao Gu, Jie Tang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ GLM-OCR तकनीकी रिपोर्ट का हिंदी अनुवाद है:

📖 मुख्य विचार: "स्मार्ट लाइब्रेरियन" बनाम "बड़ी ताकत वाला विशालकाय जीव"

कल्पना कीजिए कि आपके पास अस्त-व्यस्त दस्तावेज़ों का एक विशाल पुस्तकालय है: रसीदें, जटिल चार्ट वाले वैज्ञानिक पेपर, हाथ से लिखे नोट्स और मोहरों वाले अनुबंध। आपको इन तस्वीरों को साफ, व्यवस्थित डिजिटल टेक्स्ट में बदलना है।

आज के अधिकांश AI मॉडल विशाल, धीरे चलने वाले हाथियों की तरह हैं। वे अविश्वसनीय रूप से स्मार्ट हैं और लगभग कुछ भी पढ़ सकते हैं, लेकिन वे भारी हैं, उन्हें खिलाना (कंप्यूट पावर) महंगा है, और उन्हें पुस्तकालय के माध्यम से चलने में बहुत समय लगता है। यदि आप उन्हें किसी व्यस्त दुकान या छोटे फोन पर उपयोग करने की कोशिश करते हैं, तो वे सिस्टम को क्रैश कर सकते हैं या बहुत अधिक खर्च करा सकते हैं।

GLM-OCR अलग है। यह एक अत्यधिक कुशल, सुपर-फास्ट गिलहरी की तरह है। यह छोटा है (केवल 0.9 बिलियन पैरामीटर्स, जो AI के लिए छोटा है), लेकिन यह अविश्वसनीय रूप से फुर्तीला है। यह एक बार में पूरा पेज पढ़ने की कोशिश नहीं करता; इसके पास एक चतुर रणनीति है जिससे यह एक भी नट (टोकन) गिराए बिना दस्तावेजों के माध्यम से तेजी से निकल जाता है।


🛠️ यह कैसे काम करता है: दो-चरणीय नृत्य (Two-Step Dance)

पेपर बताता है कि GLM-OCR खुद को अभिभूत होने से बचाने के लिए एक विशेष दो-चरणीय प्रक्रिया का उपयोग करता है।

1. "आर्किटेक्ट" और "बिल्डर" (दो-चरणीय पाइपलाइन)

कल्पना कीजिए कि आप एक धुंधली फोटो से घर को फिर से बनाने की कोशिश कर रहे हैं।

  • पुराना तरीका: आप एक साथ अनुमान लगाने की कोशिश करते हैं कि हर ईंट कहाँ जाएगी। आप खिड़कियों के कारण भ्रमित हो सकते हैं और छत में दरवाजा लगा सकते हैं।
  • GLM-OCR का तरीका:
    • चरण 1 (आर्किटेक्ट): पहले, एक विशेष टूल (PP-DocLayout-V3) फोटो को देखता है और ब्लूप्रिंट बनाता है। यह कहता है, "ठीक है, यह बॉक्स एक टेबल है, यह रेखा एक पैराग्राफ है, और यह गोला एक गणितीय सूत्र है।"
    • चरण 2 (बिल्डर): अब, मुख्य AI ("बिल्डर") को लेआउट का अनुमान लगाने की आवश्यकता नहीं है। यह केवल उन विशिष्ट बॉक्सों के भीतर के टेक्स्ट को पढ़ने पर ध्यान केंद्रित करता है। क्योंकि बॉक्स छोटे हैं, AI उन्हें समानांतर (parallel) में पढ़ सकता है (एक साथ), जैसे कि श्रमिकों की एक टीम एक व्यक्ति द्वारा दीवार-दर-दीवार पेंट करने के बजाय एक साथ अलग-अलग कमरों को पेंट कर रही हो।

2. "स्पीड रीडर" (मल्टी-टोकन प्रेडिक्शन)

मानक AI एक किताब पढ़ने वाले व्यक्ति की तरह पढ़ता है: एक बार में एक शब्द। "द... कैट... सैट... ऑन... द..." यह धीमा है।
GLM-OCR मल्टी-टोकन प्रेडिक्शन (MTP) नामक एक ट्रिक का उपयोग करता है।

  • उपमा: कल्पना कीजिए कि आप एक वाक्य में अगले शब्द का अनुमान लगा रहे हैं। एक सामान्य AI एक शब्द का अनुमान लगाता है। GLM-OCR एक स्पीड-रीडर की तरह है जो आगे देखता है और एक ही सांस में अगले पांच शब्दों का अनुमान लगाता है।
  • परिणाम: यह न केवल तेजी से पढ़ता है; यह संरचना को बेहतर ढंग से समझता है। यदि यह एक टेबल पढ़ रहा है, तो यह पूरी पंक्ति की संरचना का एक साथ अनुमान लगाता है, ताकि यह भ्रमित न हो और "हैलुसिनेट" (चीजें न बनाए) न करे।

🏆 यह क्या कर सकता है? (इसकी महाशक्तियाँ)

रिपोर्ट दिखाती है कि यह छोटा सा जीव कई श्रेणियों में विशाल हाथियों को हरा देता है:

  • टेक्स्ट रिकग्निशन: यह खराब लिखावट, अजीब फोंट और विभिन्न भाषाओं (जैसे इतालवी और अंग्रेजी मिश्रित मेनू) में टेक्स्ट को पढ़ सकता है।
  • टेबल रिकवरी: यह इसकी महाशक्ति है। यह एक अस्त-व्यस्त स्प्रेडशीट की तस्वीर ले सकता है और उसे वापस एक पूर्ण, संपादन योग्य एक्सेल फ़ाइल में बदल सकता है। यह समझता है कि कौन सी संख्या किस कॉलम की है, भले ही रेखाएं हल्की हों।
  • गणितीय सूत्र: यह भौतिक विज्ञान की किताब से एक जटिल समीकरण देख सकता है और उसे सटीक कंप्यूटर कोड (LaTeX) में बदल सकता है जिसका वैज्ञानिक तुरंत उपयोग कर सकें।
  • प्रमुख जानकारी निकालना (Key Information Extraction): यदि आप इसे एक रसीद दिखाते हैं, तो यह केवल शब्दों को नहीं पढ़ता; यह जानता है कि "कुल राशि (Total)," "तारीख (Date)," और "स्टोर का नाम (Store Name)" को पकड़ना है और उन्हें आपके अकाउंटिंग सॉफ्टवेयर के लिए एक साफ सूची में रखना है।

स्कोर: OmniDocBench नामक एक टेस्ट पर, GLM-OCR ने 94.6 स्कोर किया, जिसने 200 गुना बड़े मॉडल्स (जैसे 235B पैरामीटर वाले मॉडल्स) को पीछे छोड़ दिया। इसने साबित कर दिया कि स्मार्ट होने के लिए आपको विशाल होने की आवश्यकता नहीं है; आपको बस कुशल होने की आवश्यकता है।


🚀 आपको इसकी परवाह क्यों करनी चाहिए? (वास्तविक दुनिया का उपयोग)

एक आम व्यक्ति या व्यवसाय के मालिक के लिए यह क्यों मायने रखता है?

  1. यह सस्ता है: क्योंकि यह छोटा है, आप इसे एक सामान्य लैपटॉप या यहाँ तक कि फोन पर भी चला सकते हैं। आपको सुपरकंप्यूटर की आवश्यकता नहीं है।
  2. यह तेज़ है: यह प्रति सेकंड सैकड़ों पन्ने प्रोसेस कर सकता है। यदि आपके पास 1,000 इनवॉइस का ढेर है, तो यह घंटों के बजाय मिनटों में उन्हें डिजिटाइज़ कर सकता है।
  3. यह लचीला है:
    • SDK: बड़ी कंपनियों के लिए, इसमें एक "टूलकिट" है जो पूरे अस्त-व्यस्त प्रक्रिया (लेआउट + रीडिंग) को स्वचालित रूप से संभालता है।
    • बेस मॉडल: डेवलपर्स के लिए, आप सीधे AI से बात कर सकते हैं। "हे, इस टेबल को पढ़ो और मुझे डेटा JSON में दो," और यह कर देता है।

⚠️ कमी (सीमाएँ)

कोई भी उपकरण पूर्ण नहीं होता। पेपर कुछ बातें स्वीकार करता है:

  • यदि ब्लूप्रिंट गलत है: यदि "आर्किटेक्ट" (चरण 1) पेज के किसी हिस्से को मिस कर देता है, तो "बिल्डर" उसे नहीं पढ़ेगा।
  • अत्यधिक अस्त-व्यस्त चीजें: यदि दस्तावेज़ बहुत धुंधला है, गणित असंभव रूप से जटिल है, या टेबल रेखाओं का एक उलझा हुआ जाल है, तो इसे संघर्ष करना पड़ सकता है।
  • फॉर्मेटिंग: कभी-कभी, यह एक अतिरिक्त स्पेस जोड़ सकता है या कॉमा मिस कर सकता है, हालांकि यह संरचना को सही रखने में बहुत अच्छा है।

🎯 निचोड़

GLM-OCR एक बड़ी उपलब्धि है क्योंकि यह केवल "AI को बड़ा बनाकर" दस्तावेज़ पढ़ने की समस्या को हल करने की कोशिश करना बंद कर देता है। इसके बजाय, यह स्मार्ट वर्कफ़्लो (पेज को टुकड़ों में तोड़ना) और तेज सोच (एक साथ कई शब्दों का अनुमान लगाना) पर ध्यान केंद्रित करता है।

यह एक पुस्तकालय को ढोने के लिए एक धीमे, महंगे विशालकाय जीव को काम पर रखने के बजाय, तेज, कुशल गिलहरियों की एक टीम को काम पर रखने के बीच का अंतर है जो जानते हैं कि नट कहाँ से पकड़ना है। यह तेज़, सस्ता और आश्चर्यजनक रूप से सटीक है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →