← नवीनतम पेपर
💻 computer science

Qianfan-OCR: A Unified End-to-End Model for Document Intelligence

Qianfan-OCR एक 4B-पैरामीटर वाला एकीकृत विजन-लैंग्वेज मॉडल है जो प्रत्यक्ष इमेज-टू-मार्करडाउन रूपांतरण को एक अभिनव "लेआउट-एज़-थॉट" तंत्र के साथ एकीकृत करके अत्याधुनिक डॉक्यूमेंट इंटेलिजेंस प्राप्त करता है, जिससे यह विविध बेंचमार्क पर काफी बड़े मॉडलों से भी बेहतर प्रदर्शन करता है।

मूल लेखक: Daxiang Dong, Mingming Zheng, Dong Xu, Chunhua Luo, Bairong Zhuang, Yuxuan Li, Ruoyun He, Haoran Wang, Wenyu Zhang, Wenbo Wang, Yicheng Wang, Xue Xiong, Ayong Zheng, Xiaoying Zuo, Ziwei Ou, Jingnan Gu
प्रकाशित 2026-03-17
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Daxiang Dong, Mingming Zheng, Dong Xu, Chunhua Luo, Bairong Zhuang, Yuxuan Li, Ruoyun He, Haoran Wang, Wenyu Zhang, Wenbo Wang, Yicheng Wang, Xue Xiong, Ayong Zheng, Xiaoying Zuo, Ziwei Ou, Jingnan Gu, Quanhao Guo, Jianmin Wu, Dawei Yin, Dou Shen

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास दस्तावेजों का एक विशाल, बिखरा हुआ ढेर है: पुराने रसीदें, जटिल गणित की परीक्षाएँ, हाथ से लिखे नोट्स और छोटे ग्राफ वाले चार्ट। आपका लक्ष्य इस पूरे ढेर को साफ, व्यवस्थित, डिजिटल टेक्स्ट में बदलना है जिसे कंप्यूटर समझ सके और उस पर आधारित सवालों के जवाब दे सके।

वर्षों तक, तकनीकी दुनिया ने इसे एक "फैक्ट्री असेंबली लाइन" दृष्टिकोण के साथ हल करने की कोशिश की:

  1. स्टेशन A: एक रोबोट पेज को स्कैन करता है ताकि यह पता चल सके कि टेक्स्ट कहाँ है (लेआउट डिटेक्शन)।
  2. स्टेशन B: एक अलग रोबोट उस टेक्स्ट को पढ़ता है जो उसे मिला है (OCR)।
  3. स्टेशन C: एक तीसरा रोबोट (एक स्मार्ट AI) समझने की कोशिश करता है कि उस टेक्स्ट का अर्थ क्या है।

समस्या: यह असेंबली लाइन बहुत नाजुक है। यदि स्टेशन A एक छोटे से बॉक्स को पहचानने में चूक जाता है, तो स्टेशन B उस टेक्स्ट को कभी देख ही नहीं पाता। यदि स्टेशन B किसी शब्द को गलत पढ़ लेता है, तो स्टेशन C भ्रमित हो जाता है। इसके अलावा, जब तक टेक्स्ट स्टेशन C तक पहुँचता है, तब तक सभी विजुअल संकेत (जैसे "यह एक चार्ट है" या "यह एक फुटनोट है") फेंक दिए जाते हैं। यह एक पहेली को सुलझाने जैसा है, जहाँ किसी ने पहले ही चित्र वाले हिस्से काट दिए हों और केवल पीछे लिखा हुआ टेक्स्ट ही बचा हो।

पेश है कियानफैन-OCR (Qianfan-OCR): द "सुपर-रीडर"

यह पेपर कियानफैन-OCR को पेश करता है, जो एक नया 4-बिलियन पैरामीटर वाला AI मॉडल है जो असेंबली लाइन को पूरी तरह खत्म कर देता है। तीन अलग-अलग रोबोटों के बजाय, यह एक एकल "सुपर-रीडर" है जो पूरी इमेज को देखता है और एक साथ सब कुछ समझ लेता है।

इसे एक बुद्धिमान लाइब्रेरियन की तरह समझें जो न केवल शब्दों को पढ़ता है बल्कि लेआउट, चित्रों और चार्टों को भी एक साथ देखता है।

यहाँ तीन जादुई तरकीबें दी गई हैं जो इसे काम करने में सक्षम बनाती हैं:

1. "वन-स्टॉप शॉप" (एंड-टू-एंड)

दस्तावेज को एक लाइन में आगे बढ़ाने के बजाय, कियानफैन-OCR एक बार में पूरे पेज को देखता है। यह केवल टेक्स्ट ही नहीं निकालता; यह संदर्भ (Context) को भी समझता है।

  • उपमा: कल्पना कीजिए कि आप एक कॉमिक बुक को समझने की कोशिश कर रहे हैं। पुराना तरीका यह था कि एक व्यक्ति पैनलों का वर्णन करे, दूसरा स्पीच बबल्स को पढ़े, और तीसरा कहानी का अनुमान लगाए। कियानफैन-OCR वह व्यक्ति है जो पूरे पेज को देखता है, एक्शन को देखता है, संवाद पढ़ता है, और तुरंत मजाक को समझ जाता है।

2. "बोलने से पहले सोचना" (लेआउट-एज़-थॉट)

यह इस पेपर का सबसे शानदार नवाचार है। कभी-कभी, कोई दस्तावेज इतना अव्यवset होता है (जैसे समीकरणों, आरेखों और कॉलमों वाली गणित की परीक्षा) कि सीधे पढ़ने से गलतियाँ हो सकती हैं।

कियानफैन-OCR में लेआउट-एज़-थॉट (Layout-as-Thought) नामक एक विशेष मोड है।

  • यह कैसे काम करता है: अंतिम उत्तर देने से पहले, यह रुकता है और "सोच" के रूप में बोलता है। यह पेज के हर हिस्से के चारों ओर अदृश्य बॉक्स बनाता है और उन्हें लेबल करता है: "ठीक है, यह एक हेडर है, यह एक चार्ट है, यह एक फुटनोट है, और मुझे पहले इस कॉलम को पढ़ना चाहिए, फिर उस कॉलम को।"
  • लाभ: यह "सोचने की अवस्था" एक मानसिक मानचित्र की तरह काम करती है। यह AI को अंतिम उत्तर लिखने से पहले अपने विचारों को व्यवस्थित करने में मदद करती है। यह एक ऐसे शेफ की तरह है जो खाना बनाना शुरू करने पहले ही पूरे भोजन की योजना बनाता है और सामग्री को काउंटर पर व्यवस्थित करता है, जिससे यह सुनिश्चित होता है कि कुछ भी जले या आपस में न मिले।
  • लचीलापन: यदि दस्तावेज सरल है (जैसे एक साधारण पत्र), तो AI समय बचाने के लिए सोचने के चरण को छोड़ देता है। यदि यह जटिल है, तो यह सही परिणाम पाने के लिए सोचने के चरण का उपयोग करता है।

3. "स्विस आर्मी नाइफ" (एकीकृत कार्य)

पुराने OCR सिस्टम एक हथौड़े की तरह थे: कील ठोकने (टेक्स्ट पढ़ने) में अच्छे थे, लेकिन पेच कसने (चार्ट समझने) में बेकार थे। सामान्य AI मॉडल एक स्विस आर्मी नाइफ की तरह थे: वे बहुत कुछ थोड़ा-थोड़ा कर सकते थे, लेकिन वे अव्यवस्थित दस्तावेजों को पढ़ने के भारी काम में बहुत अच्छे नहीं थे।

कियानफैन-OCR एक मास्टर क्राफ्ट्समैन है।

  • यह खराब हैंडराइटिंग को पढ़ सकता है।
  • यह एक PDF की टेबल को एक परफेक्ट एक्सेल शीट में बदल सकता है।
  • यह एक ग्राफ को देखकर जवाब दे सकता है, "मार्च में बिक्री क्यों गिरी?"
  • यह रसीद से विशिष्ट जानकारी (जैसे कुल कीमत) निकाल सकता है बिना आपको यह बताए कि उसे ठीक कहाँ देखना है।

यह क्यों मायने रखता है?

यह पेपर दिखाता है कि कियानफैन-OCR पुरानी असेंबली लाइनों की तुलना में अधिक स्मार्ट और तेज़ है।

  • सटीकता (Accuracy): इसने कठिन बेंचमार्क पर अन्य सभी "सिंगल-मॉडल" सिस्टम को हराया, यहाँ तक कि कुछ विशाल कमर्शियल मॉडल्स को भी पीछे छोड़ दिया।
  • गति (Speed): भले ही यह एक बड़ा मॉडल है, यह आधुनिक कंप्यूटरों पर आश्चर्यजनक रूप से तेज़ चलता है क्योंकि इसे किसी धीमे "लेआउट डिटेक्शन" रोबोट के काम पूरा होने का इंतज़ार नहीं करना पड़ता। यह सब कुछ समानांतर (parallel) में करता है।
  • कोई संदर्भ की हानि नहीं (No Lost Context): क्योंकि यह पूरी तस्वीर देखता है, इसलिए यह उन "विजुअल संकेतों" को नहीं खोता जो जटिल दस्तावेजों को समझने में मदद करते हैं।

निष्कर्ष

कियानफैन-OCR डॉक्यूमेंट इंटेलिजेंस की दिशा में एक बड़ी छलांग है। यह दस्तावेजों को असंबद्ध चरणों की श्रृंखला के रूप में देखना बंद करता है और उन्हें एक सुसंगत कहानी की तरह देखता है। बोलने से पहले लेआउट के बारे में "सोचने" की क्षमता देकर, यह उन उलझे हुए और जटिल दस्तावेजों की समस्या को हल करता है जो पहले अन्य सिस्टमों को तोड़ देते थे।

यह एक ऐसे रोबोट के बीच का अंतर है जो केवल निर्देशों का आँख मूंदकर पालन करता है और एक ऐसे स्मार्ट असिस्टेंट के बीच का अंतर है जो वास्तव में समझता है कि वह क्या देख रहा है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →