← नवीनतम पेपर
💻 computer science

PositionOCR: Augmenting Positional Awareness in Multi-Modal Models via Hybrid Specialist Integration

PositionOCR एक पैरामीटर-कुशल हाइब्रिड आर्किटेक्चर है जो टेक्स्ट ग्राउंडिंग और स्पॉटिंग कार्यों में पारंपरिक मल्टी-मॉडल लार्ज लैंग्वेज मॉडल्स की सीमाओं को दूर करने के लिए टेक्स्ट स्पॉटिंग विशेषज्ञों की सटीक स्थिति संबंधी क्षमताओं को लार्ज लैंग्वेज मॉडल्स के प्रासंगिक तर्क के साथ एकीकृत करता है।

मूल लेखक: Chen Duan, Zhentao Guo, Pei Fu, Zining Wang, Kai Zhou, Pengfei Yan

प्रकाशित 2026-02-24
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Chen Duan, Zhentao Guo, Pei Fu, Zining Wang, Kai Zhou, Pengfei Yan

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक शानदार लाइब्रेरियन (एक लार्ज लैंग्वेज मॉडल, या LLM) है जिसने दुनिया की हर किताब पढ़ रखी है। यह लाइब्रेरियन जटिल सवालों के जवाब दे सकता है, चुटकुले सुना सकता है और गहरी कहानियों को समझ सकता है। हालाँकि, यदि आप उन्हें एक सड़क के साइन बोर्ड की धुंधली फोटो दिखाएं और पूछें, "इस तस्वीर में 'STOP' शब्द ठीक कहाँ है?", तो हो सकता है कि वे सही शब्द तो पहचान लें लेकिन गलत जगह की ओर इशारा करें। वे शब्दों के मामले में बहुत अच्छे हैं, लेकिन कोऑर्डिनेट्स (निर्देशांकों) के मामले में बहुत खराब हैं।

दूसरी ओर, कल्पना कीजिए कि आपके पास एक विशेषज्ञ मानचित्रकार (Specialist Cartographer) है। यह व्यक्ति मानचित्रों और तस्वीरों को देखने में विशेषज्ञ है। वह तुरंत किसी पेड़, कार या साइन पर लिखे शब्द के सटीक पिक्सेल स्थान की ओर इशारा कर सकता है। लेकिन, यदि आप उनसे पूछें, "वह कार वहां क्यों खड़ी है?" या "उस दृश्य का मिजाज क्या है?", तो वे शायद खाली नजरें देखते रह जाएंगे। वे स्थानों के मामले में बहुत अच्छे हैं, लेकिन संदर्भ (context) के मामले में बहुत खराब हैं।

PositionOCR इस समस्या का समाधान है। यह एक व्यक्ति के बजाय एक दो लोगों की टीम को काम पर रखने जैसा है:

  1. लाइब्रेरियन (LLM): बातचीत संभालता है, सवाल को समझता है, और यह पता लगाता है कि आप क्या पूछ रहे हैं।
  2. मानचित्रकार (विशेषज्ञ मॉडल): दृश्य विवरणों को संभालता है, यह पता लगाता है कि चीजें कहाँ हैं।

वर्तमान AI के साथ समस्या

अधिकांश आधुनिक AI मॉडल एक "सुपर-ब्रेन" बनने की कोशिश करते हैं जो सब कुछ कर सके। वे एक विशाल, महंगे दिमाग (LLM) को लेते हैं और उसे चीजों की ओर इशारा करना सिखाने की कोशिश करते हैं।

  • समस्या: यह एक नोबेल पुरस्कार विजेता कवि को एक पेशेवर डार्ट थ्रोअर (निशानेबाज) बनाने की कोशिश करने जैसा है। इसके लिए भारी मात्रा में प्रशिक्षण की आवश्यकता होती है, कंप्यूटर पावर की एक बड़ी लागत आती है, और फिर भी वे बुल्सआई (सटीक केंद्र) पर निशाना लगाने में बहुत अच्छे नहीं होते।

PositionOCR का समाधान: "हाइब्रिड टीम"

इस पेपर के लेखकों ने महसूस किया: क्यों कवि को डार्ट फेंकना सिखाना? बस मानचित्रकार को डार्ट फेंकने दें जबकि कवि निर्देश दे रहा हो।

यहाँ बताया गया है कि उन्होंने PositionOCR को कैसे बनाया:

1. विशेषज्ञ पहले (मानचित्रकार)

सबसे पहले, उन्होंने एक छोटा, कुशल मॉडल विशेष रूप से टेक्स्ट खोजने और उसके चारों ओर बॉक्स बनाने के लिए प्रशिक्षित किया। इसे एक कुत्ते को एक विशिष्ट गेंद लाने के लिए प्रशिक्षित करने के रूप में सोचें। यह मॉडल छोटा, तेज़ है, और यह कहने में अविश्वसनीय रूप से अच्छा है कि, "शब्द 'STOP' निर्देशांक (100, 200) पर है।"

2. जुड़ाव (द हैंडशेक)

इसके बाद, उन्होंने इस "फेचिंग डॉग" (गेंद लाने वाले कुत्ते) को "कवि" (LLM) से जोड़ा।

  • आप LLM से पूछते हैं: "'STOP' शब्द खोजो।"
  • LLM अनुरोध को समझता है और इसे विशेषज्ञ को सौंप देता है।
  • विशेषज्ञ सटीक स्थान ढूंढ लेता है और निर्देशांक वापस भेज देता है।
  • LLM फिर स्वाभाविक भाषा में आपको उत्तर देता है।

3. जादू का खेल (इंस्ट्रक्शन ट्यूनिंग)

सबसे दिलचस्प बात यह है कि उन्हें विशाल कवि को फिर से प्रशिक्षित करने की आवश्यकता नहीं पड़ी। उन्हें केवल छोटे विशेषज्ञ को कवि के निर्देशों को सुनना सिखाना था।

  • उपमा: कल्पना कीजिए कि आपके पास एक विशाल, महंगी लाइब्रेरी (LLM) है जिसे आप हिला या बदल नहीं सकते। एक नया लाइब्रेरियन रखने के बजाय जो शेल्फ में नेविगेट करना सीख सके, आप बस एक छोटा, सस्ता इंटर्न (विशेषज्ञ) रखते हैं जो जानता है कि किताबें कहाँ हैं। आप इंटर्न को बताते हैं कि लाइब्रेरियन को क्या चाहिए, और इंटर्न जाकर उसे ले आता है।

यह एक बड़ी बात क्यों है?

  • यह सस्ता और तेज़ है: पूरा सिस्टम केवल 131 मिलियन "मस्तिष्क कोशिकाओं" (पैरामीटर्स) को प्रशिक्षित करने की आवश्यकता होती है। उन अन्य मॉडलों की तुलना करें जिनमें 7 बिलियन या यहाँ तक कि 9 बिलियन पैरामीटर्स होते हैं। यह एक स्मार्ट साइकिल की तुलना एक विशाल मालवाहक जहाज से करने जैसा है। साइकिल को मोड़ना बहुत आसान है और इसमें कम ईंधन की आवश्यकता होती है।
  • यह सटीक है: क्योंकि "मानचित्रकार" एक विशेषज्ञ है, इसलिए यह मॉडल धुंधली छवियों, मुड़े हुए साइन या जटिल दस्तावेजों में टेक्स्ट खोजने में अविश्वसनीय रूप से अच्छा है। यह इन विशिष्ट कार्यों में विशाल "सुपर-ब्रेन" को भी मात देता है।
  • यह लचीला है: छोटा होने के बावजूद, यह अभी भी आपसे चैट कर सकता है, चार्ट के बारे में सवालों के जवाब दे सकता है, और दस्तावेजों को समझ सकता है, बिल्कुल बड़े मॉडलों की तरह।

परिणाम

पेपर दिखाता है कि एक विशेषज्ञ (जो जानता है कि चीजें कहाँ हैं) को एक सामान्यज्ञ (जो जानता है कि चीजों का मतलब क्या है) के साथ जोड़कर, आपको दोनों दुनियाओं का सर्वश्रेष्ठ मिलता है। आपको एक ऐसा AI मिलता है जो एक दस्तावेज़ को पढ़ सकता है, एक विशिष्ट संख्या ढूंढ सकता है, उसके चारों ओर एक बॉक्स बना सकता है, और उसका अर्थ समझा सकता है—और वह भी बिना किसी सुपरकंप्यूटर के।

संक्षेप में: PositionOCR एक विशाल मस्तिष्क को सब कुछ करने की कोशिश करना बंद करता है। इसके बजाय, यह एक छोटी, कुशल टीम बनाता है जहाँ हर कोई वही करता है जिसमें वह सबसे अच्छा है, जिसके परिणामस्वरूप एक स्मार्ट, तेज़ और अधिक सटीक AI प्राप्त होता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →