← नवीनतम पेपर
🤖 AI

Visual Para-Thinker: Divide-and-Conquer Reasoning for Visual Comprehension

यह शोध पत्र विजुअल पैरा-थिंकर (Visual Para-Thinker) को प्रस्तुत करता है, जो मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स के लिए पहला समानांतर तर्क ढांचा (parallel reasoning framework) है, जो विविध और कुशल दृश्य समझ प्राप्त करने के लिए विजुअल पार्टिशनिंग (visual partitioning), पा-अटेंशन (Pa-Attention) और एलपीआरओपीई (LPRoPE) का लाभ उठाकर पारंपरिक वर्टिकल स्केलिंग की अन्वेषण सीमाओं को दूर करता है।

मूल लेखक: Haoran Xu, Hongyu Wang, Jiaze Li, Shunpeng Chen, Zizhao Tong, Jianzhong Ju, Zhenbo Luo, Jian Luan

प्रकाशित 2026-05-08
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Haoran Xu, Hongyu Wang, Jiaze Li, Shunpeng Chen, Zizhao Tong, Jianzhong Ju, Zhenbo Luo, Jian Luan

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

मुख्य विचार: एक अकेले जासूस से खोजकर्ताओं की एक टीम तक

कल्पना कीजिए कि आप एक जटिल पहेली को सुलझाने की कोशिश कर रहे हैं, जैसे कि एक भीड़भाड़ वाली फोटो में किसी विशिष्ट वस्तु को खोजना या व्यस्त सड़क के दृश्य में लोगों की गिनती करना।

पुराना तरीका (क्रमिक तर्क - Sequential Reasoning):
वर्तमान में, अधिकांश AI मॉडल एक अकेले जासूस की तरह काम करते हैं जो अकेले काम करता है। वे पूरी तस्वीर को देखते हैं, चरण-दर-चरण सोचते हैं, और अपने विचारों को एक लंबी पंक्ति में लिखते हैं: "पहले मैं एक कुत्ता देखता हूँ, फिर एक बिल्ली, फिर एक पेड़..." यदि यह जासूस छवि के एक हिस्से पर अटक जाता है या शुरुआत में कोई गलती कर देता है, तो वे भ्रमित हो सकते हैं और गलत रास्ते पर चलते रह सकते हैं। वे "गहराई से सोच" (thinking deep) रहे हैं, लेकिन वे एक ही लेन में फंसे हुए हैं।

नया तरीका (विजुअल पैरा-थिंकर - Visual Para-Thinker):
यह पेपर एक नया ढांचा पेश करता है जिसे विजुअल पैरा-थिंकर कहा जाता है। एक अकेले जासूस के बजाय, कल्पना कीजिए कि एक ही जंगल (छवि) में एक साथ भेजे गए चार खोजकर्ताओं की एक टीम है।

  • खोजकर्ता 1 केवल ऊपर-बाएँ कोने को देखता है।
  • खोजकर्ता 2 ऊपर-दाएँ को देखता है।
  • खोजकर्ता 3 बाएँ से दाएँ स्कैन करता है।
  • खोजकर्ता 4 नीचे से ऊपर की ओर स्कैन करता है।

वे सभी समानांतर (parallel) (एक ही समय में) काम करते हैं। एक बार जब वे काम पूरा कर लेते हैं, तो वे बीच में मिलते हैं, अपने नोट्स साझा करते हैं, और आपको अंतिम उत्तर देने के लिए अपने निष्कर्षों को मिलाते हैं। यह केवल "गहराई से सोचने" के बजाय "चौड़ाई से सोचने" (thinking wide) के बारे में है।


दो रणनीतियाँ: टीम को कैसे विभाजित करें

पेपर में पाया गया कि आप छवि को बेतरतीब ढंग से विभाजित नहीं कर सकते; आपको काम को विभाजित करने का एक स्मार्ट तरीका चाहिए। उन्होंने दो मुख्य रणनीतियों का परीक्षण किया:

  1. ब्लॉक-आधारित विभाजन (ब्लॉक-आधारित विभाजन - "क्वाड्रेंट" रणनीति):
    कल्पना कीजिए कि आप छवि को चार अलग-अलग वर्गों में काट रहे हैं (जैसे कि टिक-टैक-टो बोर्ड)। प्रत्येक खोजकर्ता को एक वर्ग सौंपा गया है।
  • सबसे अच्छा है: उन कार्यों के लिए जहाँ आपको अलग-अलग क्षेत्रों में विशिष्ट विवरणों को करीब से देखने की आवश्यकता होती है, जैसे कि एक छोटा टेक्स्ट लेबल ढूंढना या कोने में किसी विशिष्ट वस्तु की पहचान करना।
  • उपमा: एक निर्माण दल की तरह जहाँ एक व्यक्ति छत को पेंट करता है, एक फर्श करता है, और एक दीवारों को संभालता है।
  1. स्कैन-ऑर्डर विभाजन (स्कैन-ऑर्डर विभाजन - "पथ" रणनीति):
    कल्पना कीजिए कि सभी खोजकर्ता पूरी छवि को देखते हैं, लेकिन वे अलग-अलग दिशाओं में इसके माध्यम से चलते हैं।
  • खोजकर्ता 1 बाएँ-से-दाएँ चलता है।
  • खोजकर्ता 2 ऊपर-से-नीचे चलता है।
  • खोजकर्ता 3 दाएँ-से-बाएँ चलता है।
  • सबसे अच्छा है: गिनती करने जैसे कार्यों के लिए। यदि आप भीड़ को बाएँ से दाएँ स्कैन करते हैं, तो आप पीछे के किसी व्यक्ति को छोड़ सकते हैं; यदि आप ऊपर से नीचे स्कैन करते हैं, तो आप उन्हें पकड़ लेते हैं।
  • उपमा: एक किताब पढ़ने की तरह। एक व्यक्ति पहला पृष्ठ पढ़ता है, फिर दूसरा। दूसरा व्यक्ति पहले कॉलम को पढ़ता है, फिर दूसरे कॉलम को। वे एक ही कहानी पढ़ रहे हैं लेकिन एक अलग क्रम में।

पेपर का 'सीक्रेट सॉस': उन्होंने पाया कि सर्वोत्तम परिणामों के लिए, आपको इन दोनों रणनीतियों को एक साथ उपयोग करना चाहिए। कभी-कभी आपको विशिष्ट ब्लॉक्स को देखने की आवश्यकता होती है; अन्य समय में आपको अलग-अलग क्रमों में पूरी छवि को स्कैन करने की आवश्यकता होती है।


तकनीकी जादू: टीम को व्यवस्थित रखना

यदि चार लोग एक साथ बात कर रहे हैं, तो यह अराजक हो सकता है। पेपर ने टीम को व्यवस्थित रखने के लिए दो विशेष उपकरण पेश किए हैं:

  1. Pa-Attention (द "म्यूट बटन"):
    सोचने के चरण के दौरान, खोजकर्ता 1 को खोजकर्ता 2 को नहीं सुनना चाहिए। यदि खोजकर्ता 1 एक लाल कार के बारे में सोच रहा है, तो उसे खोजकर्ता 2 के नीले पक्षी के बारे में बात करने से विचलित नहीं होना चाहिए।
  • यह कैसे काम करता है: सिस्टम खोजकर्ताओं के बीच एक "दीवार" (अटेंशन मास्क) लगा देता है। वे केवल अपने हिस्से की छवि और साझा निर्देशों को देख सकते हैं, लेकिन वे अंत तक एक-दूसरे के विचारों को नहीं देख सकते। यह सुनिश्चित करता है कि हर कोई एक अनूठा, स्वतंत्र विचार प्रस्तुत करे।
  1. LPRoPE (द "नेम टैग"):
    जब टीम अपने निष्कर्षों का सारांश देने के लिए मिलती है, तो AI को यह जानने की आवश्यकता होती है कि किसने क्या कहा। यदि खोजकर्ता 1 और खोजकर्ता 2 दोनों कहते हैं "मैं एक कुत्ता देखता हूँ," तो AI को यह जानने की आवश्यकता है कि ये एक ही कुत्ते पर दो अलग-अलग दृष्टिकोण हैं, न कि एक भ्रमित डुप्लिकेट।
  • कैसे काम करता है: सिस्टम हर खोजकर्ता को उनके विचारों के साथ एक अनूठा, अदृश्य "नेम टैग" (एक सीखने योग्य एम्बेडिंग) देता है। भले ही वे छवि के एक ही स्थान को देख रहे हों, AI जानता है, "आह, यह विचार बाएँ-से-दाएँ स्कैनर का है, न कि ऊपर-बाएँ ब्लॉक स्कैनर का।" यह AI को इस बात से भ्रमित होने से रोकता है कि किस पथ ने किस निष्कर्ष तक पहुँचाया।

परिणाम: यह क्यों मायने रखता है

शोधकर्ताओं ने कई कठिन कार्यों पर इस नए "खोजकर्ताओं की टीम" के दृष्टिकोण का परीक्षण किया:

  • गिनती (Counting): यह वस्तुओं को गिनने में बहुत बेहतर हो गया (जैसे "इस फोटो में कितने लोग हैं?") क्योंकि अलग-अलग दिशाओं में स्कैन करने से उन्हें किसी को भी छोड़ने या एक ही व्यक्ति को दो बार गिनने से बचने में मदद मिली।
  • चीजों को खोजना (Finding Things): यह "विजुअल ग्राउंडिंग" (छवि में किसी वस्तु की सटीक स्थिति बताना) में बेहतर हो गया।
  • भ्रम (Hallucinations) से बचना: AI अक्सर "हैलुसिनेट" (चीजें बनाना) करता है। चार स्वतंत्र रास्तों द्वारा तथ्यों की जांच करने से, टीम किसी फर्जी वस्तु को बनाने की कम संभावना रखती है। यदि तीन खोजकर्ता कहते हैं "यहाँ कोई कुत्ता नहीं है" और एक कहता है "शायद," तो टीम सहमत होती है कि वहाँ कोई कुत्ता नहीं है।

दक्षता (Efficiency):
आमतौर पर, चार अलग-अलग विचारों को चलाने में चार गुना अधिक समय लगता है। हालाँकि, लेखकों ने इस प्रणाली को एक विशेष इंजन (vLLM) का उपयोग करके बनाया है जो टीम को उनकी "स्मृति" (छवि का प्रारंभिक दृश्य) साझा करने की अनुमति देता है ताकि उन्हें तस्वीर को चार बार फिर से पढ़ने की आवश्यकता न पड़े। यह प्रक्रिया को आश्चर्यजनक रूप से तेज़ बनाता है, लगभग पुराने एकल-जासूस पद्धति के समान।

सारांश

विजुअल पैरा-थिंकर AI के लिए चित्रों को देखने का एक नया तरीका है। एक छवि को देखने और एक लंबी, एकल रेखा में सोचने के बजाय, यह छवि को विभाजित करता है और विभिन्न कोणों और विभिन्न क्रमों से इसे देखने के लिए कई "मिनी-ब्रेन" भेजता है। वे भ्रम से बचने के लिए स्वतंत्र रूप से काम करते हैं, फिर अपने अद्वितीय दृष्टिकोणों को मिलाकर एक अधिक सटीक, कम भ्रमित उत्तर देते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →