← नवीनतम पेपर
🤖 AI

Divide-and-Conquer Inference for Large-Scale Visual Recognition with Multimodal Large Language Models

यह शोध पत्र डिवाइड-एंड-कॉन्कर इन्फरेंस (DCI) प्रस्तुत करता है, जो एक नवीन टेस्ट-टाइम स्केलिंग रणनीति है जो जटिल वर्गीकरण कार्यों को पुनरावर्ती रूप से स्थानीयकृत उप-समस्याओं में विघटित करके बड़े पैमाने पर दृश्य पहचान में प्रदर्शन गिरावट को कम करती है, जिससे सिग्नल-टू-नॉइज़ अनुपात और कम्प्यूटेशनल दक्षता में सुधार होता है ताकि हल्के ओपन-सोर्स मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स को बिना किसी अतिरिक्त प्रशिक्षण के फ्रंटियर क्लोज्ड-सोर्स दिग्गजों के समकक्ष बनाया जा सके।

मूल लेखक: Zhipeng Ye, Jiaqi Huang, Feng Jiang, Qiufeng Wang, Yikang Duan, Dawei Wang, Xihang Zhou, Qian Qiao

प्रकाशित 2026-05-26
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zhipeng Ye, Jiaqi Huang, Feng Jiang, Qiufeng Wang, Yikang Duan, Dawei Wang, Xihang Zhou, Qian Qiao

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ "Divide-and-Conquer Inference for Large-Scale Visual Recognition with Multimodal Large Language Models" पेपर का सरल भाषा और रचनात्मक उपमाओं (analogies) के साथ विवरण दिया गया है।

बड़ी समस्या: "बहुत अधिक विकल्प" का जाल

कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान जासूस (AI मॉडल) हैं जो एक फोटो में एक विशिष्ट जानवर को पहचानने की कोशिश कर रहे हैं।

  • परिदृश्य A: आपको एक बाघ (tiger) की फोटो दिखाई जाती है और आपसे 10 जानवरों (शेर, बाघ, भालू, भेड़िया, आदि) में से चुनने को कहा जाता है। यह आसान है। आप फोटो देखते हैं, छोटी सूची से उसकी तुलना करते हैं, और बाघ को चुन लेते हैं। आप लगभग हर बार सही होते हैं।
  • परिदृश्य B: अब, कल्पना कीजिए कि सूची बढ़कर 20,000 जानवरों (जिसमें पृथ्वी के हर प्रकार के कीट, पक्षी और मछली शामिल हैं) तक पहुँच गई है। आपको अभी भी उसी बाघ को चुनना है।

शोधकर्ताओं ने पाया है कि जब यह सूची इतनी विशाल हो जाती है, तो सबसे बुद्धिमान AI जासूस भी बुरी तरह विफल होने लगते हैं। वे शायद "उपरोक्त में से कोई नहीं" (None of the above) का अनुमान लगाते हैं या किसी रैंडम कीड़े को चुन लेते हैं। लेखक इसे "Performance Collapse in Long Sequence Recognition" कहते हैं।

ऐसा क्यों होता है?
पेपर एक अवधारणा का उपयोग करता है जिसे Attention Dilution (ध्यान का क्षरण) कहा जाता है।
AI के ध्यान को एक टॉर्च की रोशनी की तरह समझें।

  • परिदृश्य A में (10 विकल्प), टॉर्च की रोशनी चमकदार और केंद्रित है। यह "बाघ" के विकल्प पर स्पष्ट रूप से चमकती है, जिससे वह अन्य विकल्पों से अलग दिखाई देता है।
  • परिदृश्य B में (20,000 विकल्प), AI एक ही समय में उन सभी 20,000 विकल्पों पर अपनी टॉर्च की रोशनी डालने की कोशिश करता है। रोशनी इतनी फैल जाती है कि वह एक मंद और कमजोर चमक बन जाती है। "बाघ" का संकेत (signal) अन्य 19,999 विकल्पों के शोर में खो जाता है। AI अब उस संकेत को स्पष्ट रूप से नहीं देख पाता।

समाधान: "विभाजित करो और जीतो" (Divide-and-Conquer) की रणनीति

AI को एक साथ पूरी विशाल सूची देखने के लिए मजबूर करने के बजाय, लेखक एक नई विधि प्रस्तावित करते हैं जिसे Divide-and-Conquer Inference (DCI) कहा जाता है।

इसे एक विशाल पुस्तकालय में एक विशिष्ट पुस्तक खोजने के समान समझें।

  1. पुराना तरीका (Flat Inference): आप पुस्तकालय में प्रवेश करते हैं और एक ही समय में पूरी इमारत की हर शेल्फ पर रखी हर एक किताब को स्कैन करने की कोशिश करते हैं। आप घबरा जाते हैं और हार मान लेते हैं।
  2. DCI का तरीका:
    • विभाजित करें (Divide): आप 20,000 किताबों को 100-100 किताबों के 200 छोटे ढेरों में बाँट देते हैं।
    • जीते (Conquer): आप AI को केवल एक ढेर (100 किताबें) देखने के लिए कहते हैं। "क्या किताब इस ढेर में है?" AI कहता है, "हाँ, यह 'जानवरों' वाले ढेर में है।"
    • छँटाई करें (Prune): आप बाकी बचे 199 ढेरों को फेंक देते हैं। अब आपके पास जाँचने के लिए केवल 100 किताबें बची हैं।
    • दोहराएं (Repeat): आप उन 100 किताबों को 10-10 किताबों के 10 ढेरों में बाँटते हैं। AI उन्हें चेक करता है, सही समूह को ढूंढ लेता है, और आप बाकी को हटा देते हैं।
    • समाप्त करें (Finish): अंततः, आपके पास केवल कुछ ही किताबें बचती हैं, और AI आसानी से सही किताब को पहचान लेता है।

यह गेम-चेंजर क्यों है?

पेपर इस दृष्टिकोण के तीन प्रमुख लाभों का दावा करता है:

  1. यह छोटे मॉडलों को दिग्गजों जैसा बना देता है:
    आमतौर पर, कठिन समस्याओं को हल करने के लिए आपको एक सुपर-कंप्यूटर के आकार वाले AI (जैसे GPT-4) की आवश्यकता होती है। लेकिन DCI के साथ, एक छोटा, मुफ्त, ओपन-सोर्स AI (जैसे Qwen3-VL) बड़े क्लोज्ड-सोर्स मॉडलों को भी मात दे सकता है। समस्या को छोटे हिस्सों में तोड़कर, छोटा मॉडल शोर (noise) से भ्रमित नहीं होता। यह एक छोटी टॉर्च को आवर्धक लेंस (magnifying glass) देने जैसा है; अचानक यह एक विशाल स्पॉटलाइट जितना ही प्रभावी काम करने लगता है।

  2. यह वास्तव में तेज़ है (जो कि विरोधाभासी लग सकता है):
    आप सोच सकते हैं, "रुको, AI को लगातार 5 बार सूची चेक करने के लिए कहना तो ज़्यादा समय लेना चाहिए।"
    पेपर इसके विपरीत तर्क देता है। क्योंकि AI विशाल सूची (जैसे 20,000 आइटम) के बजाय बहुत छोटी सूचियों (जैसे 10 आइटम) को देख रहा है, इसलिए प्रत्येक चरण के लिए उसे जो गणितीय गणना करनी पड़ती है, वह बहुत सरल है।

  • उपमा: 20,000 सड़कों वाले एक विशाल शहर में नेविगेट करने की तुलना में, 100 सड़कों वाले एक छोटे शहर से गुजरना तेज़ होता है, भले ही आपको कुछ मोड़ लेने पड़ें। इससे प्रोसेसिंग पावर का "ट्रैफिक जाम" टल जाता है।
  1. किसी ट्रेनिंग की आवश्यकता नहीं है:
    यह एक "प्लग-एंड-प्ले" ट्रिक है। आपको AI को फिर से सिखाने या नए डेटा पर करोड़ों डॉलर खर्च करके ट्रेनिंग देने की आवश्यकता नहीं है। आप बस यह बदलते हैं कि आप प्रश्न कैसे पूछते हैं। यह किसी खिलाड़ी को जीतने के लिए आसान बनाने के उद्देश्य से खेल के नियम बदलने जैसा है, बिना खिलाड़ी के कौशल को बदले।

परिणाम

लेखकों ने बड़े डेटासेट्स (जैसे ImageNet-21K, जिसमें 20,000 से अधिक श्रेणियां हैं) पर इसका परीक्षण किया।

  • DCI के बिना: AI की सटीकता गिरकर लगभग शून्य (जैसे 0.5%) हो गई।
  • DCI के साथ: सटीकता नाटकीय रूप से बढ़ गई (जैसे छोटे मॉडलों के लिए 37% या उससे अधिक)।
  • गति: कई मामलों में, AI पुराने तरीके की तुलना में कार्य तेजी से पूरा कर सका क्योंकि वह विशाल सूची के साथ संघर्ष नहीं कर रहा था।

सारांश

यह पेपर उस समस्या को हल करता है जहाँ बहुत अधिक विकल्प होने के कारण AI "विचलित" (distracted) हो जाता है। विकल्पों की एक बड़ी, डरावनी सूची को छोटे, प्रबंधनीय टुकड़ों में तोड़कर, AI अपनी "टॉर्च" को बेहतर ढंग से केंद्रित कर सकता है। यह छोटे, सस्ते AI मॉडलों को बिना किसी अतिरिक्त ट्रेनिंग के, बड़े और महंगे मॉडलों के बराबर या उनसे बेहतर प्रदर्शन करने में सक्षम बनाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →