← नवीनतम पेपर
💻 computer science

Reasoning-Guided Part-Level Visual Grounding via Reinforcement Learning

यह शोध पत्र OP-HRG को प्रस्तुत करता है, जो एक सुदृढीकरण लर्निंग (reinforcement learning) आधारित फ्रेमवर्क है जो एक मोटे-से-सूक्ष्म पदानुक्रमित तर्क (coarse-to-fine hierarchical reasoning) रणनीति और आत्म-चिंतनशील सुधार (self-reflective correction) को नियोजित करके मल्टीमॉडल मॉडलों में पार्ट-लेवल विजुअल ग्राउंडिंग में सुधार करता है, जिससे एक 4B मॉडल को कई बेंचमार्क पर बड़े 7B ग्राउंडिंग LLMs और SAM3 से बेहतर प्रदर्शन करने में सक्षम बनाया जा सकता है।

मूल लेखक: Kazi Sajeed Mehrab, Hani Alomari, Najibul Haque Sarker, Chia-Wei Tang, Zaber Ibn Abdul Hakim, Anuj Karpatne, Chris Thomas

प्रकाशित 2026-07-20
📖 8 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Kazi Sajeed Mehrab, Hani Alomari, Najibul Haque Sarker, Chia-Wei Tang, Zaber Ibn Abdul Hakim, Anuj Karpatne, Chris Thomas

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को दुनिया देखना सिखा रहे हैं। आप उसे एक कॉफी मग की तस्वीर दिखाते हैं और पूछते हैं, "मग कहाँ है?" रोबोट, जो एक विशाल आर्टिफिशियल इंटेलिजेंस मस्तिष्क यानी मल्टीमॉडल लार्ज लैंग्वेज मॉडल (MLLM) द्वारा संचालित है, पूरे कप की ओर आत्मविश्वास से इशारा करता है। यह पूरी वस्तुओं को खोजने में बहुत अच्छा है। लेकिन फिर, आप उससे एक कठिन सवाल पूछते हैं: "हैंडल कहाँ है?" अचानक, रोबिमट भ्रमित हो जाता है। वह अभी भी पूरे मग की ओर इशारा करता है, उस विशिष्ट छोटे लूप को अनदेखा कर देता है जिसके बारे में आपने पूछा था। ऐसा इसलिए होता है क्योंकि रोबोट को मुख्य रूप से बड़ी, पूरी चीजों को पहचानने के लिए प्रशिक्षित किया गया है, और उसे उन छोटी, विशिष्ट चीजों पर ध्यान केंद्रित करने में संघर्ष करना पड़ता है जो उन चीजों को बनाती हैं।

यह शोध पत्र ठीक इसी समस्या को हल करता है। शोधकर्ता इन AI दिमागों को यह सिखाना चाहते थे कि केवल अनुमान लगाना बंद करें और एक इंसान की तरह सोचना शुरू करें: पहले बड़ी चीज़ खोजें, फिर उसके अंदर छोटी चीज़ खोजने के लिए देखें। उन्होंने केवल रोबोट को याद करने के लिए अधिक चित्र नहीं दिए; इसके बजाय, उन्होंने इसे "सोचने" और अपना "काम चेक करने" का एक नया तरीका सिखाया, जिसे 'रीइन्फोर्समेंट लर्निंग' (Reinforcement Learning) नामक एक चतुर प्रशिक्षण पद्धति का उपयोग करके लागू किया गया। यह एक चेकलिस्ट और रिवॉर्ड सिस्टम देने जैसा है जो कहता है, "अच्छा काम किया, मग ढूंढने के लिए, लेकिन अब आपको अतिरिक्त अंक मिलेंगे यदि आप पूरे कप को शामिल किए बिना मग के अंदर हैंडल भी ढूंढ सकते हैं।"

समस्या: "पूरा मग" वाला पूर्वाग्रह (The "Whole Mug" Bias)

एक AI मॉडल को एक ऐसे छात्र के रूप में सोचें जिसने दस लाख फ्लैशकार्ड पढ़े हैं। हर कार्ड पर, एक कुत्ते की तस्वीर और शब्द "कुत्ता" है। छात्र कुत्तों को पहचानने में बहुत कुशल हो जाता है। लेकिन यदि आप उन्हें एक कुत्ते की तस्वीर दिखाएं और पूछें, "कुत्ते का कान कहाँ है?", तो वे शायद अभी भी पूरे कुत्ते की ओर ही इशारा करेंगे। उन्होंने यह नहीं सीखा है कि एक कान कुत्ते का एक हिस्सा है, जो पूंछ या पंजों से अलग है।

कंप्यूटर विजन की दुनिया में, यह एक बड़ी बात है। यदि किसी रोब-बॉट को उसके हैंडल से मग उठाने की आवश्यकता है, या किसी डॉक्टर को किसी अंग पर एक विशिष्ट ट्यूमर का पता लगाने की आवश्यकता है, तो केवल पूरी वस्तु की ओर इशारा करना पर्याप्त नहीं है। वर्तमान AI मॉडल "ऑब्जेक्ट-लेवल" विशेषज्ञ हैं लेकिन "पार्ट-लेवल" नौसिखिए हैं। वे आलसी होते हैं, वे उस विशिष्ट टुकड़े को अलग करने की मेहनत करने के बजाय सबसे आसान, सबसे बड़ा बॉक्स पकड़ लेते हैं जिसे वे ढूंढ सकते हैं।

समाधान: एक तीन-चरणीय जासूसी खेल

लेखकों ने, जो वर्जीनिया टेक की एक टीम है, ऑब्जेक्ट-पार्ट हिरार्किकल रिफ्लेक्टिव ग्राउंडिंग (OP-HRG) नामक एक नई रणनीति विकसित की। AI को एक ही बड़े कदम में उत्तर का अनुमान लगाने के लिए कहने के बजाय, उन्होंने कार्य को एक संरचित, चरण-दर-चरण जासूसी खेल में विभाजित कर दिया।

यहाँ बताया गया है कि AI को कैसे खेलना सिखाया जाता है:

  1. चरण 1: पैरेंट (जनक) को खोजें (पहले "मग")
    जब AI "मग हैंडल" (Mug handle) क्वेरी देखता है, तो वह सीधे हैंडल पर नहीं कूदता। पहले, उसे पैरेंट ऑब्जेक्ट की पहचान करनी होती है: स्वयं मग। वह पूरे मग के चारों ओर एक बॉक्स बनाता है। यह एक "सर्च ज़ोन" के रूप में कार्य करता है। यह एक बच्चे को यह बताने जैसा है, "पूरे घर में लाल मोज़े मत ढूंढो; पहले लॉन्ड्री बास्केट के अंदर ढूंढो।"

  2. चरण 2: भाग (मग के अंदर का "हैंडल") को खोजें
    अब जब AI के पास "सर्च ज़ोन" (मग) है, तो वह हैंडल को खोजने के लिए उस बॉक्स के अंदर देखता है। वह केवल हैंडल के लिए एक छोटा बॉक्स बनाता है। यह AI को यह समझने के लिए मजबूर करता है कि हैंडल मग के अंदर है, न कि केवल चित्र में कहीं तैर रहा है।

  3. चरण 3: आत्म-जांच (Self-Check) ("रुको, मुझे करीब से देखने दो" वाला क्षण)
    यह सबसे शानदार हिस्सा है। अपने बॉक्स बनाने के बाद, AI को अपने काम की समीक्षा करनी होती है। वह खुद से पूछता है: "क्या मैंने हैंडल का बॉक्स बहुत बड़ा बनाया? क्या मैंने गलती से पूरे मग को शामिल कर लिया?"

  • एक्टिव परसेप्शन ट्विस्ट: इस आत्म-जांच में मदद करने के लिए, AI वास्तव में उस हैंडल की तस्वीर को "काटकर निकालता" है जिसे उसने अभी बनाया है और उसे करीब से देखता है। वह इस क्रॉप की गई इमेज का पुन: विश्लेषण करता है ताकि देख सके कि क्या बॉक्स पर्याप्त सटीक है। यदि बॉक्स बहुत ढीला है, तो वह निर्देशांक (coordinates) को समायोजित करता है। यदि यह एकदम सही है, तो वह इसे वैसा ही छोड़ देता है।

हमने इसे कैसे सिखाया: एक वीडियो गेम रिवॉर्ड सिस्टम

आप केवल एक AI को "बेहतर बनो" नहीं कह सकते। आपको उसे सही काम करने पर पुरस्कृत करना होगा। शोधकर्ताओं ने रीइन्फोर्समेंट लर्निंग (विशेष रूप से GRPO) का उपयोग किया। इसे एक कुत्ते को ट्रीट (treats) देकर प्रशिक्षित करने जैसा समझें, लेकिन यहाँ ट्रीट डिजिटल अंक हैं।

उन्होंने AI के लिए विशेष नियमों (रिवॉर्ड्स) का एक सेट बनाया:

  • "पैरेंट" रिवॉर्ड: आपको पहले पूरे मग को सही ढंग से खोजने के लिए अंक मिलते हैं।
  • "कंटेनमेंट" (Containment) रिवॉर्ड: आपको अंक तभी मिलते हैं जब हैंडल का बॉक्स मग के बॉक्स के अंदर हो। यदि हैंडल का बॉक्स बाहर तैर रहा है या पूरे मग को कवर कर रहा है, तो आपको शून्य अंक मिलते हैं।
  • "कॉम्पैक्टनेस" (Compactness) रिवॉर्ड: यदि आपका बॉक्स सटीक है और इसमें अनावश्यक बैकग्राउंड शामिल नहीं है, तो आपको अतिरिक्त अंक मिलते हैं।
  • "इम्प्रूवमेंट" (Improvement) रिवॉर्ड: यदि AI चरण 2 में एक खराब बॉक्स बनाता है, लेकिन चरण 3 (आत्म-जांच) में उसे ठीक कर देता है, तो उसे बोनस मिलता है। यह AI को सिखाता है कि एक बार सही अनुमान लगाने से बेहतर है कि गलती करना और फिर उसे सुधारना।

परिणाम: छोटा दिमाग, बड़ी जीत

टीम ने इस पद्धति का परीक्षण एक अपेक्षाकृत छोटे AI मॉडल (4 बिलियन पैरामीटर्स) का उपयोग करके किया और इसकी तुलना बड़े मॉडलों (7 बिलियन पैरामीटर्स) और अन्य अत्याधुनिक प्रणालियों से की।

परिणाम आश्चर्यजनक थे। उनके 4-बिलियन-पैरामीटर वाले मॉडल ने, जिसे इस "जासूसी खेल" और विशेष रिवॉर्ड्स के साथ प्रशिक्षित किया गया था, वास्तव में कई बेंचमार्क पर बड़े और अधिक शक्तिशाली मॉडलों को पछाड़ दिया।

  • PascalPart डेटासेट पर, उनका स्कोर 38.59 (gIoU नामक सटीकता का एक माप) था, जो पिछले सर्वश्रेष्ठ 27.44 से बेहतर था।
  • PartImageNet पर, उन्होंने 56.87 स्कोर किया, जो पिछले सर्वश्रेष्ठ 45.59 से बेहतर था।

इससे भी अधिक प्रभावशाली बात यह है कि उन्होंने दिखाया कि इस प्रशिक्षण ने AI को पूरे ऑब्जेक्ट खोजने में "मूर्ख" नहीं बनाया। यह भागों को खोजने में बेहतर हो गया और साथ ही पूरे ऑब्जेक्ट को खोजने में भी सक्षम रहा।

उन्होंने क्या खारिज किया

शोधकर्ताओं ने यह साबित करने के लिए सावधानी बरती कि उनकी सफलता केवल इसलिए नहीं थी क्योंकि उन्होंने अधिक डेटा या बेहतर "अनुमान लगाने" वाला एल्गोरिदम दिया था।

  • यह केवल डेटा नहीं था: उन्होंने अन्य मॉडलों को उसी पार्ट-केंद्रित डेटा पर प्रशिक्षित करने का प्रयास किया, लेकिन बिना उनके विशेष चरण-दर-चरण नियमों के, वे मॉडल अधिक सुधार करने में विफल रहे। "जासूसी खेल" की संरचना आवश्यक थी।
  • यह केवल "सेल्फ-चेक" नहीं था: उन्होंने पाया कि हालांकि सेल्फ-चेक स्टेप (क्रॉप की गई इमेज को देखना) ने मदद की, लेकिन सबसे महत्वपूर्ण हिस्सा प्रारंभिक "पहले पैरेंट को खोजें" वाला चरण था। सेल्फ-चेक ने मुख्य रूप से AI को प्रशिक्षण के दौरान अधिक सटीक होने में मदद की, जैसे कोई कोच खिलाड़ी के फॉर्म को सुधार रहा हो।
  • यह केवल मास्क डिकोडर नहीं था: उन्होंने उस टूल को बदल दिया जिसका उपयोग AI अंतिम आकार बनाने के लिए करता है (मास्क डिकोडर), और पाया कि सुधार AI की तर्क क्षमता (reasoning) से आया, न कि ड्राइंग टूल से।

यह क्यों मायने रखता है

यह शोध पत्र सुझाव देता है कि हमें कठिन समस्याओं को हल करने के लिए आवश्यक रूप से बड़े, अधिक महंगे AI दिमाग बनाने की आवश्यकता नहीं है। इसके बजाय, हम जो दिमाग हमारे पास पहले से हैं, उन्हें एक स्मार्ट और अधिक संरचित तरीके से सोचना सिखा सकते हैं। AI को एक समस्या को तोड़ने के लिए मजबूर करके (ऑब्जेक्ट खोजें -> भाग खोजें -> काम चेक करें) और उस तर्क का पालन करने के लिए पुरस्कृत करके, हम उस स्तर के विवरण को अनलॉक कर सकते हैं जो पहले पहुंच से बाहर था। यह एक याद दिलाता है कि कभी-कभी, जंगल को देखने का सबसे अच्छा तरीका पहले पेड़ों को खोजना है, और फिर बारीकी से पत्तियों को देखना है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →