← नवीनतम पेपर
🤖 AI

GenSeg-R1: RL-Driven Vision-Language Grounding for Fine-Grained Referring Segmentation

GenSeg-R1 एक विलगित "रीज़न-देन-सेगमेंट" (reason-then-segment) ढांचे को पेश करता है जो SAM 2 के लिए संरचित स्थानिक प्रॉम्प्ट उत्पन्न करने हेतु विजन-लैंग्वेज मॉडल्स को फाइन-ट्यून करने के लिए ग्रुप रिलेटिव पॉलिसी ऑप्टिमाइज़ेशन (GRPO) का उपयोग करता है, जिससे बिना किसी पर्यवेक्षित रीजनिंग-चेन एनोटेशन के फाइन-ग्रेन्ड रेफरिंग इमेज सेगमेंटेशन में अत्याधुनिक प्रदर्शन प्राप्त होता है।

मूल लेखक: Sandesh Hegde, Jaison Saji Chacko, Debarshi Banerjee, Uma Mahesh

प्रकाशित 2026-02-11
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Sandesh Hegde, Jaison Saji Chacko, Debarshi Banerjee, Uma Mahesh

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही प्रतिभाशाली, लेकिन कभी-कभी अति-उत्साही रोबोट के साथ "I Spy" (मैं देख रहा हूँ) का एक उच्च-दांव वाला खेल खेल रहे हैं।

अतीत में, यदि आप रोबोट को कहते, "मैं नीली शर्ट पहने हुए एक व्यक्ति को देख रहा हूँ," लेकिन कमरे में हर कोई वास्तव में लाल रंग पहने हुए था, तो रोबट घबरा जाता था। वह यह कहने के बजाय कि, "मुझे नीला पहने हुए कोई नहीं दिख रहा," एक लाल शर्ट पहने व्यक्ति की ओर उंगली दिखाते हुए कहता, "मिल गया!" वह आपको खुश करने की इतनी कोशिश कर रहा था कि वह आत्मविश्वास के साथ गलत साबित हो गया।

यह पेपर GenSeg-R1 पेश करता है, जो रोबोट्स को प्रशिक्षित करने का एक नया तरीका है ताकि वे न केवल तेज़ हों, बल्कि वास्तव में विचारशील और ईमानदार भी हों।

GenSeg-R1 के तीन घटक

"अति-उत्साही रोबोट" की समस्या को ठीक करने के लिए, शोधकर्ताओं ने तीन घटकों का उपयोग किया:

1. "कार्य करने से पहले सोचो" वाला मस्तिष्क (VLM)

रोबोट को केवल एक छवि देखने और तुरंत इशारा करने के बजाय, उन्होंने उसे एक मस्तिष्क दिया (जो Qwen3-VL नामक मॉडल पर आधारित है) जिसे तर्क (reasoning) करने के लिए प्रशिक्षित किया गया है।

  • उपमा: इसे एक शेफ (रसोइया) की तरह समझें। पुराना रोबोट उस शेफ की तरह है जो सामग्री देखते ही उन्हें पैन में डाल देता है। GenSeg-R1 उस शेफ की तरह है जो रुकता है, रेसिपी को देखता है, सोचता है, "ठीक है, मुझे लहसुन चाहिए, लेकिन मुझे यहाँ लहसुन नहीं दिख रहा है," और फिर तय करता है कि खाना बनाना शुरू करना है या नहीं। यह "सोचना" किसी भी कदम को उठाने से पहले एक विशेष "थॉट बबल" (विचार के बुलबुले) में होता है।

2. "मास्टर आर्टिस्ट" (SAM 2)

रोबोट का मस्तिष्क वास्तव में वस्तु की अंतिम, सटीक रूपरेखा (outline) नहीं बनाता है। इसके बजाय, यह एक निर्देशक (Director) की तरह कार्य करता है। यह वस्तु की ओर इशारा करता है और कहता है, "यह मोटे तौर पर इस बॉक्स में है, और यहाँ इसके दो विशिष्ट स्थान हैं।" फिर यह इन निर्देशों को एक "मास्टर आर्टिस्ट" (SAM 2 नामक मॉडल) को सौंप देता है, जो वस्तुओं की सटीक, पिक्सेल-परफेक्ट रूपरेखा बनाने में अविश्वसनीय रूप से कुशल है।

3. "स्मार्ट कोच" (GRPO ट्रेनिंग)

यही असली जादू है। आमतौर पर, हम रोबोट्स को हजारों "सही" उत्तर दिखाकर सिखाते हैं (जैसे एक शिक्षक छात्र को गणित का पूरा हल दिखाया करता है)। लेकिन इसमें बहुत अधिक काम लगता है।

इसके बजाय, शोधकर्ताओं ने रीइन्फोर्समेंट लर्निंग (GRープ GRPO Training) का उपयोग किया।

  • उपमा: एक बास्केटबॉल खिलाड़ी को कोचिंग देने की कल्पना करें। आप उन्हें हर एक परफेक्ट शॉट का वीडियो नहीं दिखाते। इसके बजाय, आप उन्हें 100 बार शॉट मारने देते हैं। यदि गेंद अंदर जाती है, तो आप उन्हें उच्च स्कोर देते हैं; यदि वे चूक जाते हैं, तो आप उन्हें कम स्कोर देते हैं।
  • इस पेपर में, "कोच" मास्टर आर्टिस्ट है। रोबलेट एक वस्तु की ओर इशारा करने की कोशिश करता है, आर्टिस्ट मास्क (mask) बनाता है, और यदि मास्क वास्तविक वस्तु से मेल खाता है, तो रोबोट को एक "पुरस्कार" मिलता है। महत्वपूर्ण बात यह है कि यदि रोबोट ऐसी चीज़ की ओर इशारा करता है जो वहाँ मौजूद नहीं है, तो कोच उसे "दंड" देता है। यह रोबोट को ईमानदार होना सिखाता है: "अगर मैं इसे नहीं ढूँढ सकता, तो मैं बस कह दूँगा कि मैं इसे नहीं ढूँढ पा रहा हूँ।"

यह एक बड़ी बात क्यों है?

  1. यह ईमानदार है: परीक्षणों में (GRefCOCO नामक डेटासेट का उपयोग करते हुए), जहाँ पुराने रोबोट अस्तित्वहीन वस्तुओं की कल्पना (hallucinating) कर रहे थे, वहीं GenSeg-R1 82% से अधिक समय में सही ढंग से कह पाने में सक्षम था, "नहीं, यहाँ कोई लक्ष्य नहीं है।"
  2. यह स्मार्ट है: यह जटिल "पहेलियों" को संभाल सकता है। यदि आप कहते हैं, "कागज काटने के काम आने वाली वस्तु को ढूँढो," तो रोबोट केवल "कैंची" शब्द को नहीं ढूँढता—वह इशारा करने से पहले वास्तव में वस्तु के कार्य (function) के माध्यम से तर्क करता है।
  3. यह कुशल है: इस रोबोट के "छोटे" संस्करण (4B मॉडल) भी बहुत बड़े, पुराने रोबोटों को पीछे छोड़ रहे हैं। यह ऐसा है जैसे एक हल्का मिडिलवेट बॉक्सर एक हैवीवेट को इसलिए हरा रहा है क्योंकि मिडिलवेट की रणनीति बेहतर है।

सारांश

GenSeg-R1 एक "अनुमान लगाने वाली मशीन" को "तर्क करने वाली मशीन" में बदल देता है। यह AI को एक दृश्य को देखने, आपकी अनुरोध की तर्क प्रक्रिया को समझने, एक विशेषज्ञ को सटीक संकेत देने और—सबसे महत्वपूर्ण—यह स्वीकार करने की ईमानदारी सिखाता है कि वह जो आप ढूँढ रहे हैं उसे नहीं ढूँढ सकता।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →