← नवीनतम पेपर
💬 NLP

Phrase-Instance Alignment for Generalized Referring Segmentation

यह शोध पत्र जेनेरालाइज्ड रेफरिंग सेगमेंटेशन के लिए एक नवीन इंस्टेंस-अवेयर फ्रेमवर्क प्रस्तावित करता है जो टास्क को 'फ्रेज़-ऑब्जेक्ट एलाइनमेंट लॉस' और एक एकीकृत एकत्रीकरण तंत्र का उपयोग करके 'फ्रेज़-इंस्टेंस एलाइनमेंट' के रूप में पुनर्गठित करता है, जिससे सिंगल, मल्टीपल और नुल टारगेट परिदृश्यों को प्रभावी ढंग से संभालते हुए gRefCOCO और Ref-ZOM बेंचमार्क पर अत्याधुनिक प्रदर्शन प्राप्त होता है।

मूल लेखक: E-Ro Nguyen, Hieu Le, Dimitris Samaras, Michael S. Ryoo

प्रकाशित 2026-03-26
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: E-Ro Nguyen, Hieu Le, Dimitris Samaras, Michael S. Ryoo

मूल पेपर CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/) के तहत सार्वजनिक डोमेन को समर्पित है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप पार्क की एक व्यस्त तस्वीर देख रहे हैं और कोई आपसे कहता है कि "लाल शर्ट पहने हुए एक आदमी और उसके साथ एक कुत्ता, और दाईं ओर वाला कुत्ता दिखाओ।"

अतीत में, कंप्यूटर विज़न मॉडल एक अनाड़ी चित्रकार की तरह थे जिसने इस निर्देश को सुना और पूरे दृश्य पर एक बड़ा, बिखरा हुआ पेंट का धब्बा लगा दिया, जिससे वह आदमी और कुत्ते दोनों को एक ही विशाल, अनिर्धारित आकार से ढकने की कोशिश करता था। वे आदमी, कुत्ते या पृष्ठभूमि में मौजूद अन्य लोगों के बीच अंतर नहीं कर पाते थे। वे पूरे वाक्य को एक ही "चीज़" के रूप में देखते थे।

यह पेपर InstAlign नामक एक नई विधि पेश करता है जो एक बिखरे हुए चित्रकार के बजाय एक चतुर जासूस की तरह काम करती है। यह कैसे काम करता है, इसे सरल अवधारणाओं में यहाँ समझाया गया है:

1. समस्या: "धब्बा" दृष्टिकोण (The "Blob" Approach)

इस कार्य के लिए वर्तमान AI मॉडल आमतौर पर एक ही बार में उत्तर का अनुमान लगाने की कोशिश करते हैं। वे वाक्य और चित्र को देखते हैं और कहते हैं, "ठीक है, मुझे लगता है कि यह पूरा क्षेत्र वही है जो आप चाहते हैं।"

  • खामी: यदि वाक्य जटिल है (जैसे, "बाईं ओर दो आदमी"), तो AI भ्रमित हो जाता है। यह शायद पूरे बाएं हिस्से पर पेंट कर दे, जिसमें वे लोग भी शामिल हों जो वे आदमी नहीं हैं, या यह एक आदमी को पूरी तरह से छोड़ भी सकता है। वे वाक्य को विशिष्ट संकेतों के सेट के बजाय एक एकल, सपाट निर्देश के रूप में देखते हैं।

2. समाधान: "जासूसों की टोली" (Instance-Aware Reasoning)

एक बड़ा धब्बा अनुमान लगाने के बजाय, InstAlign इस काम को विभाजित करता है। कल्पना कीजिए कि AI चित्र में 100 छोटे जासूसों (जिन्हें "ऑब्जेक्ट क्वेरीज़" कहा जाता है) की एक टोली भेजता है।

  • प्रत्येक जासूस एक विशिष्ट वस्तु की तलाश कर रहा है।
  • एक जासूस को एक लड़की मिल सकती है। दूसरा एक छोटा कुत्ता पाता है। तीसरा एक बड़ा कुत्ता पाता है।
  • महत्वपूर्ण बात यह है कि AI केवल उन्हें ढूंढता ही नहीं है; वह प्रत्येक जासूस से पूछता है: "आपकी खोज वाक्य के शब्दों से कितनी मेल खाती है?"

3. गुप्त हथियार: फ्रेज़-ऑब्जेक्ट अलाइनमेंट (Phrase-Object Alignment - POA)

यही इस पेपर का सबसे बड़ा नवाचार है। यह एक जासूस को विशिष्ट शब्दों को हाइलाइट करने वाले आवर्धक लेंस (magnifying glass) देने जैसा है।

  • पुराना तरीका: AI केवल अस्पष्ट रूप से "महसूस" करता है कि टेक्स्ट और इमेज आपस में संबंधित हैं।
  • InstAlign का तरीका: AI एक सख्त संबंध स्थापित करता है।
    • "छोटा कुत्ता" रखने वाला जासूस वाक्य में "छोटा कुသာ" शब्दों को देखने के लिए मजबूर किया जाता है और कहता है, "हाँ, मैं इन शब्दों से पूरी तरह मेल खाता हूँ।"
    • "लड़की" वाला जासूस "एक लड़की जो पकड़ती है..." शब्दों को देखता है और कहता है, "मैं उनसे मेल खाता हूँ।"
    • "दाईं ओर वाला कुत्ता" वाला जासूस वाक्य के पहले भाग को अनदेखा करता है और केवल "दाईं ओर वाला कुत्ता" पर ध्यान केंद्रित करता है।

इससे एक सूक्ष्म मानचित्र (fine-grained map) बनता है जहाँ वाक्य का हर हिस्सा चित्र की एक विशिष्ट वस्तु से स्पष्ट रूप से जुड़ा होता है। यह शब्द "कुत्ता" से सीधे फोटो में मौजूद विशिष्ट कुत्ते तक एक रेखा खींचने और "लड़की" से लड़की तक एक अलग रेखा खींचने जैसा है।

4. अंतिम चरण: "स्मार्ट मिक्सर" (Relevance-Weighted Aggregation)

एक बार जब जासूस अपना काम कर लेते हैं, तो AI को उनके निष्कर्षों को अंतिम उत्तर में मिलाने की आवश्यकता होती है।

  • यदि वाक्य "लड़की और कुत्ता" है: AI देखता है कि "लड़की जासूस" और "कुत्ता जासूस" दोनों का स्कोर अधिक है। यह उनके मास्क को मिलाकर अंतिम चित्र बनाता है।
  • यदि वाक्य "सोफे पर हाथी" है (लेकिन वहाँ कोई हाथी नहीं है): AI सभी जासूसों की जांच करता है। उनमें से किसी ने भी मैच नहीं पाया। "नो-टारगेट प्रेडिक्टर" (एक विशेष अलार्म बेल) बज उठता है और कहता है, "हे, किसी ने भी वह नहीं पाया जो आपने मांगा था!" यह AI को वहां हाथी दिखाने (hallucinating) से रोकता है जो वहां मौजूद ही नहीं है।

यह एक बड़ी बात क्यों है?

इसे एक बच्चे की लकीरों और एक पेशेवर मानचित्र के बीच के अंतर के रूप में सोचें।

  • पुराने मॉडल: पार्क के चारों ओर एक बड़ा घेरा बनाते हैं और कहते हैं, "यहाँ पार्क है।"
  • InstAlign: लड़की के चारों ओर एक सटीक रूपरेखा खींचता है, कुत्ते के चारों ओर एक सटीक रूपरेखा खींचता है, और फिर उन्हें तभी जोड़ता है जब निर्देश ऐसा करने को कहें।

परिणाम

लेखकों ने दो प्रमुख बेंचमार्क (gRefCOO और Ref-ZOM) पर इसका परीक्षण किया।

  • स्कोर: उन्होंने सटीकता में महत्वपूर्ण अंतर से सुधार किया (जटिल मिलान पर 3% से अधिक और "नो टारगेट" मामलों को पहचानने में 12% से अधिक)।
  • मुख्य निष्कर्ष: यह सुनिश्चित करके कि AI यह समझे कि एक वाक्य हिस्सों से बना है जो चित्र के हिस्सों के अनुरूप होते हैं, मॉडल बहुत अधिक स्मार्ट, सटीक और कठिन, जटिल विवरणों को संभालने में बेहतर हो जाता है।

संक्षेप में: InstAlign AI को एक बार में पूरी तस्वीर का अनुमान लगाने से रोकता है। इसके बजाय, यह AI को वाक्य को टुकड़ों में तोड़ने, प्रत्येक टुकड़े के लिए मिलान वाली वस्तु खोजने और फिर सावधानीपूर्वक सही टुकड़ों को जोड़ने के लिए प्रशिक्षित करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →