Decomposed Vision-Language Alignment for Fine-Grained Open-Vocabulary Segmentation
यह शोध पत्र एक विखंडित विजन-लैंग्वेज अलाइनमेंट (Decomposed Vision-Language Alignment) ढांचे का प्रस्ताव करता है जो टेक्स्ट प्रॉम्प्ट्स को कॉन्सेप्ट और एट्रिब्यूट टोकन में विभाजित करके और कंपोजिशनल सिमेंटिक्स को लागू करने के लिए एक फीचर-गेटेड क्रॉस-अटेंशन मॉड्यूल का उपयोग करके फाइन-ग्रैन्ड ओपन-वोकेबुलरी सेगमेंटेशन को बढ़ाता है, जिससे अनदेखे एट्रिब्यूट-कैटेगरी संयोजनों के प्रति सामान्यीकरण में महत्वपूर्ण सुधार होता है।