Language-Conditioned Visual Grounding with CLIP Multilingual
यह शोध पत्र तेरह भाषाओं में एक सुसंगत कारक के रूप में विज़ुअल एनकोडर को अलग करता है ताकि यह प्रदर्शित किया जा सके कि बहुभाषी विज़ुअल ग्राउंडिंग विषमताएं मुख्य रूप से सिग्नल कोलैप्स के बजाय टेक्स्ट-ब्रांच सीमाओं और स्थानिक मिसअलाइनमेंट से उत्पन्न होती हैं, जो यह प्रकट करता है कि विज़ुअल मॉडल को स्केल करने से कुछ कम-संसाधन वाली भाषाओं में सुधार होता है जबकि अन्य में यह विषमता बढ़ा देता है और विधि की ऊर्जा-कुशल व्यवहार्यता की पुष्टि करता है।