Language-Conditioned Visual Grounding with CLIP Multilingual
تعزل هذه الورقة المشفر البصري كعامل ثابت عبر ثلاث عشرة لغة لتثبت أن التفاوتات في التأسيس الأرضي البصري متعدد اللغات تنبع أساساً من قيود فرع النص وعدم المحاذاة المكانية بدلاً من انهيار الإشارة، مما يكشف أن توسيع النموذج البصري يحسن بعض اللغات ذات الموارد المنخفضة بينما يؤدي إلى تفاقم الوضع في لغات أخرى ويؤكد الجدوى الفعالة من حيث استهلاك الطاقة للمنهجية.