SocialFusion: Addressing Social Degradation in Pre-trained Vision-Language Models
यह शोधपत्र SocialFusion को प्रस्तुत करता है, जो एक ऐसा ढांचा है जो फ्रोजन एनकोडर और लैंग्वेज मॉडल्स के बीच न्यूनतम कनेक्शन सीखकर प्री-ट्रेंड विजन-लैंग्वेज मॉडल्स में "सोशल डिग्रेडेशन" को कम करता है, जिससे कई सोशल परसेप्शन कार्यों में सकारात्मक ट्रांसफर और बेहतर प्रदर्शन सक्षम होता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
बड़ी समस्या: "ज़रूरत से ज़्यादा पढ़ा हुआ" विशेषज्ञ
कल्पना कीजिए कि आपके पास एक शानदार कला समीक्षक (art critic) है जिसने अपना पूरा जीवन कला, इतिहास और साहित्य पर लाखों किताबें पढ़ने में बिताया है। वे भाषा और सामान्य ज्ञान के उस्ताद हैं। यह एक विज़न-लैंग्वेज मॉडल (VLM) की तरह है—एक शक्तिशाली AI जिसे भारी मात्रा में टेक्स्ट और छवियों पर प्रशिक्षित किया गया है।
अब, कल्पना कीजिए कि आप इस विशेषज्ञ से दोस्तों के एक समूह के पिकनिक मनाने के एक मूक वीडियो (silent movie) को देखने और आपको बताने के लिए कहते हैं:
- कौन किसकी ओर देख रहा है?
- लाल शर्ट वाले व्यक्ति का इशारा (gesture) क्या है?
- क्या दो लोग बहस कर रहे हैं या हंस रहे हैं?
- उनके चेहरे के भाव क्या हैं?
आप उम्मीद करेंगे कि यह विशेषज्ञ इसमें माहिर होगा। लेकिन, शोधपत्र में कुछ आश्चर्यजनक पाया गया: वे वास्तव में इसमें और खराब हो जाते हैं।
जब इन AI मॉडलों को विशाल, सामान्य डेटासेट (जैसे बिल्ली, कार और परिदृश्य का वर्णन करना) पर प्रशिक्षित किया जाता है, तो उनमें एक ऐसी स्थिति विकसित हो जाती है जिसे लेखक "सोशल डिग्रेडेशन" (सामाजिक क्षरण) कहते हैं। यह ऐसा है जैसे विशेषज्ञ इस बात पर इतना केंद्रित हो गया कि वह वस्तु क्या है (जैसे, "वह एक फ्रिसबी है") इसका वर्णन करने लगा, कि वह सूक्ष्म सामाजिक संकेतों (जैसे, "वह व्यक्ति फ्रिसबी की ओर इसलिए देख रहा है क्योंकि वह ईर्ष्या महसूस कर रहा है") को पढ़ना भूल गया। सामान्य प्रशिक्षण ने वास्तव में उनकी मानवीय अंतःक्रियाओं (human interactions) को समझने की क्षमता को "विकृत" या नुकसान पहुँचाया।
प्रयोग: नुकसान का परीक्षण
शोधकर्ताओं ने तीन लोकप्रिय, शक्तिशाली AI मॉडल्स (Qwen2-VL, Sail-VL, और MolmoE) का पांच अलग-अलग "सामाजिक" कार्यों पर परीक्षण किया:
- इशारे (Gestures): हाथ के संकेतों (जैसे शांति का संकेत) को पहचानना।
- नज़र (Gaze): यह पता लगाना कि कोई व्यक्ति कहाँ देख रहा है।
- भाव (Expressions): घृणा या खुशी जैसी भावनाओं का पता लगाना।
- बातचीत (Conversation): यह जानना कि कौन किससे बात कर रहा है।
- संबंध (Relationships): अनुमान लगाना कि दो लोग दोस्त, परिवार या अजनबी हैं।
परिणाम: जब उन्होंने इन मॉडलों को एक ही समय में ये सभी कार्य सिखाने की कोशिश की, तो मॉडल विफल रहे। एक-दूसरे की मदद करने के बजाय, ये कार्य एक-दूसरे के विरुद्ध लड़ने लगे। मॉडल अकेले एक चीज़ सीखने की तुलना में, सब कुछ एक साथ सीखने पर खराब प्रदर्शन करते रहे। इसे "नेगेटिव ट्रांसफर" (negative transfer) कहा जाता है।
निदान: ऐसा क्यों हो रहा है?
शोधकर्ताओं ने जांच की कि सामान्य प्रशिक्षण ने सामाजिक कौशल को क्यों बर्बाद कर दिया। उन्होंने दो चीजों को देखा:
- डिकोडेबिलिटी (क्या हम संकेत पढ़ सकते हैं?): उन्होंने जांचा कि क्या AI का "मस्तिष्क" (विज़ुअल एनकोडर) अभी भी सामाजिक संकेतों के बारे में कच्ची जानकारी रखता है। उन्होंने पाया कि सामान्य प्रशिक्षण के बाद, संकेत धुंधला हो गया था। यह ऐसा था जैसे विशेषज्ञ की आँखें अभी भी काम कर रही थीं, लेकिन उनके मस्तिष्क का वह हिस्सा जो सामाजिक अर्थ की व्याख्या करता है, अन्य सभी सामान्य ज्ञान से धुंधला हो गया था।
- अनुकूलता (क्या कार्य आपस में तालमेल रखते हैं?): उन्होंने जांचा कि क्या कार्य आपस में लड़ रहे थे। उन्होंने थोड़ा संघर्ष पाया, लेकिन मुख्य समस्या यह थी कि संकेत स्वयं ही बहुत कमजोर था।
समाधान: सोशलफ्यूजन (SocialFusion - "विशेष इंटर्न")
इसे ठीक करने के लिए, लेखकों ने SocialFusion नामक एक नया मॉडल बनाया।
"धुंधले" विशेषज्ञ को ठीक करने के बजाय, उन्होंने एक ताज़ा, साफ लेंस का उपयोग करने का निर्णय लिया।
- फ्रोजन आई (The Frozen Eye): उन्होंने एक विज़ुअल एनकोडर (वह हिस्सा जो छवियों को देखता है) लिया जिसे उस विशाल, सामान्य "सोशल डिग्रेडेशन" प्रशिक्षण से नहीं गुजारा गया था। इसे "फ्रोजन" (अछूता) रखा गया था ताकि बारीक विवरण देखने की इसकी क्षमता तीक्ष्ण बनी रहे।
- मिनिमल कनेक्टर (The Minimal Connector): उन्होंने इस तीक्ष्ण आँख को भाषा मॉडल (वह हिस्सा जो बोलता है) से जोड़ने के लिए एक बहुत ही सरल पुल बनाया।
- रणनीति: उन्होंने आँख को फिर से प्रशिक्षित करने की कोशिश नहीं की। उन्होंने बस भाषा मॉडल को आँख से बात करना सिखाया।
उपमा: कल्पना कीजिए कि आपके पास एक कैमरा है जिसका लेंस थोड़ा टूटा हुआ है (सामान्य VLM)। फोटोग्राफर चाहे कितना भी अच्छा क्यों न हो, तस्वीरें धुंधली ही आएंगी। SocialFusion उस टूटे हुए लेंस को एक बिल्कुल नए, बेदाग लेंस से बदलने और फिर फोटोग्राफर को उसका उपयोग करना सिखाने जैसा है।
परिणाम: एक परफेक्ट स्कोरकार्ड
जब उन्होंने SocialFusion का परीक्षण किया:
- पॉजिटिव ट्रांसफर (Positive Transfer): अन्य मॉडलों के विपरीत, SocialFusion ने हर उस कार्य में बेहतर प्रदर्शन किया जब उसने उन सभी को एक साथ सीखा। कार्य एक-दूसरे की मदद करने लगे, जैसे दोस्तों की एक टीम मिलकर पढ़ाई कर रही हो।
- नए रिकॉर्ड: इसने इशारों (HaGRIDv2) और सामाजिक संबंधों (PISC) को पहचानने के लिए नए "स्टेट-ऑफ-द-आर्ट" (सर्वश्रेष्ठ संभव) रिकॉर्ड बनाए।
- प्रतिस्पर्धी: यह अन्य कार्यों पर सर्वश्रेष्ठ विशिष्ट मॉडलों के समान ही अच्छा था, जिससे साबित हुआ कि सामाजिक संकेतों को समझने के लिए आपको एक विशाल, जटिल प्रणाली की आवश्यकता नहीं है—बस सही सेटअप की आवश्यकता है।
निष्कर्ष
यह शोधपत्र निष्कर्ष निकालता है कि वर्तमान में हम AI को प्रशिक्षित करने का तरीका (सब कुछ एक विशाल मिश्रण में डाल देना) अनजाने में उनकी मानवीय सामाजिक अंतःक्रियाओं को समझने की क्षमता को नुकसान पहुँचा सकता है। वास्तव में सामाजिक रूप से सक्षम AI बनाने के लिए, हमें सामान्य मॉडलों को सब कुछ करने के लिए मजबूर करना बंद करना पड़ सकता है और इसके बजाय "साफ" विज़ुअल टूल्स का उपयोग करना पड़ सकता है जिन्हें सामान्य डेटा पर अत्यधिक प्रशिक्षित नहीं किया गया है।
संक्षेप में: शोधपत्र ने पाया कि AI को सामान्य चीजों के बारे में "बहुत स्मार्ट" बनाने से लोगों के बारे में "बेवकूफ" बना दिया। उनका नया समाधान, SocialFusion, इसे ठीक करता है क्योंकि यह "आंखों" को ताज़ा और सरल रखता है, जिससे AI अंततः सामाजिक दुनिया को सही ढंग से समझ पाता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।