Group Preference Collapse in Personalized Multimodal Large Language Models
यह शोधपत्र PrefMoE प्रस्तुत करता है, जो एक प्राथमिकता-केंद्रित ढांचा है जो साझा प्रोटोटाइप और व्यक्तिगत अवशेषों (personalized residuals) में प्राथमिकताओं को विभाजित करके व्यक्तिगत मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स में "ग्रुप प्रेफरेंस कोलैप्स" को संबोधित करता है, जिससे प्रमुख जनसंख्या-स्तरीय विकल्पों की ओर झुकाव को कम करते हुए व्यक्तिगत प्रतिक्रिया पीढ़ी को बढ़ाया जाता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक विशाल, जादुई पुस्तकालय में प्रवेश कर रहे हैं जहाँ किताबें आपसे बात कर सकती हैं। ये सिर्फ साधारण किताबें नहीं हैं; ये "मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स" (MLLMs) हैं। इन्हें मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स के रूप में समझें—ये उन सुपर-स्मार्ट लाइब्रेरियन की तरह हैं जो चित्र देख सकते हैं, टेक्स्ट पढ़ सकते हैं और दुनिया को समझ सकते हैं। आमतौर पर, यदि आप उनसे कोई प्रश्न पूछते हैं, तो वे एक बहुत अच्छा, सामान्य उत्तर देते हैं जो लगभग हर किसी के लिए काम करता है। लेकिन क्या होगा अगर आप चाहते हैं कि लाइब्रेरियन विशेष रूप से आपको जाने? क्या होगा अगर आप चाहते हैं कि उन्हें पता हो कि आपको तीखा खाना पसंद नहीं है, विंटेज फैशन बहुत पसंद है, और आप हमेशा तैराकी के बजाय हाइकिंग पसंद करते हैं? व्यक्तिगत (personalized) एआई का लक्ष्य यही है: एआई को एक ऐसे दोस्त की तरह बनाना जो औसत व्यक्ति की पसंद को जानने वाले रोबोट के बजाय आपकी अनूठी पसंद को जानता हो।
हालाँकि, जब आप एक ही लाइब्रेरियन को एक साथ सैकड़ों अलग-अलग लोगों को जानने के लिए सिखाने की कोशिश करते हैं, तो एक पेचीदा समस्या आती है। यह शोध पत्र कंप्यूटर विज्ञान के एक कोने, जिसे "पर्सनलाइज्ड मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स" कहा जाता है, में गहराई से उतरता है। यह एक विशिष्ट सिरदर्द को सुलझाता है: जब एक एआई कई उपयोगकर्ताओं की पसंद सीखने की कोशिश करता है, तो वह अक्सर भ्रमित हो जाता है और व्यक्ति की बात सुनना बंद कर देता है। इसके बजाय कि वह याद रखे कि आपको जैज़ पसंद है और आपके दोस्त को रॉक संगीत पसंद है, एआई यह सोचने लगता है कि सभी को सबसे लोकप्रिय संगीत शैली पसंद है। यह एक वेटर की तरह है जो, बहुत सारे टेबल की सेवा करने के बाद, यह तय कर लेता है कि सबको "सबसे लोकप्रिय व्यंजन" ही परोसा जाए, और यह भूल जाता है कि आपने विशेष रूप से सलाद ऑर्डर किया था। यह शोध पत्र जांच करता है कि ऐसा क्यों होता है और इसे ठीक करने की कोशिश करता है ताकि एआई अंततः आपकी जीवन की विशिष्ट पसंद को याद रख सके।
महान "ग्रुप हग" (समूह आलिंगन) की समस्या
लेखकों ने इस पेपर में एक ऐसी गड़बड़ी खोजी जिसे वे "ग्रुप प्रेफरेंस कोलैप्स" (समूह प्राथमिकता पतन) कहते हैं। कल्पना कीजिए कि एक कक्षा में शिक्षक हर छात्र से पूछता है कि उनका पसंदीदा रंग क्या है। यदि शिक्षक बहुत अच्छा है, तो वह याद रखता है कि एलेक्स को नीला पसंद है, सैम को हरा पसंद है और जॉर्डन को बैंगनी पसंद है। लेकिन इस "कोलैप्स" परिदृश्य में, शिक्षक अभिभूत हो जाता है। वह देखता है कि "नीला" कमरे में सबसे लोकप्रिय उत्तर है, इसलिए वह यह मान लेने लगता है कि सभी को नीला पसंद है। भले ही सैम हाथ उठाकर कहे, "नहीं, मुझे वास्तव में हरा पसंद है!" तो भी शिक्षक सिर हिलाकर कहता है, "बहुत अच्छा, तुम्हें भी नीला पसंद है।"
एआई की दुनिया में, यह तब होता है जब एक मॉडल कई उपयोगकर्ताओं से सीखने की कोशिश करता है। "तेज़" या सामान्य प्राथमिकताएं (जैसे योग पसंद करना या कैजुअल कपड़े पहनना) शांत या विशिष्ट प्राथमिकताओं को दबा देती हैं। मॉडल व्यक्तिगत विशेषताओं के प्रति असंवेदनशील हो जाता है और "औसत" विकल्प की ओर झुक जाता है। शोध पत्र दिखाता है कि भले ही आप एआई को कहें, "हे, मैं एंडरसन हूँ, और मुझे बागवानी पसंद है," एआई फिर भी अनुमान लगा सकता है कि आप योग पसंद करते हैं क्योंकि, खैर, प्रशिक्षण डेटा में बहुत से लोग योग पसंद करते हैं। ऐसा नहीं है कि एआई आपको अनदेखा कर रहा है; बल्कि यह है कि वह उन विशिष्ट संकेतों को सुनना भूल गया है जो आपको आप बनाते हैं।
समाधान: PrefMoE (स्मार्ट लाइब्रेरियन)
इसे ठीक करने के लिए, शोधकर्ताओं ने PrefMoE नामक एक नया सिस्टम बनाया है। इसे एआई लाइब्रेरियन को एक सुपर-व्यवस्थित फाइलिंग सिस्टम और विशेषज्ञ सहायकों का एक सेट देने के रूप में समझें।
1. "कौन" को "क्या" से अलग करना
सबसे पहले, सिस्टम उपयोगकर्ता की जानकारी को दो अलग-अलग बाल्टियों में विभाजित करता है।
- प्रोफाइल बाल्टी (The "Who" - कौन): इसमें आपके बारे में स्थिर तथ्य होते हैं, जैसे आपकी फोटो या एक विवरण जो कहता है "मैं एक 25 वर्षीय छात्र हूँ।" ये तथ्य बहुत अधिक नहीं बदलते।
- प्रेफरेंस बाल्टी (The "What" - क्या): इसमें आपकी विशिष्ट पसंद होती है, जैसे "मुझे बोहेमियन फैशन पसंद है" या "मुझे हॉरर फिल्में पसंद नहीं हैं।" ये वे चीजें हैं जो आपको अद्वितीय बनाती हैं।
पुराने तरीके इस सारी जानकारी को एक बड़े ढेर में मिलाने की कोशिश करते थे, जिससे "ग्रुप हग" की समस्या पैदा होती थी। PrefMoE इन्हें अलग रखता है ताकि एआई भ्रमित न हो।
2. प्रोटोटाइप और रेसिडुअल (औसत बनाम ट्विस्ट)
यहीं पर यह बहुत चतुर है। सिस्टम यह समझता है कि सभी की कुछ सामान्य पसंदें होती हैं ("प्रोटोटाइप")। उदाहरण के लिए, अधिकांश लोगों को "यात्रा" पसंद हो सकती है। लेकिन PrefMoE केवल वहीं नहीं रुकता। यह "रेसिडुअल" (अवशेष) की तलाश करता है—वह छोटा, अनूठा ट्विस्ट जो आपकी यात्रा शैली को दूसरों से अलग बनाता है। शायद आप यात्रा पसंद करते हैं, लेकिन आप विशेष रूप से कैंपिंग से नफरत करते हैं और केवल लग्जरी क्रूज पसंद करते हैं।
- प्रोटोटाइप: "मुझे यात्रा पसंद है।" (कई लोगों द्वारा साझा किया गया)
- रेसिडुअल: "लेकिन मैं केवल लग्जरी क्रूज पसंद करता हूँ।" (आपके लिए विशिष्ट)
शोध पत्र में पाया गया कि विशेष सुरक्षा के बिना, एआई "रेसिडुअल" को अनदेखा करने और केवल "प्रोटोटाइप" पर टिके रहने की प्रवृत्ति रखता है। PrefMoE एक विशेष गणितीय तकनीक का उपयोग करता है जिसे काउंटरफैक्चुअल ऑग्मेंटेशन (counterfactual augmentation) कहा जाता है। कल्पना कीजिए कि एआई अलग-अलग लोगों की पसंद को मिलाकर (जैसे एंडरसन के बागवानी के प्रेम और बेला के योग के प्रेम को मिलाना) नकली "घोस्ट यूजर्स" (भूतिया उपयोगकर्ता) बना रहा है। इन बनाए गए संयोजनों पर प्रशिक्षण देकर, एआई विशिष्ट विवरणों पर ध्यान देना सीखता है, न कि केवल समूह के औसत पर। यह डिकोरिलेशन (decorrelation) नामक तकनीक का भी उपयोग करता है, जो एआई को यह बताने जैसा है कि, "हे, अपनी यात्रा की प्राथमिकताओं को अपनी फैशन प्राथमिकताओं के साथ न मिलाएं; उन्हें अपने अलग बक्सों में रखें।"
3. विशेषज्ञ सहायक (The MoE Router)
अंत में, PrefMoE एक "मिक्सचर ऑफ एक्सपर्ट्स" (MoE) सिस्टम का उपयोग करता है। कल्पना कीजिए कि एआई के पास विशेषज्ञों की एक टीम है। जब आप कोई प्रश्न पूछते हैं, तो एक स्मार्ट "राउटर" देखता है कि आप क्या पूछ रहे हैं और तय करता है कि किस विशेषज्ञ को बुलाना है।
- यदि आप पूछते हैं, "यह व्यक्ति क्या पहने हुए है?" तो राउटर प्रोफाइल स्पेशलिस्ट (जो आपकी फोटो देखता है) को बुलाता है।
- यदि आप पूछते हैं, "इस व्यक्ति को कौन सी गतिविधि पसंद आएगी?" तो राउटर प्रेफरेंस स्पेशलिस्ट (जो आपकी विशिष्ट पसंद और नापसंद की जांच करता है) को बुलाता है।
यह सुनिश्चित करता है कि एआई केवल लोकप्रियता के आधार पर अनुमान न लगाए; बल्कि यह आपके लिए विशिष्ट जानकारी को सक्रिय रूप से प्राप्त करता है।
आंकड़े क्या कहते हैं
शोधकर्ताओं ने LLaVA और Qwen जैसे कुछ बहुत लोकप्रिय मॉडलों सहित कई अलग-अलग एआई मॉडलों पर इस नए सिस्टम का परीक्षण किया। उन्होंने अपने नए तरीके की तुलना एआई प्रशिक्षण के मानक तरीकों से की।
परिणाम काफी स्पष्ट थे। LLaVA-1.5-7B नामक मॉडल का उपयोग करके किए गए एक परीक्षण में, मानक प्रशिक्षण विधि (फुल फाइन-ट्यूनिंग) उपयोगकर्ता की विशिष्ट पसंद का अनुमान लगाने में लगभग 44.13% बार सही थी। PrefMoE के साथ, यह संख्या बढ़कर 67.33% हो गई।
इससे भी महत्वपूर्ण बात यह है कि उन्होंने यह भी मापा कि एआई कितनी बार "ग्रुप हग" वाली गलती (उपयोगकर्ता की पसंद के बजाय लोकप्रिय विकल्प का अनुमान लगाना) करता है। मानक विधि 34.25% बार समूह प्राथमिकता में ढह गई। PrefMoE ने इस आपदा को घटाकर केवल 12.33% कर दिया। उनके द्वारा परीक्षण किए गए सबसे मजबूत मॉडलों में, PrefMoE ने 78.93% की सटीकता हासिल की और साथ ही कोलैप्स रेट को 10.96% तक कम रखा।
निष्कर्ष
शोध पत्र सुझाव देता है कि एआई को वास्तव में व्यक्तिगत बनाने के लिए, हम केवल उसे अधिक डेटा देकर या उसे "स्मार्ट" बनने के लिए कहकर ऐसा नहीं कर सकते। हमें उसे यह सिखाना होगा कि सामान्य भीड़ को व्यक्तिगत पहचान से कैसे अलग किया जाए। उपयोगकर्ता की प्रोफाइल और अनूठी प्राथमिकताओं को अलग करके, और एक स्मार्ट सिस्टम का उपयोग करके जो प्रश्नों को सही "विशेषज्ञ" तक पहुँचाता है, हम एआई को बहुमत की इच्छा का अनुमान लगाने के बजाय यह समझने में मदद कर सकते हैं कि आप वास्तव में क्या चाहते हैं।
बेशक, लेखक स्वीकार करते हैं कि यह अभी भी पूर्ण नहीं है। यदि आप अपनी पसंद के बारे में एआई को स्पष्ट निर्देश नहीं देते हैं, या यदि चित्र पर्याप्त संकेत नहीं देता है, तो एआई अभी भी गलत हो सकता है। लेकिन यह नया दृष्टिकोण एक आशाजनक मार्ग सुझाता है: एक ऐसा मार्ग जहाँ डिजिटल लाइब्रेरियन अंततः याद रखता है कि आप, विशेष रूप रूप से, शोर वाले कॉन्सर्ट के बजाय शांत बुक कैफे पसंद करते हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।