← नवीनतम पेपर
📊 statistics

Provable Pluralistic Alignment: Multi-Party RLHF under Offline Human Feedback

यह शोध पत्र बहुलवादी संरेखण (pluralistic alignment) के लिए एक एकीकृत ऑफलाइन RLHF ढांचे का प्रस्ताव करता है जो एक लो-रैंक लीनियर मॉडल के तहत पार्टी-विशिष्ट पुरस्कारों का संयुक्त रूप से अनुमान लगाता है और नैश (Nash), उपयोगितावादी (Utilitarian), और समतावादी (Egalitarian) उद्देश्यों के लिए नीतियों को अनुकूलित करता है, साथ ही एक निराशावादी वॉन न्यूमैन विजेता (pessimistic von Neumann winner) के माध्यम से सामान्य चक्रीय प्राथमिकताओं को भी संबोधित करता है, यह सब स्थापित गैर-असमकालिक प्रदर्शन गारंटी (nonasymptotic performance guarantees) के साथ।

मूल लेखक: Huiying Zhong, Tianwei Gao, Zhiwei Steven Wu, Linjun Zhang, Weijie J. Su, Zhun Deng

प्रकाशित 2026-09-09
📖 8 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Huiying Zhong, Tianwei Gao, Zhiwei Steven Wu, Linjun Zhang, Weijie J. Su, Zhun Deng

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

आर्टिफिशियल इंटेलिजेंस की दुनिया में, यह बढ़ती हुई पहचान है कि मशीनें एक एकल मानवीय आवाज में बात नहीं करती हैं। जब हम किसी कंप्यूटर से कोई कहानी लिखने, समाचार लेख का सारांश देने या सलाह देने के लिए कहते हैं, तो अलग-अलग लोग अक्सर अलग-अलग चीजें चाहते हैं। एक व्यक्ति संक्षिप्तता और स्पष्टता को महत्व दे सकता है, जबकि दूसरा सूक्ष्मता और भावनात्मक गहराई पसंद कर सकता है। तीसरा व्यक्ति सबसे ऊपर सुरक्षा को प्राथमिकता दे सकता है, जबकि चौथा रचनात्मकता की तलाश करता है। वर्षों से, इन मशीनों को सिखाने का मानक तरीका यह रहा है कि इन सभी अलग-अलग मतों को एकत्र किया जाए, उन्हें एक बड़े ढेर में मिला दिया जाए, और सिस्टम को औसत को संतुष्ट करने के लिए प्रशिक्षित किया जाए। यह दृष्टिकोण मानता है कि मानवीय असहमति केवल शोर है, एक अस्थायी भ्रम जो तब गायब हो जाएगा जब हम पर्याप्त डेटा एकत्र कर लेंगे। लेकिन वास्तव में, ये अंतर अक्सर गहरे, स्थायी और मौलिक होते हैं। वे मूल्यों के वास्तविक संघर्षों का प्रतिनिधित्व करते हैं, न कि केवल यादृच्छिक त्रुटियों का। वैज्ञानिकों के लिए चुनौती अब केवल एक ऐसी मशीन बनाना नहीं है जो बहुमत को प्रसन्न करे, बल्कि एक ऐसी मशीन बनाना है जो विशिष्ट, कभी-कभी विरोधी दृष्टिकोणों की भीड़ से सीख सके और फिर भी एक एकल, निष्पक्ष निर्णय पर पहुँच सके जो उस असहमति की संरचना का सम्मान करता हो।

यह उस समस्या का केंद्र है जिसे एमआईटी (MIT), यूनिवर्सिटी ऑफ नॉर्थ कैरोलिना और कार्नेगी मेलन यूनिवर्सिटी सहित विभिन्न संस्थानों के शोधकर्ताओं की एक टीम ने हल करने का प्रयास किया है। उन्होंने मशीन लर्निंग के क्षेत्र में एक विशिष्ट पहेली को हल करने के लिए कदम उठाया जिसे "प्लुरलिस्टिक एलाइनमेंट" (बहुलतावादी संरेखण) के रूप में जाना जाता है। कल्पना कीजिए कि एक कमरा लोगों से भरा है जो एक एकल कार्य पथ पर निर्णय लेने की कोशिश कर रहे हैं, लेकिन वे इस पर सहमत नहीं हो पा रहे हैं कि सबसे अच्छा परिणाम क्या होगा। अतीत में, कंप्यूटर वैज्ञानिक बस हर संभावित विकल्प पर सभी से वोट करने के लिए कहते, वोटों को गिनते और विजेता को चुन लेते। यह कार्य में वर्णित नया दृष्टिकोण तर्क देता है कि यह विधि बहुत अधिक जानकारी को नष्ट कर देती है। यदि आप ऐसे समूह के वोटों को मिला देते हैं जो तीखा भोजन पसंद करता है और ऐसे समूह के जो इसे नापसंद करता है, तो आप अंत में एक फीका, असंतोषजनक समझौता प्राप्त कर सकते हैं जो किसी को भी संतुष्ट नहीं करता। इसके बजाय, शोधकर्ता एक ऐसी पद्धति का प्रस्ताव करते हैं जो सीखने के दौरान समूहों को अलग रखती है, यह समझती है कि प्रत्येक समूह वास्तव में क्या चाहता है, और फिर उन इच्छाओं को एक अंतिम निर्णय में संयोजित करने के लिए एक विशिष्ट, पारदर्शी नियम लागू करती है।

शोधकर्ताओं ने एक ऐसी सेटिंग पर ध्यान केंद्रित किया जहाँ कंप्यूटर "ऑफलाइन" डेटा से सीखता है। इसका अर्थ है कि मशीन वास्तविक समय में लोगों से बात नहीं कर रही है; वह रिकॉर्ड के एक विशाल, पूर्व-मौजूदा संग्रह को देख रही है। इन रिकॉर्डों में, लोगों ने दो अलग-अलग विकल्पों की तुलना की है और कहा है कि वे किसे पसंद करते हैं। महत्वपूर्ण रूप से, शोधकर्ताओं ने यह सुनिश्चित किया कि डेटा प्रत्येक तुलना के पीछे के व्यक्ति का ट्रैक रखता है। उन्होंने केवल यह रिकॉर्ड नहीं किया कि "विकल्प A, विकल्प B से बेहतर था"; उन्होंने रिकॉर्ड किया कि "समूह A ने विकल्प A को पसंद किया, जबकि समूह B ने विकल्प B को पसंद किया।" इन पहचानों को संरक्षित करके, कंप्यूटर प्रत्येक विशिष्ट समूह की प्राथमिकताओं को सीख सकता है, न कि उन्हें एक एकल, भ्रमित औसत में मिला सकता है।

इस जटिलता को संभालने के लिए, टीम ने एक गणितीय ढांचा विकसित किया जो दो मुख्य चरणों में कार्य करता है। सबसे पहले, सिस्टम उन छिपे हुए नियमों को सीखता है जो प्रत्येक समूह की प्राथमिकताओं को संचालित करते हैं। उन्होंने पाया कि भले ही विभिन्न समूह अलग-अलग चीजें चाहते हों, उनकी प्राथमिकताएं अक्सर एक सामान्य अंतर्निहित संरचना साझा करती हैं, ठीक वैसे ही जैसे विभिन्न भाषाएं एक सामान्य व्याकरण साझा करती हैं। इस साझा संरचना को पहचानकर, कंप्यूटर बहुत कम डेटा का उपयोग करके कई अलग-अलग समूहों की विशिष्ट इच्छाओं को सीख सकता है, बजाय इसके कि वह प्रत्येक को अलग से सीखने का प्रयास करे। यह चरण महत्वपूर्ण है क्योंकि यह सिस्टम को सटीक होने की अनुमति देता है, भले ही किसी एक समूह के लिए डेटा कम या अधूरा हो।

एक बार जब सिस्टम समझ जाता है कि प्रत्येक समूह क्या चाहता है, तो वह दूसरे चरण की ओर बढ़ता है: अंतिम निर्णय लेना। यहाँ, शोधकर्ताओं ने इन प्राथमिकताओं को संयोजित करने के तीन अलग-अलग तरीकों का परीक्षण किया, जो निष्पक्षता के विभिन्न विचारों का प्रतिनिधित्व करते हैं। एक विधि, जिसे "यूटिलिटेरियन" (उपयोगितावादी) कहा जाता है, बस सभी समूहों की कुल खुशी को जोड़ती है और उस विकल्प को चुनती है जो समग्र रूप से सबसे अधिक भलाई पैदा करता है। दूसरी विधि, जिसे "इक्विटेरियन" (समतावादी) कहा जाता है, पूरी तरह से उस समूह पर ध्यान केंद्रित करती है जो सबसे कम संतुष्ट है, यह सुनिश्चित करती है कि सबसे कम सुखी समूह को यथासंभव खुश किया जा सके। तीसरी विधि, जिसे "नैश" (Nash) के रूप में जाना जाता है, एक ऐसे संतुलन की तलाश करती है जहाँ सभी की संतुष्टि का गुणनफल अधिकतम हो, जो प्रभावी रूप से यह सुनिश्चित करता है कि किसी भी एकल समूह को पूरी तरह से अनदेखा न किया जाए, जबकि समग्र प्रगति को भी पुरस्कृत किया जाए। शोधकर्ताओं ने गणितीय रूप से सिद्ध किया कि उनकी पद्धति इन सभी निष्पक्षता की परिभाषाओं के तहत अच्छा प्रदर्शन करने वाला एक एकल नीति खोज सकती है, बशर्ते डेटा पर्याप्त हो।

अध्ययन का एक प्रमुख निष्कर्ष यह है कि सभी डेटा को एक साथ मिलाने और यह अनदेखा करने कि किसने क्या कहा, से एक खराब परिणाम मिलता है। जब शोधकर्ताओं ने तीन विशिष्ट समूहों के लोगों के साथ एक परिदृश्य का अनुकरण किया, तो पारंपरिक "पूल की गई" विधि एक निष्पक्ष समझौता खोजने में विफल रही। इसने अक्सर एक ऐसा विकल्प चुना जिसे एक समूह द्वारा बहुत पसंद किया गया लेकिन अन्य समूहों द्वारा नापसंद किया गया, जिससे आधी आबादी पूरी तरह से असंतुष्ट रह गई। इसके विपरीत, उनकी नई पद्धति, जिसने सीखने के चरण के दौरान समूहों को अलग रखा, एक मध्य मार्ग वाला विकल्प सफलतापूर्वक पहचानने में सफल रही जो सभी को संतुष्टि का एक मध्यम स्तर प्रदान करता था। इसने प्रदर्शित किया कि आर्टिफिशियल इंटेलिजेंस को संरेखित करने की कठिनाई केवल पर्याप्त डेटा होने के बारे में नहीं है, बल्कि यह कि एक स्पष्ट, इरादतन विकल्प बनाने तक मानवीय असहमति की संरचना को कैसे संरक्षित किया जाए।

शोधकर्ताओं ने एक अधिक कठिन परिदृश्य का भी अन्वेषण किया जहाँ मानवीय प्राथमिकताओं को आसानी से एक सरल स्कोर या रैंकिंग में नहीं बदला जा सकता है। कभी-कभी, लोगों के चुनाव असंगत होते हैं; वे A को B से पसंद कर सकते हैं, B को C से, लेकिन फिर C को A से। इन मामलों में, प्रत्येक विकल्प को एक एकल संख्या देने की मानक पद्धति टूट जाती है। इसे संभालने के लिए, टीम ने "वॉन न्यूमैन विनर" (von Neumann winner) की अवधारणा पर आधारित एक नई रणनीति विकसित की। यह एक संभाव्य दृष्टिकोण है जहाँ सिस्टम एक एकल सर्वश्रेष्ठ विकल्प खोजने का प्रयास नहीं करता है, बल्कि एक ऐसी रणनीति खोजता है जिसके किसी अन्य रणनीति के विरुद्ध आमने-सामने की तुलना में हारने की संभावना कम हो। उन्होंने सिद्ध किया कि इन अव्यवस्थित, असंगत स्थितियों में भी, उनकी पद्धति एक स्थिर, निष्पक्ष समाधान पा सकती है जो सभी पक्षों की प्राथमिकताओं का सम्मान करती है, बशर्ते डेटा को पर्याप्त सावधानी से एकत्र किया गया हो।

कंप्यूटर सिमुलेशन के माध्यम से, टीम ने दिखाया कि उनका दृष्टिकोण मौजूदा विधियों से लगातार बेहतर प्रदर्शन करता है। जब उन्होंने अपने एल्गोरिदम का विभिन्न लोगों की संख्या और सहमति के विभिन्न स्तरों वाले सिंथेटिक डेटा पर परीक्षण किया, तो नई पद्धति ने ऐसे निर्णय दिए जो प्रत्येक समूह के लिए आदर्श परिणाम के करीब थे। सिमुलेशन ने पुष्टि की कि समूहों की पहचान को बरकरार रखकर और एक साझा शिक्षण संरचना का उपयोग करके, सिस्टम अधिक कुशलता से सीख सकता है और निष्पक्ष विकल्प बना सकता है। परिणाम तब भी सही रहे चाहे लक्ष्य औसत खुशी को अधिकतम करना हो, सबसे कमजोर समूह की रक्षा करना हो, या एक संतुलित समझौता खोजना हो।

यह कार्य इस बारे में हमारे सोचने के तरीके में एक महत्वपूर्ण प्रगति है कि विविध मानव समाजों के साथ काम करने के लिए मशीन को कैसे प्रशिक्षित किया जाए। यह इस विचार से दूर जाता है कि व्यवहार करने का एक ही "सही" तरीका है जिसे मशीन को खोजना चाहिए। इसके बजाय, यह मानवीय राय की विविधता को एक ऐसी विशेषता के रूप में देखता है जिसे प्रबंधित किया जाना है, न कि एक बग के रूप में जिसे ठीक किया जाना है। विभिन्न दृष्टिकोणों को संयंबित करने की प्रक्रिया को स्पष्ट और गणितीय रूप से कठोर बनाकर, शोधकर्ताओं ने ऐसी प्रणालियों के निर्माण के लिए एक ब्लूप्रिंट प्रदान किया है जो उस विशिष्ट आवाज़ को मिटाए बिना संघर्षों को नेविगेट कर सकती हैं जो उसे बनाती हैं। अध्ययन यह दावा नहीं करता है कि उसने मानव-AI संपर्क की हर समस्या को हल कर दिया है, लेकिन यह असहमति रखने वाले लोगों की भीड़ से सीखने और एक एकल, सामूहिक निर्णय उत्पन्न करने का एक प्रमाणित, विश्वसनीय तरीका प्रदान करता है जो सांख्यिकीय रूप से सुदृढ़ और नैतिक रूप से पारदर्शी है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →