Reward Models Inherit Value Biases from Pretraining
यह अध्ययन प्रदर्शित करता है कि रिवॉर्ड मॉडल अपने बेस प्रीट्रेन मॉडल से महत्वपूर्ण और टिकाऊ मूल्य पूर्वाग्रह, विशेष रूप से "एजेंसी" या "कम्यूनियन" के प्रति प्राथमिकताएं, विरासत में प्राप्त करते हैं, जो यह दर्शाता है कि फाउंडेशन मॉडल का चयन बाद के फाइन-ट्यूनिंग के बावजूद संरेखण परिणामों को मौलिक रूप से आकार देता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक जज (न्यायाधीश) को काम पर रख रहे हैं ताकि यह तय किया जा सके कि एक रोबोट को लोगों को क्या जवाब देना चाहिए। आप चाहते हैं कि यह जज निष्पक्ष, दयालु और मानवीय मूल्यों के अनुरूप हो। आर्टिफिशियल इंटेलिजेंस की दुनिया में, इस जज को रिवॉर्ड मॉडल (RM) कहा जाता है।
लंबे समय तक, डेवलपर्स को लगा कि वे एक विशाल डेटासेट का उपयोग करके, जिसमें "अच्छे" और "बुरे" जवाबों का संग्रह हो, एक पूरी तरह से तटस्थ जज बना सकते हैं। उन्होंने सोचा, "यदि हम जज को मानवीय प्राथमिकताओं के पर्याप्त उदाहरण दे दें, तो वह अपने व्यक्तित्व को भूल जाएगा और बस मानवता का एक दर्पण बन जाएगा।"
यह शोध पत्र कहता है: "इतनी जल्दी नहीं।"
शोधकर्ताओं ने पाया कि ये जज (रिवॉर्ड मॉडल्स) खाली स्लेट के रूप में शुरुआत नहीं करते हैं। इन्हें एक विशिष्ट "बेस मॉडल" (AI के अंतर्निहित मस्तिष्क) के ऊपर बनाया जाता है। और ठीक वैसे ही जैसे एक बच्चा अपने माता-पिता के व्यक्तित्व के गुणों को विरासत में पाता है, ये जज भी उस बेस मॉडल के गहरे मूल्यों को विरासत में पाते हैं जिससे उन्हें बनाया गया है।
यहाँ उनकी खोज की कहानी दी गई है, जिसे सरल उपमाओं के साथ समझाया गया है।
1. दो परिवार: "गो-गेटर्स" (लक्ष्य पाने वाले) बनाम "कम्युनिटी बिल्डर्स" (समुदाय बनाने वाले)
शोधकर्ताओं ने AI मॉडल्स के दो प्रमुख परिवारों का अध्ययन किया: Llama (Meta से) और Gemma (Google से)।
उन्होंने पाया कि ये मॉडल दुनिया को देखने के तरीके में एक दिलचस्प विभाजन रखते हैं, जो दो मनोवैज्ञानिक अवधारणाओं पर आधारित है:
- एजेंसी (Agency): व्यक्तिगत उपलब्धि, स्वतंत्रता, शक्ति और सफलता की प्रेरणा। (सोचिए: "मैंने यह अकेले किया!")
- कम्यूनियन (Communion): जुड़ाव, प्रेम, परिवार और सद्भाव की प्रेरणा। (सोचिए: "हमने यह मिलकर किया!")
उपमा:
कल्पना कीजिए कि दो अलग-अलग विचारधाराएँ हैं।
- Llama स्कूल एक स्टार्टअप इनक्यूबेटर की तरह है। जब पूछा जाता है, "सबसे महान चीज़ क्या है?" तो उनकी आंतरिक आवाज़ फुसफुसाती है, "स्वतंत्रता," "सफलता," "अवसर।" वे व्यक्तिगत नायक को महत्व देते हैं।
- Gemma स्कूल एक सामुदायिक उद्यान (Community Garden) की तरह है। जब उनसे वही सवाल पूछा जाता है, तो उनकी आंतरिक आवाज़ फुसफुसाती है, "प्रेम," "परिवार," "दोस्ती।" वे समूह के बंधन को महत्व देते हैं।
चौंकाने वाली बात? भले ही शोधकर्ताओं ने एक Llama-आधारित जज और एक Gemma-आधारित जज को एक ही मानवीय प्राथमिकताओं की सूची पर प्रशिक्षित किया, फिर भी Llama जज ने "स्वतंत्रता" को पसंद किया और Gemma जज ने "प्रेम" को पसंद किया। प्रशिक्षण डेटा उस "DNA" को नहीं धो सका जो बेस मॉडल में निहित था।
2. "मशीन में भूत" (प्रीट्रेनिंग)
आप पूछ सकते हैं, "लेकिन क्या हमने उन्हें एक ही डेटा पर प्रशिक्षित नहीं किया था?"
हाँ, लेकिन वह डेटा केवल पेंट की अंतिम परत थी। "DNA" प्रीट्रेनिंग (Pretraining) के दौरान मॉडल में रचा-बसा था।
उपमा:
एक रिवॉर्ड मॉडल को एक घर के रूप में सोचें।
- प्रीट्रेनिंग घर की नींव और ढांचा है। यह विशिष्ट सामग्रियों (Llama लकड़ी या Gemma स्टील) से बनाया गया है।
- फाइन-ट्यूनिंग (Fine-tuning) (मानवीय डेटा के साथ प्रशिक्षण) पेंट और फर्नीचर है।
शोधकर्ताओं ने पाया कि चाहे आप घर को कितना भी नया रंग दें या फर्नीचर को कितना भी व्यवस्थित करें, घर का आकार अभी भी नींव द्वारा निर्धारित होता है। यदि नींव "व्यक्तिवाद" के बीमों से बनी है, तो घर हमेशा उसी ओर झुकेगा, भले ही आप दीवारों पर "समुदाय" की तस्वीरें लगाने की कोशिश करें।
उन्होंने इसे "लॉग प्रोबेबिलिटीज" (एक तकनीकी तरीका यह कहने का कि मॉडल किसी शब्द को कितना संभावित मानता है) को देखकर सिद्ध किया। उन्होंने पाया कि किसी भी प्रशिक्षण से पहले, Llama के मस्तिष्क ने स्वाभाविक रूप से "स्वतंत्रता" को सबसे "बेहतरीन" उत्तर के रूप में अधिक संभावित माना, जबकि Gemma के मस्तिष्क ने "प्रेम" को अधिक संभावित माना।
3. "इम्प्लिसिट रिवॉर्ड" (छिपा हुआ पूर्वाग्रह)
शोधकर्ताओं ने इसे मापने के लिए एक चतुर तरकीब निकाली। उन्होंने दोनों मॉडलों के बीच के अंतर को एक रिवॉर्ड मॉडल की तरह माना।
उपमा:
कल्प imagine कीजिए कि आपके पास दो शेफ हैं, शेफ Llama और शेफ Gemma। आप दोनों से "अब तक का सबसे अच्छा व्यंजन" बनाने के लिए कहते हैं।
- शेफ Llama "स्वतंत्रता" के साइड डिश के साथ एक स्टेक बनाता है।
- शेफ Gemma "प्रेम" के साइड डिश के साथ एक स्टू (Stew) बनाता है।
शोधकर्ताओं ने पूछा: "यदि हम जादू से यह माप सकें कि शेफ Llama और शेफ Gemma के बीच क्या अंतर है, तो वह अंतर कैसा दिखेगा?"
उन्होंने पाया कि यह "अंतर" एक विशाल, अदृश्य शक्ति थी जो Llama को "स्वतंत्रता" की ओर और Gemma को "प्रेम" की ओर धकेल रही थी। यह बल इतना शक्तिशाली है कि यह एक छिपे हुए रिवॉर्ड सिस्टम की तरह कार्य करता है, जो इंसानों के निर्देश देने से पहले ही AI का मार्गदर्शन करता है।
4. क्या हम इसे "ठीक" कर सकते हैं? (वॉशिंग मशीन प्रयोग)
शोधकर्ताओं ने यह देखने की कोशिश की कि क्या वे मॉडल्स को और अधिक और अधिक मानवीय प्राथमिकता डेटा खिलाकर इन पूर्वाग्रहों को "धो" सकते हैं।
उपमा:
उन्होंने पक्षपाती जजों को "मानवीय प्राथमिकता" डिटर्जेंट के एक बड़े लोड के साथ एक विशाल वॉशिंग मशीन (प्रशिक्षण प्रक्रिया) में डाल दिया।
- परिणाम: पूर्वाग्रह थोड़ा कमजोर हुआ, लेकिन वह गायब नहीं हुआ।
- कैच (Catch): एक उल्लेखनीय अंतर बनाने के लिए, उन्हें एक विशाल मात्रा में डेटा (1,00,000 से अधिक उदाहरण) की आवश्यकता थी। और तब भी, पूर्वाग्रह गायब नहीं हुआ; यह बस छोटा हो गया।
- चेतावनी: जब उन्होंने तीसरे मॉडल परिवार (Qwen) के साथ यह प्रयोग किया, तो पूर्वाग्रह इतना मजबूत था कि भारी मात्रा में डेटा भी इसे ठीक नहीं कर सका। "नींव" बहुत अलग थी।
यह क्यों मायने रखता है?
यह शोध पत्र AI सुरक्षा के बारे में हमारी सोच को बदल देता है।
वर्षों से, इंडस्ट्री को लगता था, "हम AI के व्यवहार को बिल्कुल अंत में (RLHF चरण में) ठीक कर देंगे, यह दिखाकर कि मनुष्य क्या पसंद करते हैं।"
वास्तविकता की जाँच:
यदि आप एक ऐसे घर का निर्माण करते हैं जिसकी नींव बाईं ओर झुकी हुई है, तो आप केवल दीवारों को पेंट करके उसे सीधा नहीं कर सकते। आपको नींव को ठीक करना होगा।
- डेवलपर्स के लिए: एक बेस मॉडल (जैसे Llama बनाम Gemma) चुनना केवल गति या आकार के बारे में तकनीकी विकल्प नहीं है; यह एक नैतिक विकल्प है। यह तय करता है कि आपका AI स्वाभाविक रूप से "व्यक्तिगत स्वतंत्रता" की ओर झुकेगा या "सामुदायिक प्रेम" की ओर।
- समाज के लिए: हम यह मानकर नहीं चल सकते कि AI तटस्थ होगा। इसका "व्यक्तित्व" हमारे बात करने से बहुत पहले इसके कोड में लिखा जा चुका होता है। यदि हम चाहते हैं कि AI वास्तव में सभी मानवीय मूल्यों के अनुरूप हो, तो हमें प्रीट्रेनिंग चरण के बारे में बहुत अधिक सावधान होना होगा—जो AI के जीवन का सबसे पहला कदम है।
संक्षेप में: आप केवल मछली को बहुत सारे उड़ने के सबक देकर उसे उड़ना नहीं सिखा सकते। आपको एक पक्षी से शुरुआत करनी होगी। और यदि आप एक मछली से शुरुआत करते हैं, तो आपको यह स्वीकार करना होगा कि वह हमेशा तैरना ही चाहेगी, चाहे आप उसे कितना भी प्रशिक्षित क्यों न करें। AI और उसके बेस मॉडल्स के मामले में भी यही बात लागू होती है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।