← नवीनतम पेपर
💬 NLP

Reward Models Inherit Value Biases from Pretraining

यह अध्ययन प्रदर्शित करता है कि रिवॉर्ड मॉडल अपने बेस प्रीट्रेन मॉडल से महत्वपूर्ण और टिकाऊ मूल्य पूर्वाग्रह, विशेष रूप से "एजेंसी" या "कम्यूनियन" के प्रति प्राथमिकताएं, विरासत में प्राप्त करते हैं, जो यह दर्शाता है कि फाउंडेशन मॉडल का चयन बाद के फाइन-ट्यूनिंग के बावजूद संरेखण परिणामों को मौलिक रूप से आकार देता है।

मूल लेखक: Brian Christian, Jessica A. F. Thompson, Elle Michelle Yang, Vincent Adam, Hannah Rose Kirk, Christopher Summerfield, Tsvetomira Dumbalska

प्रकाशित 2026-03-03
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Brian Christian, Jessica A. F. Thompson, Elle Michelle Yang, Vincent Adam, Hannah Rose Kirk, Christopher Summerfield, Tsvetomira Dumbalska

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक जज (न्यायाधीश) को काम पर रख रहे हैं ताकि यह तय किया जा सके कि एक रोबोट को लोगों को क्या जवाब देना चाहिए। आप चाहते हैं कि यह जज निष्पक्ष, दयालु और मानवीय मूल्यों के अनुरूप हो। आर्टिफिशियल इंटेलिजेंस की दुनिया में, इस जज को रिवॉर्ड मॉडल (RM) कहा जाता है।

लंबे समय तक, डेवलपर्स को लगा कि वे एक विशाल डेटासेट का उपयोग करके, जिसमें "अच्छे" और "बुरे" जवाबों का संग्रह हो, एक पूरी तरह से तटस्थ जज बना सकते हैं। उन्होंने सोचा, "यदि हम जज को मानवीय प्राथमिकताओं के पर्याप्त उदाहरण दे दें, तो वह अपने व्यक्तित्व को भूल जाएगा और बस मानवता का एक दर्पण बन जाएगा।"

यह शोध पत्र कहता है: "इतनी जल्दी नहीं।"

शोधकर्ताओं ने पाया कि ये जज (रिवॉर्ड मॉडल्स) खाली स्लेट के रूप में शुरुआत नहीं करते हैं। इन्हें एक विशिष्ट "बेस मॉडल" (AI के अंतर्निहित मस्तिष्क) के ऊपर बनाया जाता है। और ठीक वैसे ही जैसे एक बच्चा अपने माता-पिता के व्यक्तित्व के गुणों को विरासत में पाता है, ये जज भी उस बेस मॉडल के गहरे मूल्यों को विरासत में पाते हैं जिससे उन्हें बनाया गया है।

यहाँ उनकी खोज की कहानी दी गई है, जिसे सरल उपमाओं के साथ समझाया गया है।

1. दो परिवार: "गो-गेटर्स" (लक्ष्य पाने वाले) बनाम "कम्युनिटी बिल्डर्स" (समुदाय बनाने वाले)

शोधकर्ताओं ने AI मॉडल्स के दो प्रमुख परिवारों का अध्ययन किया: Llama (Meta से) और Gemma (Google से)।

उन्होंने पाया कि ये मॉडल दुनिया को देखने के तरीके में एक दिलचस्प विभाजन रखते हैं, जो दो मनोवैज्ञानिक अवधारणाओं पर आधारित है:

  • एजेंसी (Agency): व्यक्तिगत उपलब्धि, स्वतंत्रता, शक्ति और सफलता की प्रेरणा। (सोचिए: "मैंने यह अकेले किया!")
  • कम्यूनियन (Communion): जुड़ाव, प्रेम, परिवार और सद्भाव की प्रेरणा। (सोचिए: "हमने यह मिलकर किया!")

उपमा:
कल्पना कीजिए कि दो अलग-अलग विचारधाराएँ हैं।

  • Llama स्कूल एक स्टार्टअप इनक्यूबेटर की तरह है। जब पूछा जाता है, "सबसे महान चीज़ क्या है?" तो उनकी आंतरिक आवाज़ फुसफुसाती है, "स्वतंत्रता," "सफलता," "अवसर।" वे व्यक्तिगत नायक को महत्व देते हैं।
  • Gemma स्कूल एक सामुदायिक उद्यान (Community Garden) की तरह है। जब उनसे वही सवाल पूछा जाता है, तो उनकी आंतरिक आवाज़ फुसफुसाती है, "प्रेम," "परिवार," "दोस्ती।" वे समूह के बंधन को महत्व देते हैं।

चौंकाने वाली बात? भले ही शोधकर्ताओं ने एक Llama-आधारित जज और एक Gemma-आधारित जज को एक ही मानवीय प्राथमिकताओं की सूची पर प्रशिक्षित किया, फिर भी Llama जज ने "स्वतंत्रता" को पसंद किया और Gemma जज ने "प्रेम" को पसंद किया। प्रशिक्षण डेटा उस "DNA" को नहीं धो सका जो बेस मॉडल में निहित था।

2. "मशीन में भूत" (प्रीट्रेनिंग)

आप पूछ सकते हैं, "लेकिन क्या हमने उन्हें एक ही डेटा पर प्रशिक्षित नहीं किया था?"

हाँ, लेकिन वह डेटा केवल पेंट की अंतिम परत थी। "DNA" प्रीट्रेनिंग (Pretraining) के दौरान मॉडल में रचा-बसा था।

उपमा:
एक रिवॉर्ड मॉडल को एक घर के रूप में सोचें।

  • प्रीट्रेनिंग घर की नींव और ढांचा है। यह विशिष्ट सामग्रियों (Llama लकड़ी या Gemma स्टील) से बनाया गया है।
  • फाइन-ट्यूनिंग (Fine-tuning) (मानवीय डेटा के साथ प्रशिक्षण) पेंट और फर्नीचर है।

शोधकर्ताओं ने पाया कि चाहे आप घर को कितना भी नया रंग दें या फर्नीचर को कितना भी व्यवस्थित करें, घर का आकार अभी भी नींव द्वारा निर्धारित होता है। यदि नींव "व्यक्तिवाद" के बीमों से बनी है, तो घर हमेशा उसी ओर झुकेगा, भले ही आप दीवारों पर "समुदाय" की तस्वीरें लगाने की कोशिश करें।

उन्होंने इसे "लॉग प्रोबेबिलिटीज" (एक तकनीकी तरीका यह कहने का कि मॉडल किसी शब्द को कितना संभावित मानता है) को देखकर सिद्ध किया। उन्होंने पाया कि किसी भी प्रशिक्षण से पहले, Llama के मस्तिष्क ने स्वाभाविक रूप से "स्वतंत्रता" को सबसे "बेहतरीन" उत्तर के रूप में अधिक संभावित माना, जबकि Gemma के मस्तिष्क ने "प्रेम" को अधिक संभावित माना।

3. "इम्प्लिसिट रिवॉर्ड" (छिपा हुआ पूर्वाग्रह)

शोधकर्ताओं ने इसे मापने के लिए एक चतुर तरकीब निकाली। उन्होंने दोनों मॉडलों के बीच के अंतर को एक रिवॉर्ड मॉडल की तरह माना।

उपमा:
कल्प imagine कीजिए कि आपके पास दो शेफ हैं, शेफ Llama और शेफ Gemma। आप दोनों से "अब तक का सबसे अच्छा व्यंजन" बनाने के लिए कहते हैं।

  • शेफ Llama "स्वतंत्रता" के साइड डिश के साथ एक स्टेक बनाता है।
  • शेफ Gemma "प्रेम" के साइड डिश के साथ एक स्टू (Stew) बनाता है।

शोधकर्ताओं ने पूछा: "यदि हम जादू से यह माप सकें कि शेफ Llama और शेफ Gemma के बीच क्या अंतर है, तो वह अंतर कैसा दिखेगा?"

उन्होंने पाया कि यह "अंतर" एक विशाल, अदृश्य शक्ति थी जो Llama को "स्वतंत्रता" की ओर और Gemma को "प्रेम" की ओर धकेल रही थी। यह बल इतना शक्तिशाली है कि यह एक छिपे हुए रिवॉर्ड सिस्टम की तरह कार्य करता है, जो इंसानों के निर्देश देने से पहले ही AI का मार्गदर्शन करता है।

4. क्या हम इसे "ठीक" कर सकते हैं? (वॉशिंग मशीन प्रयोग)

शोधकर्ताओं ने यह देखने की कोशिश की कि क्या वे मॉडल्स को और अधिक और अधिक मानवीय प्राथमिकता डेटा खिलाकर इन पूर्वाग्रहों को "धो" सकते हैं।

उपमा:
उन्होंने पक्षपाती जजों को "मानवीय प्राथमिकता" डिटर्जेंट के एक बड़े लोड के साथ एक विशाल वॉशिंग मशीन (प्रशिक्षण प्रक्रिया) में डाल दिया।

  • परिणाम: पूर्वाग्रह थोड़ा कमजोर हुआ, लेकिन वह गायब नहीं हुआ।
  • कैच (Catch): एक उल्लेखनीय अंतर बनाने के लिए, उन्हें एक विशाल मात्रा में डेटा (1,00,000 से अधिक उदाहरण) की आवश्यकता थी। और तब भी, पूर्वाग्रह गायब नहीं हुआ; यह बस छोटा हो गया।
  • चेतावनी: जब उन्होंने तीसरे मॉडल परिवार (Qwen) के साथ यह प्रयोग किया, तो पूर्वाग्रह इतना मजबूत था कि भारी मात्रा में डेटा भी इसे ठीक नहीं कर सका। "नींव" बहुत अलग थी।

यह क्यों मायने रखता है?

यह शोध पत्र AI सुरक्षा के बारे में हमारी सोच को बदल देता है।

वर्षों से, इंडस्ट्री को लगता था, "हम AI के व्यवहार को बिल्कुल अंत में (RLHF चरण में) ठीक कर देंगे, यह दिखाकर कि मनुष्य क्या पसंद करते हैं।"

वास्तविकता की जाँच:
यदि आप एक ऐसे घर का निर्माण करते हैं जिसकी नींव बाईं ओर झुकी हुई है, तो आप केवल दीवारों को पेंट करके उसे सीधा नहीं कर सकते। आपको नींव को ठीक करना होगा।

  • डेवलपर्स के लिए: एक बेस मॉडल (जैसे Llama बनाम Gemma) चुनना केवल गति या आकार के बारे में तकनीकी विकल्प नहीं है; यह एक नैतिक विकल्प है। यह तय करता है कि आपका AI स्वाभाविक रूप से "व्यक्तिगत स्वतंत्रता" की ओर झुकेगा या "सामुदायिक प्रेम" की ओर।
  • समाज के लिए: हम यह मानकर नहीं चल सकते कि AI तटस्थ होगा। इसका "व्यक्तित्व" हमारे बात करने से बहुत पहले इसके कोड में लिखा जा चुका होता है। यदि हम चाहते हैं कि AI वास्तव में सभी मानवीय मूल्यों के अनुरूप हो, तो हमें प्रीट्रेनिंग चरण के बारे में बहुत अधिक सावधान होना होगा—जो AI के जीवन का सबसे पहला कदम है।

संक्षेप में: आप केवल मछली को बहुत सारे उड़ने के सबक देकर उसे उड़ना नहीं सिखा सकते। आपको एक पक्षी से शुरुआत करनी होगी। और यदि आप एक मछली से शुरुआत करते हैं, तो आपको यह स्वीकार करना होगा कि वह हमेशा तैरना ही चाहेगी, चाहे आप उसे कितना भी प्रशिक्षित क्यों न करें। AI और उसके बेस मॉडल्स के मामले में भी यही बात लागू होती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →