Reward Shaping for (Inference-Time) Alignment: A Stackelberg Game Perspective
यह शोध पत्र KL रेगुलराइजेशन के तहत रिवॉर्ड मॉडल ऑप्टिमाइज़ेशन को एक स्टैकेलबर्ग गेम के रूप में औपचारिक रूप देता है और एक सरल रिवॉर्ड शेपिंग योजना प्रस्तावित करता है जो बेस पॉलिसी बायस को प्रभावी ढंग से कम करते हुए रिवॉर्ड हैकिंग को रोकता है, जिससे इन्फरेंस-टाइम अलाइनमेंट प्रदर्शन में महत्वपूर्ण सुधार होता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
यहाँ इस शोध पत्र "Reward Shaping for (Inference-Time) Alignment: A Stackelberg Game Perspective" का सरल भाषा और रचनात्मक उपमाओं के साथ हिंदी अनुवाद दिया गया है।
मुख्य समस्या: जिद्दी इंटर्न (The Stubborn Intern)
कल्पना कीजिए कि आपने आपके लिए ईमेल लिखने के लिए एक प्रतिभाशाली लेकिन जिद्दी इंटर्न (यह Base Large Language Model है) को काम पर रखा है। इस इंटर्न की कुछ बहुत गहरी और स्थापित आदतें हैं। उदाहरण के लिए, यदि आप उनसे किसी राजनीतिक विषय पर एक तटस्थ (neutral) राय मांगते हैं, तो वे स्वाभाविक रूप से बाईं ओर झुक जाते हैं क्योंकि उन्हें उसी तरह प्रशिक्षित किया गया है।
आप चाहते हैं कि इंटर्न बिल्कुल वैसा ही लिखे जैसा आप पसंद करते हैं। इसलिए, आप उन्हें आपकी व्यक्तिगत पसंद के आधार पर एक स्कोरकार्ड (यह Reward Model है) देते हैं। आप उनसे कहते हैं: "यदि आप एक तटस्थ प्रतिक्रिया लिखते हैं, तो मैं आपको 2 अंक दूँगा। यदि आप बाईं ओर झुकी हुई प्रतिक्रिया लिखते हैं, तो मैं आपको 1 अंक दूँगा।"
हालाँकि, इंटर्न आलसी है और बदलाव के प्रति प्रतिरोधी है। वे अपना व्यक्तित्व पूरी तरह से नहीं बदलना चाहते। इसलिए, वे एक नियम का पालन करते हैं: "मैं आपके अंक प्राप्त करने की कोशिश करूँगा, लेकिन मैं अपनी प्राकृतिक सहजता (instincts) से बहुत दूर नहीं जाऊँगा।" तकनीकी शब्दों में, इसे KL Regularization कहा जाता है। यह इंटर्न के आउटपुट को उसके मूल, पक्षपाती स्वरूप के करीब रखता है।
समस्या: क्योंकि इंटर्न इतना जिद्दी है, इसलिए केवल उन्हें आपका स्कोरकार्ड दिखाना पर्याप्त नहीं है। वे अभी भी बाईं ओर झुक सकते हैं क्योंकि उनकी "प्राकृतिक सहजता" आपके छोटे से रिवॉर्ड अंतर से अधिक मजबूत है। यदि आप इसे ठीक करने के लिए तटस्थ प्रतिक्रिया को अनंत अंक देने की कोशिश करते हैं, तो इंटर्न घबरा सकता है और केवल वे अंक पाने के लिए बकवास (gibberish) लिखना शुरू कर सकता है (इसे Reward Hacking कहा जाता है)।
समाधान: बॉस और इंटर्न (एक Stackelberg Game)
लेखक इस स्थिति को एक बॉस (Reward Model Provider) और एक इंटर्न (LLM) के बीच एक रणनीतिक खेल के रूप में देखने का प्रस्ताव देते हैं। इसे गेम थ्योरी में Stackelberg Game के रूप में जाना जाता है, जहाँ बॉस पहले कदम उठाता है, और इंटर्न प्रतिक्रिया देता है।
केवल कच्चे स्कोरकार्ड को इंटर्न को सौंपने के बजाय, बॉस एक स्मार्ट गेम खेलता है। बॉस पूछता है: "मुझे स्कोर को कैसे टवीक (tweak) करना चाहिए ताकि, यह जानते हुए कि मेरा इंटर्न कितना जिद्दी है, वे वास्तव में वही करें जो मैं चाहता हूँ?"
यह शोध पत्र गणितीय रूप से सिद्ध करता है कि इसे करने का सबसे अच्छा तरीका "Threshold Reward Shaping" है।
उपमा: "पास/फेल" गेट (The "Pass/Fail" Gate)
बॉस की रणनीति को नौकरी के साक्षात्कार के लिए एक सख्त पास/फेल गेट सेट करने की तरह समझें, न कि एक सूक्ष्म ग्रेड देने की तरह।
- थ्रेशोल्ड (Threshold): बॉस एक विशिष्ट स्कोर लाइन (थ्रशहोल्ड) चुनता है।
- शेपिंग (Shaping):
- यदि इंटर्न का प्राकृतिक आउटपुट इस लाइन से नीचे है, तो बॉस उसे 0 (शून्य अंक) का स्कोर देता है।
- यदि इंटर्न का प्राकृतिक आउटपुट इस लाइन से ऊपर है, तो बॉस उसे B (अधिकतम अंक) का स्कोर देता है।
- यदि यह ठीक लाइन पर है, तो इसे एक मध्यम स्कोर मिलता है।
यह क्यों काम करता है:
रिवॉर्ड्स को एक तीखे "सब कुछ या कुछ नहीं" (All or Nothing) वाले विकल्प में बदलकर, बॉस जिद्दी इंटर्न को एक बड़ा बदलाव करने के लिए मजबूर करता है। इंटर्न को एहसास होता है, "यदि मैं इस थ्रेशोल्ड को पार नहीं करता हूँ, तो मुझे कुछ नहीं मिलेगा। यदि मैं करता हूँ, तो मुझे अधिकतम रिवॉर्ड मिलेगा।" रिवॉर्ड्स का यह अतिरंजित रूप (exaggeration) इंटर्न की जिद (पक्षपात) का मुकाबला करता है, बिना उन्हें बकवास लिखने के लिए मजबूर किए (रिवॉर्ड हैकिंग)।
व्यवहार में यह कैसे काम करता है (Inference-Time)
अधिकांश AI अलाइनमेंट ट्रेनिंग के दौरान होते हैं (मॉडल को शुरुआत से सिखाना)। यह शोध पत्र Inference-Time Alignment पर ध्यान केंद्रित करता है, जो इंटर्न को उनके काम करते समय कोचिंग देने जैसा है, बिना उन्हें फिर से प्रशिक्षित किए।
यहाँ वह चरण-दर-चरण प्रक्रिया है जिसे लेखक प्रस्तावित करते हैं:
- सैंपल (Sample): जब आप AI से कोई प्रश्न पूछते हैं, तो यह पहले अपनी स्वाभाविक, जिद्दी सहजता का उपयोग करके कुछ रफ ड्राफ्ट तैयार करता है।
- स्कोर (Score): सिस्टम इन ड्राफ्ट्स की आपकी वास्तविक प्राथमिकताओं के विरुद्ध जाँच करता है।
- थ्रेशोल्ड की गणना (Calculate the Threshold): एक त्वरित गणना (Monte Carlo sampling) का उपयोग करके, सिस्टम उस विशिष्ट प्रश्न के लिए सही "थ्रेशोल्ड" स्कोर निकालता है। यह पूछता है: "ड्राफ्ट्स की औसत गुणवत्ता कब मेरी अपेक्षाओं को पूरा करती है?"
- रीशेप (Reshape): सिस्टम फिर "पास/फेल" लॉजिक लागू करता है। यह अच्छे ड्राफ्ट्स के स्कोर को अधिकतम तक बढ़ा देता है और खराब ड्राफ्ट्स को शून्य पर गिरा देता है।
- डिकोड (Decode): AI इन रीशेप्ड स्कोर का उपयोग अंतिम शब्दों को चुनने के लिए करता है। क्योंकि रिवॉर्ड्स अब स्पष्ट रूप से परिभाषित हैं, AI को वह आउटपुट जेनरेट करने के लिए प्रेरित किया जाता है जो आप वास्तव में चाहते हैं, जिससे इसके प्राकृतिक पक्षपात पर विजय प्राप्त होती है।
परिणाम
लेखकों ने लोकप्रिय AI मॉडल्स (जैसे Llama और Qwen) पर इस पद्धति का परीक्षण किया। उन्होंने पाया कि:
- बेहतर अलाइनमेंट: AI ने मानक तरीकों की तुलना में उपयोगकर्ता की प्राथमिकताओं के साथ बहुत बेहतर तरीके से प्रतिक्रियाएँ दीं।
- कोई बकवास नहीं (No Gibberish): इस पद्धति ने "रिवॉर्ड हैकिंग" से बचाव किया, जिसका अर्थ है कि AI सिस्टम को धोखा देने के लिए बकवास लिखना शुरू नहीं हुआ।
- कुशल (Efficient): यह गणना बहुत तेज़ है। यह AI के रिस्पॉन्स टाइम में लगभग कोई देरी नहीं जोड़ती है।
- जीत (Winning): जब दूसरे AI (GPT-4) द्वारा जज किया गया, तो इस पद्धति के साथ जेनरेट की गई प्रतिक्रियाओं को 66% समय बेसलाइन से बेहतर या उसके बराबर रेट किया गया।
सारांश
संक्षेप में, यह शोध पत्र तर्क देता है कि आपको केवल AI को यह नहीं बताना चाहिए कि आपको क्या पसंद है; बल्कि आपको अपने रिवॉर्ड्स को रणनीतिक रूप से बढ़ाकर (exaggerate) दिखाना चाहिए ताकि AI के स्वाभाविक पक्षपात को दूर किया जा सके। इसे एक ऐसे खेल के रूप में फ्रेम करके जहाँ "बॉस" (रिवॉर्ड डिजाइनर) "इंटर्न" (AI) की जिद का पूर्वानुमान लगाता है, उन्होंने एक सरल, प्रभावी तरीका बनाया है जिससे AI असिस्टेंट को अधिक सहायक और उपयोगकर्ता के इरादे के अनुरूप बनाया जा सके।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।