← नवीनतम पेपर
💬 NLP

RLHF in an SFT Way: From Optimal Solution to Reward-Weighted Alignment

यह शोध पत्र वेरिएशनल अलाइनमेंट विद री-वेटिंग (VAR) का प्रस्ताव करता है, जो एक नवीन ऑफलाइन विधि है जो बेहतर अलाइनमेंट प्रदर्शन और स्थिरता प्राप्त करने के लिए मानव फीडबैक से सुदृढीकरण लर्निंग (RLHF) को एक रिवॉर्ड-वेटेड सुपरवाइज्ड फाइन-ट्यूनिंग कार्य के रूप में पुनर्गठित करती है, जबकि पारंपरिक ऑनलाइन विधियों और DPO जैसे मौजूदा ऑफलाइन दृष्टिकोणों की तुलना में कम्प्यूटेशनल लागत को काफी कम करती है।

मूल लेखक: Yuhao Du, Zhuo Li, Pengyu Cheng, Zhihong Chen, Yuejiao Xie, Xiang Wan, Anningzhe Gao

प्रकाशित 2026-03-24
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yuhao Du, Zhuo Li, Pengyu Cheng, Zhihong Chen, Yuejiao Xie, Xiang Wan, Anningzhe Gao

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

🎓 बड़ी तस्वीर: AI को "अच्छा" बनना सिखाना

कल्पना कीजिए कि आपके पास एक प्रतिभाशाली लेकिन अराजक छात्र (AI मॉडल) है। उसे बहुत सारी बातें पता हैं, लेकिन वह हमेशा यह नहीं जानता कि विनम्रता से व्यवहार कैसे करना है, मददगार कैसे बनना है, या बुरी बातें कहने से कैसे बचना है।

इसे ठीक करने के लिए, हमें उसे "मानवीय मूल्य" (Human Values) सिखाने की आवश्यकता है। AI की दुनिया में, इस प्रक्रिया को RLHF (Reinforcement Learning from Human Feedback) कहा जाता है।

पुराना तरीका (The "PPO" Method):
इस छात्र को सिखाने के पुराने तरीके को एक हाई-स्टेक्स, लाइव-एक्शन रोल-प्लेइंग गेम की तरह समझें।

  1. आप छात्र को एक प्रॉम्प्ट देते हैं।
  2. वे एक उत्तर का अनुमान लगाते हैं।
  3. एक शिक्षक (Reward Model) उसे ग्रेड देता है।
  4. छात्र फिर से प्रयास करता है, ग्रेड के आधार पर अपने व्यवहार को समायोजित करता है।
  5. समस्या: यह किसी को ट्रेडमिल पर दौड़ते समय जग्लिंग (juggle) करना सिखाने जैसा है। इसके लिए एक बड़ी टीम (एक क्रिटिक, एक रिवॉर्ड मॉडल, एक रेफरेंस मॉडल) की आवश्यकता होती है, इसमें बहुत समय लगता है, और छात्र अक्सर भ्रमित हो जाता है या क्रैश हो जाता है (अस्थिरता)। यह महंगा और धीमा है।

"DPO" वाला तरीका (वर्तमान शॉर्टकट):
समय बचाने के लिए, शोधकर्ताओं ने DPO (Direct Preference Optimization) का आविष्कार किया। लाइव गेम खेलने के बजाय, वे बस छात्र को "अच्छे उत्तरों" बनाम "बुरे उत्तरों" की एक सूची दिखाते हैं और कहते हैं, "अच्छे वाले ज़्यादा करो, बुरे वाले कम करो।"

  • समस्या: कभी-कभी, छात्र को यह कहना कि "बुरी चीज़ मत करो," एक अजीब गणितीय गड़बड़ी (glitch) पैदा कर देता है। यदि "बुरा" उत्तर बहुत मजबूती से खारिज किया जाता है, तो गणित टूट जाता है, और छात्र अजीब व्यवहार करने लगता है या उत्तर देने से मना कर देता है। यह एक बच्चे को यह कहने जैसा है कि "गुलाबी हाथी के बारे में मत सोचो," और अचानक वह उसके बारे में सोचना बंद नहीं कर पाता।

🚀 नया समाधान: VAR (Variational Alignment with Re-weighting)

इस पेपर के लेखक कहते हैं: "हम इसे इतना जटिल क्यों बना रहे हैं? चलिए इसे एक साधारण गणित की समस्या की तरह लेते हैं।"

उन्होंने VAR नामक एक नई विधि प्रस्तावित की है। यह कैसे काम करती है, यहाँ एक सरल उपमा दी गई है:

उपमा: "सर्वश्रेष्ठ छात्र" बनाम "कक्षा का औसत"

कल्पना कीजिए कि एक कक्षा है जहाँ:

  • Reference Model "औसत छात्र" है (जो बुनियादी बातें जानता है लेकिन पूर्ण नहीं है)।
  • Optimal Solution "परफेक्ट छात्र" है (जो हमेशा सबसे अच्छा, सबसे मददगार और हानिरहित उत्तर देता है)।
  • आपका लक्ष्य "औसत छात्र" को "परफेक्ट छात्र" में बदलना है।

VAR कैसे काम करता है:
जटिल गेम खेलने या नकारात्मक संख्याओं से लड़ने के बजाय, VAR परफेक्ट छात्र के उत्तरों को देखता है और पूछता है: "यह उत्तर औसत छात्र के उत्तर से कितना बेहतर है?"

  1. स्कोरकार्ड: यह प्रत्येक उत्तर के लिए एक "रिवॉर्ड स्कोर" की गणना करता है।
  2. जादुई वेट (Magic Weight): यह उस स्कोर को एक सकारात्मक वेट (एक मल्टीप्लायर) में बदल देता है।
    • यदि उत्तर शानदार है, तो वेट बहुत बड़ा होता है (जैसे 100x)।
    • यदि उत्तर ठीक-ठाक है, तो वेट छोटा होता है (जैसे 1x)।
    • महत्वपूर्ण: यह कभी भी नकारात्मक वेट का उपयोग नहीं करता है। यह केवल यह कहता है, "इसे अधिक करो," कभी यह नहीं कहता "इसे कम करो।" यह उन गणितीय गड़बड़ियों से बचता है जो अन्य विधियों को तोड़ देती हैं।
  3. सरल पाठ: इसके बाद यह AI को बताता है: "औसत छात्र के उत्तरों को देखो, लेकिन उन पर विशेष ध्यान दो जिन्हें उच्च स्कोर मिले। उनसे सीखो।"

यह जटिल Reinforcement Learning की समस्या को एक सरल Supervised Fine-Tuning (SFT) समस्या में बदल देता है। यह एक मानक होमवर्क असाइनमेंट लेने जैसा है लेकिन सही उत्तरों के लिए अतिरिक्त क्रेडिट अंक देने जैसा है।


⚡ VAR एक गेम-चेंजर क्यों है?

1. यह तेज़ है (The "Express Lane")

  • पुराना तरीका (PPO): एक ऐसी रेस कार चलाने जैसा है जिसे हर 5 मिनट में ईंधन भरने की आवश्यकता होती है। इसे प्रशिक्षित करने में 5 घंटे लगते हैं।
  • VAR: एक हाई-स्पीड ट्रेन लेने जैसा है। यह पुराने तरीकों की तुलना में 5 गुना तेज़ है। पेपर कहता है कि यह अगले सबसे अच्छे विकल्प (2 घंटे 54 मिनट) की तुलना में लगभग 42 मिनट में प्रशिक्षित हो जाता है।

2. यह स्थिर है (The "Steady Hand")

  • अन्य विधियाँ अक्सर "दोलन" (oscillate) करती हैं। AI बेहतर होता है, फिर अचानक बुरा हो जाता है, फिर बेहतर हो जाता है। यह एक नशे में धुत व्यक्ति के टेढ़े-मेढ़े चलने जैसा है।
  • VAR एक लेजर-गाइडेड मिसाइल की तरह है। यह लगातार ऊपर चढ़ता है। क्योंकि यह केवल सकारात्मक वेट का उपयोग करता है, गणित कभी नहीं टूटता और प्रशिक्षण क्रैश नहीं होता।

3. यह स्मार्ट है (The "Better Grades")

  • जब मानक बेंचमार्क (जैसे गणित, कोडिंग और मददगार होना) पर परीक्षण किया गया, तो VAR ने वर्तमान लोकप्रिय विधि (DPO) को काफी अंतर से पीछे छोड़ दिया (लग लगभग 7% बेहतर)।
  • यह AI को अधिक मददगार बनाता है और हानिकारक बातें बोलने की संभावना को कम करता है, भले ही वह एक ऐसे "बेस" मॉडल से शुरू हुआ हो जिसे बहुत कम सिखाया गया हो।

🛠️ उन्होंने यह कैसे किया (The "Batch" Trick)

आप पूछ सकते हैं: "रुको, आप बिना वास्तव में एक परफेक्ट छात्र के पास मौजूद हुए, यह कैसे जानते हैं कि 'परफेक्ट छात्र' कैसा दिखता है?"

लेखकों ने In-Batch Estimation नामक एक चतुर ट्रिक का उपयोग किया।

  • कल्पना कीजिए कि आप एक टेस्ट को ग्रेड कर रहे हैं। पूरे स्कूल के खत्म होने का इंतज़ार करने के बजाय, आप छात्रों के एक छोटे समूह (एक "बैच") को लेते हैं (जैसे 8 छात्र)।
  • आप उन सभी 8 उत्तरों को एक साथ देखते हैं। आप समूह की औसत "अच्छाई" की गणना करते हैं।
  • आप उस समूह के औसत का उपयोग यह पता लगाने के लिए करते हैं कि प्रत्येक व्यक्तिगत छात्र को कितना पुरस्कृत किया जाना चाहिए।
  • यह इतना कुशल है कि आपको जटिल सिमुलेशन चलाने की आवश्यकता नहीं है। आप इसे सीधे वहीं, आपके पास मौजूद डेटा के साथ करते हैं।

🏆 निचोड़ (The Bottom Line)

समस्या: AI को मददगार बनाना वर्तमान में बहुत महंगा, बहुत धीमा और बहुत अस्थिर है।
समाधान: VAR
परिणाम: एक ऐसी विधि जो सरल है (एक मानक होमवर्क असाइनमेंट की तरह), तेज़ है (प्रतिस्पर्धियों से 5 गुना तेज़), और स्थिर है (कोई क्रैश नहीं)।

VAR को AI प्रशिक्षण की जटिल, महंगी मशीनरी को एक चिकनी, कुशल इंजन में बदलने के रूप में देखें जो बिना धुएं और शोर के समान या बेहतर परिणाम प्राप्त करता है। यह "सही करने" और "तेजी से करने" के बीच के अंतर को पाटता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →