f-GRPO and Beyond: Divergence-Based Reinforcement Learning Algorithms for General LLM Alignment
यह शोध पत्र -GRPO और -HAL को पेश करके डाइवर्जेंस-आधारित प्रेफरेंस अलाइनमेंट (preference alignment) को सामान्य LLM अलाइनमेंट तक विस्तारित करता है, जो रिवॉर्ड-आधारित रीजनिंग (reward-based reasoning) में सुधार करने और सेफ्टी अलाइनमेंट में रिवॉर्ड हैकिंग (reward hacking) को कम करने के लिए -डाइवर्जेंस एस्टीमेशन का लाभ उठाते हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान लेकिन थोड़ी शरारती रोबोटिक असिस्टेंट (एक लार्ज लैंग्वेज मॉडल) को मददगार, सुरक्षित और पहेलियाँ सुलझाने में कुशल बनने के लिए प्रशिक्षित कर रहे हैं। आप जो शोध पत्र (पेपर) पढ़ रहे हैं, वह इस तरह से है जैसे इस रोबोट को सिखाने के लिए एक नया निर्देश मैनुअल, जो विशेष रूप से दो अलग-अलग तरीकों पर ध्यान केंद्रित करता है जिनसे हम इसे फीडबैक दे सकते हैं।
यहाँ इस पेपर की कहानी है, जिसे सरल अवधारणाओं और उपमाओं में विभाजित किया गया है।
रोबोट को सिखाने के दो तरीके
लेखक बताते हैं कि इन रोबोटों को सिखाने के लिए हमारे पास दो मुख्य "कक्षाएं" (classrooms) हैं, और हम आमतौर पर प्रत्येक के लिए अलग-अलग शिक्षण विधियों का उपयोग करते हैं।
1. "गणित की कक्षा" (Verifiable Rewards - सत्यापन योग्य पुरस्कार)
- परिदृश्य: कल्पना कीजिए कि आप रोबोट को गणित सिखा रहे हैं। यदि वह हल करता है, तो आप तुरंत उत्तर की जांच कर सकते हैं। या तो यह सही है (उच्च स्कोर) या गलत (कम स्कोर)।
- पुरानी विधि (GRPO): यह सिखाने का वर्तमान सबसे अच्छा तरीका एक कोच की तरह है जो कहता है, "उस उत्तर पर बहुत अच्छा काम किया! वैसे ही और काम करो। उस पर बुरा काम किया; वैसा कम करो।" यह उत्तरों के एक समूह (batch) को देखता है, उनके औसत स्कोर को देखता है, और रोबोट को औसत से ऊपर कुछ भी लक्ष्य बनाने के लिए कहता है।
- समस्या: यह थोड़ा भद्दा (blunt) है। यह सभी "औसत से ऊपर" वाले उत्तरों के साथ एक जैसा व्यवहार करता है, भले ही एक दूसरे से कहीं अधिक बेहतर क्यों न हो।
2. "कला की कक्षा" (Preferences - प्राथमिकताएँ)
- परिदृश्य: अब कल्पना कीजिए कि आप रोबोट को विनम्र या सुरक्षित होना सिखा रहे हैं। यहाँ कोई एक एकल "सही" उत्तर नहीं होता। इसके बजाय, आप रोबोट को दो प्रतिक्रियाएं दिखाते हैं और कहते हैं, "मुझे यह वाली उस दूसरी वाली से बेहतर लगी।"
- पुरानी विधि: रोबोट इन जोड़ों (pairs) की तुलना करके सीखता है। वह "पसंद की गई" प्रतिक्रियाओं की संभावना बढ़ाने और "नापसंद की गई" प्रतिक्रियाओं की संभावना कम करने की कोशिश करता है।
एक बड़ा विचार: एक एकीकृत भाषा (One Unified Language)
लेखकों ने देखा कि गणित की कक्षा और कला की कक्षा दोनों में, लक्ष्य वास्तव में एक ही है। आप रोबोट के व्यवहार को "बुरे" जवाबों से दूर धकेलने और "अच्छे" जवाबों की ओर ले जाने की कोशिश कर रहे हैं।
गणितीय शब्दों में, वे इसे Divergence (विचलन) कहते हैं। "Divergence" को दो समूहों के बीच की दूरी के रूप में सोचें:
- समूह A: "अच्छे" प्रतिक्रियाएं (Aligned/अनुरूप)।
- समूह B: "बुरे" प्रतिक्रियाएं (Unaligned/अनुरूप नहीं)।
पेपर का तर्क है कि हम दोनों कक्षाओं में, चाहे वह गणित हो या कला, समूहों के बीच की दूरी को मापने के लिए एक ही गणितीय उपकरण का उपयोग कर सकते हैं। वे इस उपकरण को f-Divergence कहते हैं।
नए उपकरण: f-GRPO और f-HAL
लेखकों ने इस विचार पर आधारित दो नए "शिक्षण एल्गोरिदम" बनाए हैं।
1. f-GRPO: "गणित की कक्षा" का अपग्रेड
- यह क्या है: गणित की कक्षा (जहाँ स्पष्ट सही/गलत उत्तर होते हैं) में रोबोट को सिखाने का एक नया तरीका।
- उपमा: कल्पना कीजिए कि पुराने कोच (GRPO) चिल्ला रहा था, "औसत से ऊपर वाले सभी लोग, बहुत अच्छा काम किया!" नया कोच (f-GRPO) अधिक सटीक है। वह कहता है, "हम 'अच्छे' समूह को 'बुरे' समूह से जितना संभव हो सके उतना दूर धकेलने की कोशिश कर रहे हैं।"
- यह कैसे काम करता है: केवल औसत स्कोर देखने के बजाय, यह एक गणितीय "बल" (force) बनाता है जो रोबोट को उच्च स्कोर वाले उत्तर उत्पन्न करने के लिए प्रेरित करता है और कम स्कोर वाले उत्तरों को सक्रिय रूप से दबा देता है। यह अच्छे और बुरे उत्तरों के बीच के अंतर को एक भौतिक दूरी की तरह मानता है जिसे अधिकतम किया जाना चाहिए।
- परिणाम: उनके प्रयोगों में, इस नए कोच ने रोबोट को पुराने कोच की तुलना में गणित की समस्याओं को बेहतर ढंग से हल करने में मदद की, विशेष रूप से बहुत कठिन पहेलियों पर।
2. f-HAL: "हाइब्रिड" शिक्षक
- समस्या: कभी-कभी, हमारे पास एक आदर्श "गणित की कक्षा" वाला स्कोर नहीं होता है। उदाहरण के लिए, सुरक्षा सिखाते समय, हम एक "रिवॉर्ड मॉडल" (एक दूसरा AI) का उपयोग कर सकते हैं जो यह अनुमान लगाता है कि क्या कोई उत्तर सुरक्षित है। लेकिन यह दूसरा AI गलत हो सकता है या "धोखा" खा सकता है (इसे Reward Hacking कहा जाता है)। रोबोट ऐसी बातें कहना सीख सकता है जो दूसरे AI को सुरक्षित दिखती हैं, लेकिन वास्तव में वे अजीब या अनुपयोगी होती हैं।
- समाधान: f-HAL एक हाइब्रिड (मिश्रित) शिक्षक है। यह दो संकेतों को जोड़ता है:
- On-Policy सिग्नल: "रोबोट अभी क्या कर रहा है उसे देखो और उसे एक स्कोर दो।" (नए विचारों की खोज के लिए अच्छा है)।
- Off-Policy सिग्नल: "यहाँ मानव द्वारा स्वीकृत अच्छे और बुरे व्यवहार के उदाहरणों की एक सूची है।" (रोबोट को जमीन से जुड़े रहने में मदद करता है)।
- उपमा: कल्पना कीजिए कि एक छात्र परीक्षा दे रहा है।
- शुद्ध On-Policy: छात्र केवल उस शिक्षक की बात सुनता है जो उत्तरों का अनुमान लगा रहा है। यदि शिक्षक अनुमान लगाने में खराब है, तो छात्र असफल हो जाता है।
- शुद्ध Off-Policy: छात्र केवल पुराने उत्तर कुंजियों (answer keys) को रटता है। वे बहुत कठोर हो सकते हैं और नए प्रश्नों के अनुकूल होने में विफल हो सकते हैं।
- f-HAL (हाइब्रिड): छात्र अनुमान लगाने वाले शिक्षक की बात तो सुनता है, लेकिन अपने डेस्क पर पुरानी उत्तर कुंजियों की एक प्रति भी रखता है। यदि शिक्षक कुछ भी अजीब कहना शुरू करता है, तो छात्र कुंजियों की जाँच करता है और कहता है, "रुको, यह नियमों से मेल नहीं खाता।"
- परिणाम: इस हाइब्रिड दृष्टिकोण ने रोबोट को "चीटिंग" (Reward Hacking) करने से रोका जब सुरक्षा स्कोर अपूर्ण था। इसने रोबोट को सुरक्षित और मददगार बनाए रखा, भले ही "स्कोरिंग" करने वाला AI पूरी तरह सटीक न हो।
यह क्यों मायने रखता है (पेपर के अनुसार)
पेपर का दावा है कि "एलाइनमेंट" (रोबोट को सिखाना) को समूहों के बीच की दूरी मापने की समस्या के रूप में देखकर, उन्होंने एक एकीकृत ढांचा तैयार किया है।
- गणित/तर्क के लिए: उन्होंने सिद्ध किया कि उनका नया तरीका (f-GRPO) गारंटी देता है कि रोबोट उच्च स्कोर प्राप्त करने में बेहतर होगा, सैद्धांतिक रूप से इसे सर्वोत्तम उत्तरों की ओर धकेलेगा।
- सुरक्षा/प्राथमिकता के लिए: उन्होंने सिद्ध किया कि मानव प्राथमिकताओं को रिवॉर्ड स्कोर के साथ मिलाने से (f-HAL), रोबोट अपूर्ण स्कोरिंग सिस्टम से भ्रमित या धोखा नहीं खाएगा।
एक वाक्य में सारांश
लेखकों ने AI रोबोट को सिखाने का एक नया तरीका आविष्कार किया है, जिसमें "अच्छे" और "बुरे" व्यवहार को दो समूहों के रूप में देखा जाता है जिन्हें एक दूसरे से दूर धकेले जाने की आवश्यकता है, जिससे एक एकल, लचीली प्रणाली बनती है जो पिछले तरीकों की तुलना में गणितीय पहेलियों और सुरक्षा नियमों दोनों के लिए बेहतर काम करती है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।