← नवीनतम पेपर
📊 statistics

A Unified Pair-GRPO Family: From Implicit to Explicit Preference Constraints for Stable and General RL Alignment

यह शोध पत्र Pair-GRPO परिवार को प्रस्तुत करता है, जो एक एकीकृत सैद्धांतिक ढांचा है जिसमें Soft-Pair-GRPO और Hard-Pair-GRPO वेरिएंट शामिल हैं जो मुख्यधारा के RLHF में अस्थिरता, उच्च विचरण और अस्पष्टता को हल करने के लिए बाइनरी पेयरवाइज़ वरीयताओं (binary pairwise preferences) और स्पष्ट बाधाओं का लाभ उठाते हैं, जिससे भाषा और निरंतर नियंत्रण (continuous control) दोनों कार्यों में बेहतर संरेखण गुणवत्ता और सामान्यीकरण प्राप्त होता है।

मूल लेखक: Hao Yu

प्रकाशित 2026-05-08
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Hao Yu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान लेकिन थोड़े अराजक (chaotic) रोबोट को ऐसी कहानियाँ लिखना सिखा रहे हैं जिन्हें इंसान वास्तव में पसंद करें। इस प्रक्रिया को RLHF (Reinforcement Learning from Human Preferences) कहा जाता है। आमतौर पर, आप रोबोट को दो कहानियाँ दिखाते हैं, इंसान से पूछते हैं, "कौन सी बेहतर है?" और फिर रोबोट को "अच्छी" वाली कहानी के लिए और अधिक प्रयास करने और "खराब" वाली से कम प्रयास करने के लिए कहते हैं।

यह पेपर एक नए शिक्षण तरीकों के परिवार का परिचय देता है जिसे Pair-GRPO कहा जाता है। इसे एक नए, अधिक स्थिर तरीके के रूप में सोचें जिससे रोबोट को फीडबैक दिया जाता है। लेखक तर्क देते हैं कि पुराने तरीके थोड़े बहुत शोर भरे भीड़ में निर्देश चिल्लाने जैसे हैं—रोबोट भ्रमित हो जाता है, बहुत धीरे सीखता है, या अजीब व्यवहार करने लगता है।

यहाँ उनके समाधान का सरल उपमाओं (analogies) का उपयोग करके विवरण दिया गया है:

समस्या: "शोर भरा क्लासरूम" (The "Noisy Classroom")

वर्तमान तरीके (जैसे मानक GRPO) रोबोट को हर कहानी के लिए एक जटिल स्कोर देकर सिखाने की कोशिश करते हैं।

  • समस्या: यह एक शिक्षक की तरह है जो छात्र को एक निबंध के लिए "84.3" और दूसरे के लिए "82.1" का स्कोर देता है। अंतर बहुत मामूली है, और नंबर शोर भरे (noisy) हो सकते हैं। छात्र (रोबोट) इस बात को लेकर भ्रमित हो जाता है कि एक दूसरे से क्यों बेहतर था, जिससे सीखना अस्थिर हो जाता है और व्यवहार में बड़े उतार-चढ़ाव आते हैं।

समाधान: "Pair-GRPO परिवार" (The "Pair-GRPO Family")

लेखक दो नए तरीके प्रस्तावित करते हैं, जिन्हें वे Soft-Pair-GRPO और Hard-Pair-GRPO कहते हैं।

1. Soft-Pair-GRPO: "अंगूठा ऊपर / अंगूठा नीचे" वाला शिक्षक

यह पुराने तरीके का एक सरल अपग्रेड है। जटिल स्कोर (जैसे 84.3) देने के बजाय, शिक्षक केवल बाइनरी फीडबैक देता है: बेहतर कहानी के लिए +1 और खराब कहानी के लिए -1

  • जादुई ट्रिक (Gradient Equivalence): आप सोच सकते हैं, "रुको, यदि मैं विस्तृत स्कोर फेंक देता हूँ, तो क्या रोबोट कम सीखेगा?" लेखक गणितीय रूप से सिद्ध करते हैं कि नहीं, वह कम नहीं सीखेगा।
  • उपमा: कल्पना कीजिए कि आप एक पहाड़ी पर चढ़ रहे हैं। पुराना तरीका आपको 1,000.5 मीटर की सटीक ऊंचाई वाला एक नक्शा देता है। नया तरीका बस कहता है, "आप ऊपर जा रहे हैं।" लेखकों ने सिद्ध किया कि जब तक आप अपनी वर्तमान स्थिति के करीब हैं, "ऊपर जाना" ठीक उसी दिशा को बताता है जो विस्तृत नक्शा बताता है।
  • परिणाम: सरल फीडबैक (केवल "बेहतर" या "खराब") देकर, रोबोट मामूली और अर्थहीन संख्यात्मक अंतरों से विचलित होना बंद कर देता है। यह तेजी से और अधिक स्थिरता के साथ सीखता है।

2. Hard-Pair-GRPO: "बाड़ के साथ सख्त कोच" (The "Strict Coach with a Fence")

यह उन्नत संस्करण है। जबकि "Soft" केवल फीडबैक को सरल बनाता है, "Hard" एक सख्त नियम पुस्तिका जोड़ता है।

  • Soft के साथ समस्या: सरल फीडबैक के साथ भी, रोबोट अनजाने में अपने व्यक्तित्व को उन तरीकों से बदल सकता है जिनकी आपने मांग नहीं की थी। यह डायनासोरों के बारे में लिखना शुरू कर सकता है जबकि आपने केवल बिल्लियों के बारे में लिखने के लिए कहा था, क्योंकि गणित थोड़ा ढीला हो गया था।
  • समाधान: Hard-Pair-GRPO रोबोट के सीखने के चारों ओर एक बाड़ (fence) बनाता है। यह कहता है, "आप केवल उन्हीं दो कहानियों के बारे में अपना विचार बदल सकते हैं जिनकी हम अभी तुलना कर रहे हैं। बाकी सब बिल्कुल वैसा ही रहेगा।"
  • उपमा: एक मूर्तिकार की कल्पना करें।
    • Soft-Pair-GRPO एक मूर्तिकार को यह बताने जैसा है, "इस मूर्ति को अच्छी वाली मूर्ति की तरह बनाओ।" मूर्तिकार चेहरे को ठीक करते समय गलती से मूर्ति के जूते या टोपी भी बदल सकता है।
    • Hard-Pair-GRPO मूर्ति के चारों ओर एक कांच का केस लगा देता है। मूर्तिकार केवल चेहरे को छू सकता है। उन्हें जूतों या टोपी को बदलने से शारीरिक रूप से रोका जाता है।
  • परिणाम: यह "ड्रिफ्ट" (रोबोट का पटरी से उतरना) को समाप्त करता है और सीखने की प्रक्रिया को अविश्वसनीय रूप से सुचारू और अनुमानित बनाता है।

प्रयोग क्या दिखाते हैं

लेखकों ने इन तरीकों का परीक्षण दो बहुत अलग दुनिया में किया:

  1. भाषा मॉडल (LLMs): रोबोट को चैट करने और मददगार होने के लिए सिखाना।
  2. रोबोटिक्स (MuJoCo): एक आभासी चीते (virtual cheetah) को दौड़ना सिखाना।

परिणाम:

  • बेहतर प्रदर्शन: नए तरीके दोनों में पुराने मानकों (जैसे PPO और DPO) को पछाड़ देते हैं—बेहतर कहानियाँ लिखने और रोबोट को तेज़ी से चलाने में।
  • स्थिरता: प्रशिक्षण प्रक्रिया बहुत कम "झटका देने वाली" (jittery) थी। यदि आप सीखने की प्रगति का ग्राफ बनाते हैं, तो पुराने तरीके एक टेढ़ी-मेढ़ी रेखा खींचने वाले हाथ की तरह दिखते थे, जबकि नए तरीके (विशेष रूप से Hard-Pair-GRPO) एक चिकने, सीधे तीर की तरह दिखते थे।
  • सामान्यीकरण (Generalization): तथ्य यह है कि यह लेखन और दौड़ने वाले रोबोट दोनों पर काम करता है, यह साबित करता है कि यह केवल भाषा के लिए एक ट्रिक नहीं है; यह मशीनों द्वारा पसंद से सीखने का एक मौलिक सुधार है।

मुख्य निष्कर्ष (The Big Takeaway)

पेपर का दावा है कि हमें मशीनों को यह सिखाने के लिए जटिल, शोर भरे स्कोर की आवश्यकता नहीं है कि इंसान क्या पसंद करते हैं। हमें बस स्पष्ट रूप से कहना है कि "A, B से बेहतर है" और, यदि हम अतिरिक्त सावधानी बरतना चाहते हैं, तो सख्ती से सीमित करना है कि मशीन अपने व्यवहार को उस विशिष्ट तुलना को ठीक करने के लिए कैसे बदल सकती है।

"जटिल स्कोरिंग" से "सरल तुलना" में स्विच करके और "सख्त सीमाओं" को जोड़कर, उन्होंने एक ऐसा शिक्षण तरीका बनाया है जो तेज़, सुरक्षित और अधिक विश्वसनीय है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →