← नवीनतम पेपर
🤖 machine learning

GRPO, Dr. GRPO, and DAPO Are Three Operations on One Number: The Group-Standard-Deviation Identity

यह शोध पत्र प्रकट करता है कि GRPO, Dr. GRPO, और DAPO अलग-अलग विधियाँ नहीं हैं, बल्कि एक ही अंतर्निहित तंत्र के तीन विशिष्ट विन्यास (configurations) हैं: बाइनरी रिवॉर्ड्स का ग्रुप स्टैंडर्ड डेविएशन, जो प्रशिक्षण अपडेट के परिमाण को निर्देशित करता है और यह निर्धारित करता है कि कौन सी समस्याएँ प्रभावी रूप से सीखने में योगदान देती हैं।

मूल लेखक: Yong Yi Bay, Kathleen A. Yearick

प्रकाशित 2026-07-02
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yong Yi Bay, Kathleen A. Yearick

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक छात्र को एक कठिन गणित की समस्या हल करना सिखाने की कोशिश कर रहे हैं। इसके बजाय कि आप उनसे केवल एक बार पूछें, आप उन्हें एक ही समस्या को लगातार आठ बार हल करने के लिए कहते हैं।

  • यदि वे आठों बार गलत होते हैं, तो आप उन्हें बहुत कुछ नहीं सिखा सकते क्योंकि आपको अभी तक यह नहीं पता कि एक "सही" उत्तर उनके लिए कैसा दिखता है।
  • यदि वे आठों बार सही होते हैं, तो भी आप उन्हें बहुत कुछ नहीं सिखा सकते क्योंकि वे इसे पहले से ही जानते हैं; सीखने के लिए संघर्ष की कमी है।
  • लेकिन यदि वे चार सही और चार गलत करते हैं, तो यही वह "स्वीट स्पॉट" (उपयुक्त स्थिति) है। आप सही वाले उत्तरों की ओर इशारा करके कह सकते हैं, "ऐसा करो," और गलत वाले उत्तरों की ओर इशारा करके कह सकते, "ऐसा मत करो।" उनके प्रयासों के बीच का असहमति (disagreement) ही सीखने का संकेत पैदा करता है।

यह शोध पत्र, जिसका शीर्षक है "GRPO, Dr. GRPO, and DAPO Are Three Operations on One Number," यह तर्क देता है कि AI को तर्क करने (reasoning) के लिए प्रशिक्षित करने के तीन लोकप्रिय तरीके वास्तव में असहमति के उस विशिष्ट क्षण को संभालने के तीन अलग-अलग तरीके हैं।

यहाँ सरल उपमाओं (analogies) का उपयोग करके इसका विवरण दिया गया है:

"जादुई संख्या": मानक विचलन (The Standard Deviation)

यह शोध पत्र उन आठ प्रयासों से गणना की गई एक विशिष्ट संख्या पर ध्यान केंद्रित करता है: मानक विचलन (Standard Deviation)

  • इसे एक "भ्रम मीटर" (Confusion Meter) के रूप में सोचें।
  • यदि छात्र 8/8 सही या 0/8 सही होता है, तो मीटर शून्य दिखाता है। कोई भ्रम नहीं है, और इसलिए, सीखने का कोई संकेत नहीं है।
  • यदि छात्र 4/8 सही होता है, तो मीटर अधिकतम होता है। छात्र भ्रमित है, और यही भ्रम ही वह जगह है जहाँ सीखना होता है।

यह शोध पत्र सिद्ध करता है कि बाइनरी रिवॉर्ड्स (सही/गलत) के लिए, यह "भ्रम मीटर" केवल एक सहायक उपकरण नहीं है; यह वास्तव में पाठ का आकार है।

तीन विधियाँ: डायल को घुमाने के तीन तरीके

यह शोध पत्र दिखाता है कि तीन प्रसिद्ध AI प्रशिक्षण विधियाँ वास्तव में इसी एक डायल के तीन अलग-अलग सेटिंग्स हैं:

  1. GRPO (एम्प्लीफायर - प्रवर्धक):

    • यह क्या करता है: यह पाठ को लेता है और उसे "भ्रम मीटर" से भाग (divide) देता है।
    • उपमा: कल्पना कीजिए कि एक शिक्षक कहता है, "यदि तुम भ्रमित हो (उच्च मीटर), तो मैं पाठ को बहुत जोर से चिल्लाकर बोलूँगा ताकि तुम सुन सको। यदि तुम भ्रमित नहीं हो (कम मीटर), तो मैं फुसफुसाऊंगा।"
    • परिणाम: यह विधि कठिन और सबसे आसान समस्याओं (जहाँ मीटर उच्च है) को बहुत अधिक प्राथमिकता देती है और "बिल्कुल सही" वाली समस्याओं को अनदेखा कर देती है। यह एक "कठिनाई पूर्वाग्रह" (difficulty bias) बनाता है, जो AI को चरम स्थितियों पर तीव्रता से ध्यान केंद्रित करने के लिए प्रेरित करता है।
  2. Dr. GRPO (फ्लैट-लाइनर):

    • यह क्या करता है: यह भाग देने को हटा देता है। यह "भ्रम मीटर" को पूरी तरह से अनदेखा करता है।
    • उपमा: यह शिक्षक कहता है, "मैं ठीक उसी आवाज़ में चिल्लाऊँगा, चाहे तुम कितने भी भ्रमित क्यों न हो।"
    • परिणाम: AI शुद्ध सफलता दर के आधार पर सीखता है। यह 50/50 के अनुमान और 90% सफलता दर दोनों को सुधार की प्रति इकाई समान भार देता है। यह पहले तरीके के "कठिनाई पूर्वाग्रह" को हटा देता है।
  3. DAPO (फ़िल्टर):

    • यह क्या करता है: यह "भ्रम मीटर" को देखता है। यदि मीटर शून्य है (सभी ने सही उत्तर दिया या सभी ने गलत), तो यह उस समूह को फेंक देता है और छात्र को फिर से प्रयास करने के लिए कहता है।
    • उपमा: यह शिक्षक कहता है, "यदि तुम्हें सभी उत्तर सही या सभी गलत मिलते हैं, तो मैं इस पर समय बर्बाद नहीं करूँगा। मैं बस तुम्हें नए प्रश्नों का एक सेट दूँगा जब तक कि तुम मुझे कुछ भ्रम दिखा न दो।"
    • परिणाम: यह उन "शांत" समूहों को अनदेखा करके कंप्यूटिंग शक्ति बचाता जो कुछ भी नहीं सिखाते।

बड़ी खोज: एक डायल, तीन सेटिंग्स

शोध पत्र का मुख्य दावा है कि ये तीन अलग आविष्कार नहीं हैं। वे केवल एक ही संख्या (समूह के उत्तरों का मानक विचलन) पर तीन अलग-अलग ऑपरेशन हैं:

  • GRPO इससे भाग देता है।
  • Dr. GRPO इसे अनदेखा करता है।
  • DAPO शून्य वाले समूहों को फ़िल्टर करता है।

यह क्यों महत्वपूर्ण है ( "समूह आकार" का नियम)

यह शोध पत्र एक व्यावहारिक नियम भी देता है कि आपको छात्र को कितनी बार प्रयास करने के लिए कहना चाहिए (यानी "समूह का आकार"):

  • नियम: समस्या जितनी कठिन होगी, आपको उतनी ही अधिक बार पूछने की आवश्यकता होगी।
  • उपमा: यदि कोई समस्या "सिक्का उछालने" (50% सही होने की संभावना) जैसी है, तो 8 बार पूछना आमतौर पर एक अच्छा पाठ प्राप्त करने के लिए पर्याप्त है। लेकिन यदि कोई समस्या बहुत कठिन है (केवल 5% सही होने की संभावना), तो 8 बार पूछने पर हर बार 8 गलत उत्तर मिल सकते हैं (एक शांत समूह)। आपको एक ऐसा समूह पाने के लिए 70 बार पूछने की आवश्यकता हो सकती है जहाँ छात्र कुछ सही और कुछ गलत करे, ताकि आप वास्तव में उन्हें सिखा सकें।

सारांश

यह शोध पत्र जटिल AI प्रशिक्षण को सरल बनाता है, यह दिखाते हुए कि:

  1. सीखना असहमति के माध्यम से होता है। यदि एक AI समूह हर चीज़ पर सहमत है (सभी सही या सभी गलत), तो वह कुछ नहीं सीखता।
  2. "भ्रम मीटर" ही पाठ है। असहमति की मात्रा यह निर्धारित करती है कि सीखने का संकेत कितना मजबूत है।
  3. तीनों विधियाँ इसी मीटर का उपयोग करने के तीन अलग-अलग तरीके हैं। एक इसे बढ़ाता है, एक इसे अनदेखा करता है, और एक उन समूहों को छोड़ देता है जहाँ मीटर काम नहीं कर रहा है।

लेखकों ने गणित की समस्याओं के एक विशाल डेटासेट और नियंत्रित कंप्यूटर सिमुलेशन पर इनका परीक्षण किया, जिससे यह सिद्ध हुआ कि ये सूत्र सटीक रूप से भविष्यवाणी करते हैं कि AI कितना सीखता है और उसे सफल होने के लिए कितने प्रयासों की आवश्यकता होती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →