← नवीनतम पेपर
🤖 machine learning

F-GRPO: Don't Let Your Policy Learn the Obvious and Forget the Rare

यह शोधपत्र F-GRPO का प्रस्ताव करता है, जो एक कठिनाई-जागरूक (difficulty-aware) सुदृढीकरण शिक्षण विधि है जो उच्च-सफलता वाले अपडेट को कम भार देकर मानक समूह-आधारित एल्गोरिदम की सामान्य समाधानों पर ओवरफिट होने और दुर्लभ सही प्रक्षेप पथों (trajectories) की उपेक्षा करने की प्रवृत्ति को कम करती है, जिससे बिना किसी अतिरिक्त कम्प्यूटेशनल लागत के विभिन्न बेसलाइनों में गणितीय तर्क प्रदर्शन में महत्वपूर्ण सुधार होता है।

मूल लेखक: Daniil Plyusov, Alexey Gorbatovski, Boris Shaposhnikov, Viacheslav Sinii, Alexey Malakhov, Daria Korotyshova, Daniil Gavrilov

प्रकाशित 2026-05-26
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Daniil Plyusov, Alexey Gorbatovski, Boris Shaposhnikov, Viacheslav Sinii, Alexey Malakhov, Daria Korotyshova, Daniil Gavrilov

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ सरल भाषा और रचनात्मक उपमाओं का उपयोग करते हुए पेपर "F-GRPO: Don't Let Your Policy Learn the Obvious and Forget the Rare" की व्याख्या दी गई है।

बड़ी तस्वीर: "ग्रुप स्टडी" की समस्या

कल्पना कीजिए कि आप एक छात्र (एक AI मॉडल) को एक कठिन गणित की समस्या हल करना सिखा रहे हैं। उन्हें मदद करने के लिए, आप उन्हें केवल एक उत्तर नहीं दिखाते; बल्कि आप उनसे एक ही समय में आठ अलग-अलग प्रयास (एक "ग्रुप") करने के लिए कहते हैं। फिर आप इन आठ प्रयासों को देखते हैं, उनकी तुलना करते हैं, और छात्र को बताते हैं: "हे, तुम्हारे अधिकांश उत्तर गलत थे, लेकिन यह वाला सही था। अगली बार हम चाहते हैं कि तुम इसी तरह का उत्तर देने की अधिक संभावना रखें।"

इस पद्धति को Group-Relative Policy Optimization (GRPO) कहा जाता है। यह एक स्टडी ग्रुप की तरह है जहाँ शिक्षक केवल उस फीडबैक के आधार पर प्रतिक्रिया देता है जो ग्रुप ने वास्तव में उत्पन्न किया है।

समस्या:
पेपर का तर्क है कि यदि आपका स्टडी ग्रुप बहुत छोटा है, तो हो सकता है कि आपको सही उत्तर मिले ही नहीं। लेकिन यदि आपका ग्रुप "सही" आकार का है (न बहुत छोटा, न बहुत बड़ा), तो एक अजीब चीज़ होती है:

  1. ग्रुप सही उत्तर ढूँढ लेता है।
  2. शिक्षक कहता है, "बहुत बढ़िया, इस पर ध्यान दो!"
  3. छात्र उस एक विशिष्ट सही उत्तर को लेकर इतना उत्साहित हो जाता है कि वह समस्या को हल करने के अन्य तरीकों को खोजना बंद कर देता है। वह उस एकल समाधान के प्रति जुनूनी हो जाता है और वहां तक पहुँचने के अन्य सभी वैध तरीकों को भूल जाता है।

AI की दुनिया में, इसे "डिस्ट्रीब्यूशन शार्पनिंग" (Distribution Sharpening) कहा जाता है। AI एक सामान्य उत्तर खोजने में बहुत अच्छा हो जाता है लेकिन दुर्लभ, रचनात्मक या कठिन उत्तर खोजने की क्षमता खो देता है। यह एक ऐसे छात्र की तरह है जिसने सबसे आम टेस्ट प्रश्नों के उत्तर तो रट लिए हैं, लेकिन जब शिक्षक एक पेचीदा, असामान्य प्रश्न पूछता है, तो वह पूरी तरह विफल हो जाता है।

मुख्य खोज: "गोल्डिलॉक्स" ट्रैप (The "Goldilocks" Trap)

लेखकों ने कुछ गणितीय गणनाएँ कीं जिससे यह सिद्ध हुआ कि यह "भूलने" की प्रक्रिया सबसे अधिक तब होती है जब ग्रुप का आकार मध्यम (medium) होता है।

  • छोटे ग्रुप (आकार 2): ग्रुप अक्सर कोई भी सही उत्तर खोजने में विफल रहता है। शिक्षक कहता है, "इस बार कुछ भी काम नहीं आया," इसलिए छात्र अपनी आदतों में बहुत अधिक बदलाव नहीं करता। वे सुरक्षित और विविध बने रहते हैं, लेकिन वे बहुत अधिक सीखते भी नहीं हैं।
  • विशाल ग्रुप (आकार 128+): ग्रुप हर संभव सही उत्तर ढूँढ लेता है, जिसमें दुर्लभ उत्तर भी शामिल हैं। शिक्षक कहता है, "देखो, तुमने सामान्य वाला भी ढूँढा और दुर्लभ वाला भी!" छात्र सब कुछ सीख जाता है। लेकिन कंप्यूटर पर ऐसा करना बहुत महंगा है (इसमें बहुत पैसा और समय खर्च होता है)।
  • मध्यम ग्रुप (आकार 8-16): यह वह जाल है। ग्रुप सामान्य सही उत्तर तो ढूँढ लेता है (ताकि शिक्षक फीडबैक दे सके), लेकिन वह दुर्लभ सही उत्तर को छोड़ देता है। छात्र सोचता है, "केवल वही एक सामान्य उत्तर मायने रखता है," और वह दुर्लभ विकल्पों की तलाश करना बंद कर देता है।

उपमा:
कल्पना कीजिए कि आप सिक्कों के 1,000 जार में एक विशिष्ट दुर्लभ सिक्के की तलाश कर रहे हैं।

  • यदि आप 2 सिक्के निकालते हैं, तो शायद आपको दुर्लभ सिक्का नहीं मिलेगा। आप कुछ नहीं सीखते।
  • यदि आप 500 सिक्के निकालते हैं, तो आप निश्चित रूप से दुर्लभ सिक्का ढूँढ लेंगे। आप सब कुछ सीख जाते हैं।
  • यदि आप 10 सिक्के निकालते हैं, तो आप सामान्य सिक्के तो ढूँढ सकते हैं लेकिन दुर्लभ वाले को मिस कर सकते हैं। फिर आप निष्कर्ष निकालते हैं, "दुर्लभ सिक्का मौजूद ही नहीं है," और आप उसे ढूँढना बंद कर देते हैं।

समाधान: F-GRPO (एक "कठिनाई-जागरूक" कोच)

लेखकों ने एक सुधार प्रस्तावित किया है जिसे F-GRPO कहा जाता है। उन्होंने महसूस किया कि जब एक ग्रुप कई सही उत्तर ढूँढ लेता है, तो AI बहुत आत्मविश्वासी हो जाता है और दुर्लभ उत्तरों को अनदेखा करने लगता है।

इसलिए, उन्होंने Focal Loss नामक तकनीक से प्रेरित होकर एक "डिफिकल्टी वेट" (कठिनाई भार) जोड़ा।

यह कैसे काम करता है:

  • पुराना तरीका: यदि ग्रुप 8 में से 5 सही उत्तर ढूँढता है, तो शिक्षक एक बड़ा "हाई फाइव" देता है और AI को उन उत्तरों पर बहुत अधिक ध्यान केंद्रित करने के लिए कहता है।
  • नया तरीका (F-GRPO): शिक्षक ग्रुप को देखता है और कहता है, "वाह, तुमने 5 सही उत्तर ढूँढे! यह तुम्हारे लिए अभी आसान है। मैं इस फीडबैक की आवाज़ (volume) कम कर दूँगा।"
    • यदि ग्रुप में कम सही उत्तर मिलते हैं (यह एक कठिन संघर्ष था), तो शिक्षक आवाज़ बढ़ा देता है और कहता है, "यह कठिन था, इस पर ध्यान दें कि क्या काम आया!"
    • यदि ग्रुप में अधिक सही उत्तर मिलते हैं (यह आसान था), तो शिक्षक आवाज़ कम कर देता है ताकि AI स्पष्ट समाधानों के प्रति बहुत अधिक जुनूनी न हो जाए।

परिणाम:
"आसान" समूहों पर आवाज़ कम करके, AI को और अधिक अन्वेषण (exploring) करने के लिए मजबूर किया जाता है। वह केवल इसलिए दुर्लभ, कठिन समाधानों को खोजना बंद नहीं करता क्योंकि उसने एक आसान समाधान ढूँढ लिया है।

प्रयोगों ने क्या दिखाया

टीम ने गणित की समस्याओं और तर्क पहेलियों का उपयोग करके कई AI मॉडलों (जैसे Qwen और Llama) पर इसका परीक्षण किया।

  1. "रेयर" (दुर्लभ) टेस्ट: उन्होंने जाँच की कि क्या AI किसी भी सही उत्तर को ढूँढ सकता है यदि उन्हें 256 प्रयास (केवल 1 के बजाय) दिए जाएं।
    • सुधार के बिना: जैसे-जैसे AI आसान उत्तरों में बेहतर होता गया, उसकी दुर्लभ उत्तरों को खोजने की क्षमता गिरती गई।
    • F-GRPO के साथ: AI ने अपनी दुर्लभ उत्तरों को खोजने की क्षमता को उच्च बनाए रखा, जबकि वह आसान उत्तरों में भी बेहतर होता गया।
  2. "मेज़" (भूलभुलैया) टेस्ट: उन्होंने एक भूलभुलैया का उपयोग किया जहाँ केवल एक सही रास्ता है। यहाँ तक कि इस सरल मामले में भी, पुराने तरीके ने AI को उस रास्ते को भूलने पर मजबूर कर दिया यदि वह शुरुआत में भाग्यशाली रहा। F-GRPO ने AI को ट्रैक पर रखा।
  3. दक्षता (Efficiency): उन्होंने ग्रुप का आकार बढ़ाए बिना ये परिणाम प्राप्त किए। उन्हें AI को 100 उत्तर उत्पन्न करने के लिए कहने की आवश्यकता नहीं थी; उन्हें बस यह बदलने की आवश्यकता थी कि वे पहले से उत्पन्न 8 उत्तरों को कैसे सुनते हैं।

सारांश

पेपर कहता है: "अपने AI को स्पष्ट उत्तरों के साथ बहुत सहज न होने दें।"

जब एक AI प्रयासों के समूह से सीखता है, तो मध्यम आकार के समूह के मामले में वह दुर्लभ, कठिन समाधानों को भूलने लगता है। लेखकों ने इसे एक "वॉल्यूम नॉब" (F-GRPO) बनाकर ठीक किया जो आसान, उच्च-सफलता वाले समूहों के महत्व को कम कर देता है। यह AI को अन्वेषण जारी रखने के लिए मजबूर करता है और यह सुनिश्चित करता है कि वह कठिन, दुर्लभ समस्याओं को हल करने की अपनी क्षमता न खोए।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →