← नवीनतम पेपर
🤖 machine learning

ReCo: Reweighting GRPO Against Distributional Concentration

यह शोध पत्र ReCo को प्रस्तुत करता है, जो एक रीवेटिंग (reweighting) विधि है जो प्रतिक्रिया योगदानों को सामान्य बनाकर और महत्व अनुपातों (importance ratios) को विचरण-आधारित स्केलिंग (variance-based scaling) से बदलकर GRPO की उच्च-संभाव्यता वाली प्रतिक्रियाओं और टोकन पर ध्यान केंद्रित करने की प्रवृत्ति को कम करती है, जिससे छोटे-k सटीकता से समझौता किए बिना गणितीय तर्क बेंचमार्क पर Pass@k प्रदर्शन में सुधार होता है।

मूल लेखक: Junoh Park, Junseo Hwang, Wonguk Cho, Taesup Kim

प्रकाशित 2026-07-30
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Junoh Park, Junseo Hwang, Wonguk Cho, Taesup Kim

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

एक ऐसी दुनिया की कल्पना करें जहाँ कंप्यूटर केवल चैट नहीं करते, बल्कि गणित की समस्याओं या कोडिंग चुनौतियों जैसे जटिल पहेलियों के माध्यम से वास्तव में सोचते हैं। यह आर्टिफिशियल इंटेलिजेंस का अग्रिम क्षेत्र है, विशेष रूप से 'रीइन्फोर्समेंट लर्निंग' (Reinforcement Learning) नामक एक क्षेत्र। इसे एक कुत्ते को प्रशिक्षित करने जैसा समझें: आप केवल कुत्ते को यह नहीं बताते कि उसे क्या करना है; आप उसे कोशिश करने देते हैं, और यदि वह बैठ जाता है, तो आप उसे एक इनाम (ट्रीट) देते हैं। यदि वह सोफे पर कूद जाता है, तो आप नहीं देते। समय के साथ, कुत्ता बैठना सीख जाता है क्योंकि वह इनाम चाहता है। AI की दुनिया में, जब कंप्यूटर किसी समस्या को सही ढंग से हल करता है, तो हम उसे एक "रिवॉर्ड" (इनाम) देते हैं।

इन AI "कुत्तों" को प्रशिक्षित करने का एक लोकप्रिय तरीका है जिसे 'ग्रुप रिलेटिव पॉलिसी ऑप्टिमाइज़ेशन' (Group Relative Policy Optimization) या GRPO कहा जाता है। कल्पना करें कि आपने AI को दस बार एक गणित की समस्या हल करने के लिए कहा। यह दस अलग-अलग उत्तर उत्पन्न करता है। GRPO उन दसों को देखता है, देखता है कि किनमें से कितनों को "ट्रीट" मिला (जो सही थे), और AI को उन तरीकों की तरह बनने के लिए प्रेरित करता है जो सफल रहे। यह एक चतुर तरकीब है जिसने AI को तर्क करने में बहुत बेहतर बना दिया है। लेकिन इसमें एक पेंच है: कभी-कभी, इनाम पाने की उत्सुकता में, AI बहुत अधिक आत्मविश्वासी हो जाता है और नई चीजें आज़माना बंद कर देता है। यह बार-बार एक ही तरह के कुछ चुनिंदा तरीकों को दोहराने लगता है, और उन अन्य चतुर तरीकों को अनदेखा कर देता है जो उतने ही अच्छे से काम कर सकते थे।

यही वह पहेली है जिसे सियोल नेशनल यूनिवर्सिटी के शोधकर्ताओं की एक टीम ने सुलझाने का निर्णय लिया। उन्होंने देखा कि जबकि GRPO AI को समस्याओं को तेज़ी से हल करने में स्मार्ट बनाता है, यह वास्तव में AI को कम रचनात्मक बनाता है और यदि आप उसे कई मौके देते हैं, तो सही उत्तर खोजने की संभावना कम कर देता है। उन्होंने इस समस्या को "डिस्ट्रीब्यूशनल कंसंट्रेशन" (distributional concentration) कहा—यह कहने का एक भारी-भरकम तरीका है कि AI एक ढर्रे में फंस गया है, और केवल उन्हीं रास्तों को तलाश रहा है जिन्हें वह पहले से सुरक्षित जानता है।

इसे ठीक करने के लिए, टीम ने एक नई विधि बनाई जिसे ReCo (Reweighting GRPO Against Distributional Concentration) कहा जाता है। यह कैसे काम करता है, इसके लिए एक सरल उपमा का उपयोग करते हैं:

कल्पना कीजिए कि आप छात्रों की एक कक्षा को ग्रेड दे रहे हैं जो सभी एक ही कठिन गणित की समस्या को हल करने की कोशिश कर रहे हैं।

  • पुराना तरीका (GRPO): आप कक्षा से उत्तर लिखने के लिए कहते हैं। यदि पाँच छात्र बिल्कुल एक ही समाधान लिखते हैं (क्योंकि वह सबसे लोकप्रिय समाधान है), तो आप उस समाधान को बहुत अधिक ध्यान देते हैं। आप पूरी कक्षा को बताते हैं, "देखो! पाँच लोगों ने यह किया! सभी को यही करना चाहिए!" इस बीच, वह एक छात्र जिसने एक अजीब, रचनात्मक तरीका आज़माया जो काम भी कर गया, उसे अनदेखा कर दिया जाता है क्योंकि वह अकेला था। कक्षा नई चीजें आज़माना बंद कर देती है और बस लोकप्रिय उत्तर की नकल करने लगती है।
  • नया तरीका (ReCo): शिक्षक (ReCo) इस पूर्वाग्रह को पहचान लेता है। पहले, वे महसूस करते हैं कि यदि पाँच छात्रों ने एक ही उत्तर लिखा है, तो ऐसा इसलिए है क्योंकि वह उत्तर ढूंढना आसान था, न कि इसलिए कि वह एकमात्र अच्छा उत्तर है। इसलिए, वे उस लोकप्रिय उत्तर के महत्व को कम (downgrade) कर देते हैं। वे कहते हैं, "ठीक है, आप में से पाँच ने यह किया, लेकिन चूंकि यह इतना सामान्य था, इसलिए यह एक अद्वितीय समाधान जितना महत्वपूर्ण नहीं है।" यह कक्षा को अंधाधुंध भीड़ की नकल करने से रोकता है।
  • दूसरी तरकीब: शिक्षक यह भी देखता है कि छात्र कैसे सोच रहे हैं। यदि कोई छात्र अपने गणित के एक विशिष्ट चरण के बारे में 99% आश्वस्त है, तो शिक्षक कहता है, "बहुत अच्छे, तुम आश्वस्त हो, लेकिन बहुत ज़्यादा आत्मविश्वासी मत बनो! अभी भी एक छोटी सी संभावना है कि तुम गलत हो सकते हो, इसलिए चलो अपने दिमाग को अन्य संभावनाओं के लिए खुला रखते हैं।" लेकिन यदि कोई छात्र एक ऐसे मोड़ पर फंसा हुआ है जहाँ वह अनिश्चित है कि कौन सा रास्ता चुनना है, तो शिक्षक उसे अन्वेषण करने के लिए प्रोत्साहन का एक बड़ा बढ़ावा (boost) देता है। यह छात्रों को बहुत जल्दी एक एकल, कठोर तरीके में बंध जाने से रोकता है।

इन दो तरकीबों का उपयोग करके, ReCo AI के सीखने के तरीके को बदल देता है। यह AI को केवल "सुरक्षित" उत्तर याद करने से रोकता है और उसे विभिन्न रास्तों को तलाशने के लिए मजबूर करता है।

शोधकर्ताओं ने इस नई विधि का परीक्षण कुछ बहुत कठिन गणित प्रतियोगिताओं पर किया, जैसे कि AIME (अमेरिकन इनविटेशनल मैथमेटिक्स एग्जामिनेशन) और ओलंपियाड की समस्याएं। उन्होंने Qwen और Llama पर आधारित सहित विभिन्न AI मॉडल का उपयोग किया। परिणाम उत्साहजनक थे। जब उन्होंने AI को केवल कुछ ही बार प्रयास करने के लिए कहा, तो ReCo पुराने तरीके के समान ही प्रदर्शन करता था। लेकिन जब उन्होंने AI को कई मौके दिए (जैसे कि 64 अलग-अलग उत्तर उत्पन्न करने और उनमें से सर्वश्रेष्ठ चुनने के लिए कहना), तो ReCo चमक उठा। इसने वे सही उत्तर खोज निकाले जिन्हें पुराना तरीका पूरी तरह से छोड़ देता।

वास्तव में, कुछ सबसे कठिन परीक्षणों में, पुराने तरीके (GRPO) ने कई प्रयासों के साथ मूल, अप्रशिक्षित AI की तुलना में वास्तव में खराब प्रदर्शन किया, क्योंकि वह बहुत संकीर्ण सोच वाला हो गया था। हालाँकि, ReCo ने AI के "मन" को खुला रखा। इसने विविध समाधान खोजने की क्षमता को संरक्षित किया, यह सुनिश्चित किया कि यदि पहले कुछ प्रयास विफल भी हो जाएं, तो भी AI के पास विभिन्न रणनीतियों का एक पूरा टूलबॉक्स मौजूद हो।

टीम ने यह भी देखा कि ऐसा क्यों हुआ। उन्होंने देखा कि पुराने तरीके के तहत, AI की "विचार प्रक्रिया" बहुत दोहराव वाली हो गई थी, जैसे एक टूटा हुआ रिकॉर्ड एक ही गाना बजा रहा हो। ReCo के तहत, AI ने एक ही समस्या को हल करते समय भी अद्वितीय, विविध दृष्टिकोण बनाए रखे। यह एक ऐसे छात्र को देखने जैसा था जो, केवल पाठ्यपुस्तक की नकल करने के बजाय, अवधारणा को समझने के लिए चित्र बनाना, विभिन्न सूत्रों का उपयोग करना और यहाँ तक कि भौतिक मॉडल बनाना शुरू कर देता है।

संक्षेप में, ReCo सुझाव देता है कि AI को वास्तव में स्मार्ट बनाने के लिए, हमें केवल उसे जल्दी सही उत्तर पाने के लिए पुरस्कृत नहीं करना चाहिए। हमें उसे एक ढर्रे में न फंसने के लिए भी पुरस्कृत करने की आवश्यकता है। AI को विविधता और अनिश्चितता को महत्व देने के लिए धीरे से प्रेरित करके, शोधकर्ताओं ने पाया कि वे उसके डिजिटल मस्तिष्क को जिज्ञासु, रचनात्मक और समस्याओं को उन तरीकों से हल करने में सक्षम बनाए रख सकते हैं जिनकी हम उम्मीद नहीं कर सकते थे। यह हमें याद दिलाता है कि कभी-कभी, सीखने का सबसे अच्छा तरीका अपने विकल्पों को खुला रखना होता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →