← नवीनतम पेपर
🤖 machine learning

Advantage Collapse in Group Relative Policy Optimization: Diagnosis and Mitigation

यह शोध पत्र 'एडवांटेज कोलैप्स' (Advantage Collapse) को ग्रुप रिलेटिव पॉलिसी ऑप्टिमाइजेशन (GRPO) में एक महत्वपूर्ण विफलता मोड के रूप में पहचानता है जो प्रशिक्षण ठहराव का कारण बनता है, और एडेप्टिव वर्चुअल सैंपल पॉलिसी ऑप्टिमाइजेशन (AVSPO) का प्रस्ताव करता है, जो एक हल्का तरीका है जो इस समस्या को कम करने के लिए वर्चुअल रिवॉर्ड सैंपल्स का उपयोग करता है और विभिन्न मॉडल स्केल्स में रीजनिंग प्रदर्शन को महत्वपूर्ण रूप से सुधारता है।

मूल लेखक: Xixiang He, Qiyao Sun, Ao Cheng, Xingming Li, Xuanyu Ji, Hailun Lu, Runke Huang, Qingyong Hu

प्रकाशित 2026-05-21
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Xixiang He, Qiyao Sun, Ao Cheng, Xingming Li, Xuanyu Ji, Hailun Lu, Runke Huang, Qingyong Hu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

एक बड़ी तस्वीर: रोबोट को गणित सिखाना

कल्पना कीजिए कि आप एक रोबोट (एक AI मॉडल) को कठिन गणित के सवाल हल करना सिखाने की कोशिश कर रहे हैं। आपके पास कोई इंसान शिक्षक नहीं है जो उसके कंधे पर हाथ रखकर खड़ा हो; इसके बजाय, आप एक सख्त "उत्तर कुंजी" (एक वेरीफायर) का उपयोग करते हैं। यदि रोबोट सही उत्तर देता है, तो उसे एक गोल्ड स्टार मिलता है (इनाम = 1)। यदि वह गलत उत्तर देता है, तो उसे कोई स्टार नहीं मिलता (इनाम = 0)।

यह पेपर एक विशिष्ट शिक्षण पद्धति पर केंद्रित है जिसे GRPO (ग्रुप रिलेटिव पॉलिसी ऑप्टिमाइज़ेशन) कहा जाता है। रोबोट को एक बार में एक समस्या सिखाने के बजाय, GRPO उसे एक ही समस्या के 8 अलग-अलग प्रयास करने के लिए देता है। फिर यह इन 8 प्रयासों की आपस में तुलना करता है ताकि यह पता लगाया जा सके कि कौन से प्रयास "बेहतर" थे और जिन्हें दोहराया जाना चाहिए।

समस्या: "मौन ठहराव" (एडवांटेज कोलैप्स)

यह पेपर इस शिक्षण पद्धति में एक छिपे हुए जाल की पहचान करता है जिसे एडवांटेज कोलैप्स (Advantage Collapse) कहा जाता है।

उपमा: क्लास फोटो
कल्पना कीजिए कि आप 8 छात्रों की एक कक्षा को गणित के टेस्ट पर ग्रेड दे रहे हैं।

  • परिदृश्य A (अच्छा): 4 छात्रों को 'A' मिलता है, और 4 को 'F' मिलता है। आप आसानी से बता सकते हैं कि उच्च उपलब्धि हासिल करने वालों को क्या जारी रखना चाहिए और कम उपलब्धि हासिल करने वालों को अपनी रणनीति क्यों बदलनी चाहिए। "ग्रेडिएंट" (सीखने का संकेत) मजबूत है।
  • परिदृश्य B (कोलैप्स/पतन):
    • केस 1: सभी 8 छात्रों को 'A' मिलता है।
    • केस 2: सभी 8 छात्रों को 'F' मिलता है।

दोनों ही मामलों में, कक्षा समरूप (homogeneous) है। सभी ने बिल्कुल एक जैसा किया।

  • यदि सभी को 'A' मिला, तो शिक्षक सोचता है, "खैर, उन सबने एक जैसा ही किया, इसलिए सीखने के लिए कोई नहीं है।"
  • यदि सभी को 'F' मिला, तो शिक्षक सोचता है, "वे सभी एक ही तरह से असफल हुए, इसलिए सीखने के लिए कोई नहीं है।"

AI की दुनिया में, जब 8 के 8 प्रयास एक ही इनाम प्राप्त करते हैं (सभी सही या सभी गलत), तो सीखने के एल्गोरिदम के पीछे का गणित टूट जाता है। "सीखने का संकेत" शून्य हो जाता है। AI सीखना बंद कर देता है, भले ही वह अभी भी चल रहा हो और बिजली खर्च कर रहा हो। पेपर इसे एडवांटेज कोलैप्स कहता है। यह एक ऐसी कार के इंजन की तरह है जो जोर से गूँज रहा है लेकिन पहिए नहीं घूम रहे हैं।

निदान: "ACR" मीटर

लेखकों ने महसूस किया कि मानक मेट्रिक्स (जैसे अंतिम स्कोर देखना) बहुत धीमे हैं। जब तक आप स्कोर गिरते हुए देखते हैं, तब तक AI प्रशिक्षण का घंटों का समय इस "मौन ठहराव" में बर्बाद कर चुका होता है।

उन्होंने एक नया टूल बनाया जिसे ACR (एडवांटेज कोलैप्स रेट) कहा जाता है।

  • उपमा: ACR को आपकी कार के डैशबोर्ड पर एक "ठहराव अलार्म" की तरह समझें।
  • यह देखने के बजाय कि क्या आप अपने गंतव्य तक पहुँच गए हैं, ACR अभी चेक करता है: "मेरे वर्तमान प्रयासों में से कितने बिल्कुल एक जैसे हैं?"
  • यदि ACR अधिक है, तो इसका मतलब है कि AI एक जैसे जवाबों (या तो सभी सही या सभी गलत) के लूप में फंस गया है और सीख नहीं रहा है।
  • निष्कर्ष: उन्होंने पाया कि यदि आप प्रशिक्षण के शुरुआती चरण में इस अलार्म की जांच करते हैं, तो यह 62% सटीकता के साथ भविष्यवाणी कर सकता है कि AI अंततः विफल होगा या सफल होगा। यह प्रशिक्षण दक्षता के लिए एक क्रिस्टल बॉल की तरह है।

समाधान: AVSPO (द "वर्चुअल सैंपल" ट्रिक)

एक बार जब उन्हें पता चल गया कि AI कहाँ फंसा हुआ है, तो उन्हें बिना नए उत्तर जेनरेट किए (जो महंगा और धीमा है) इसे फिर से गतिमान करने के तरीके की आवश्यकता थी।

उन्होंने एक पद्धति प्रस्तावित की जिसे AVSPO (एडेप्टिव वर्चुअल सैंपल पॉलिसी ऑप्टिमाइज़ेशन) कहा जाता है।

उपमा: नकली दर्शक
कल्पना कीजिए कि AI मंच पर एक कॉमेedian (हास्य कलाकार) है।

  • समस्या: दर्शक (8 प्रयास) या तो हर चीज़ पर हंस रहे हैं (सभी सही) या हर चीज़ पर हूटिंग कर रहे हैं (सभी गलत)। कॉमेडियन को नहीं पता कि क्या बदलना है क्योंकि प्रतिक्रिया एक समान है।
  • AVSPO समाधान: कॉमेडियन को फिर से कोशिश करने के लिए कहने के बजाय (जिसमें समय लगता है), ट्रेनर गुप्त रूप से कुछ वर्चुअल (आभासी) दर्शक पेश करता है।
    • यदि वास्तविक दर्शक हर चीज़ पर हंस रहे हैं, तो वर्चुअल सदस्य कुछ चुटकुलों पर हूटिंग करते हैं।
    • यदि वास्तविक दर्शक हर चीज़ पर हूटिंग कर रहे हैं, तो वर्चुअल सदस्य कुछ चुटकुलों पर हंसते हैं।
  • परिणाम: अब, "कमरे" में मिश्रित प्रतिक्रियाएं फिर से आ जाती हैं। कॉमेडियन देख सकता है, "ओह, इस चुटकुले पर हंसी आई, लेकिन उस पर हूटिंग हुई।" सीखने का संकेत बहाल हो जाता है!

महत्वपूर्ण बात यह है कि ये "वर्चुअल सैंपल" केवल गणित में इंजेक्ट किए गए नंबर हैं; AI को वास्तव में नया टेक्स्ट जेनरेट करने की आवश्यकता नहीं होती है। यह डेडलॉक (गतिरोध) को तोड़ने का एक सस्ता और तेज़ तरीका है।

परिणाम

इस पेपर ने गणित की समस्याओं पर 0.5 बिलियन पैरामीटर्स से लेकर 14 बिलियन पैरामीटर्स तक के AI मॉडल का परीक्षण किया।

  1. कम ठहराव: AVSO ने AI द्वारा "मौन ठहराव" में बिताए गए समय को लगभग 60% कम कर दिया।
  2. स्मार्टर AI: चूंकि AI ने फँसने के बजाय सीखने में अधिक समय बिताया, इसलिए गणित के टेस्ट पर इसकी सटीकता पूरे क्षेत्र में 4-6 प्रतिशत अंक बढ़ गई।
  3. कोई अतिरिक्त लागत नहीं: चूंकि उन्हें नए उत्तर जेनरेट करने की आवश्यकता नहीं थी, इसलिए यह विधि मूल पद्धति जितनी ही तेज़ और सस्ती थी, बस अधिक स्मार्ट थी।

सारांश

पेपर ने पाया कि जब AI को गणित हल करना सिखाया जाता है, तो वह अक्सर एक ऐसे लूप में फंस जाता है जहाँ उसके सभी अनुमान एक जैसे होते हैं, जिससे वह सीखना बंद कर देता है। उन्होंने इसे तुरंत पहचानने के लिए एक मीटर (ACR) बनाया और एक समाधान (AVSPO) बनाया जो मिश्रण में "नकली" विविधता डालता है ताकि AI सीखते रहना जारी रखे, जिसके परिणामस्वरूप बिना किसी अतिरिक्त कंप्यूटिंग लागत के काफी स्मार्ट रोबोट प्राप्त हुआ।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →