Balanced Aggregation: Understanding and Fixing Aggregation Bias in GRPO
यह शोध पत्र 'बैलेंस्ड एग्रीगेशन' (Balanced Aggregation) का प्रस्ताव देकर सत्यापन योग्य पुरस्कारों (verifiable rewards) वाले GRPO-शैली के सुदृढीकरण लर्निंग (reinforcement learning) में एकत्रीकरण पूर्वाग्रह (aggregation bias) की पहचान और समाधान करता है, जो सकारात्मक और नकारात्मक प्रतिक्रियाओं के लिए टोकन-स्तरीय ग्रेडिएंट्स को पुनर्संयोजित करने से पहले अलग-अलग औसत निकालता है, जिससे रीजनिंग और कोडिंग बेंचमार्क में प्रशिक्षण स्थिरता और प्रदर्शन में सुधार होता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
मुख्य चित्र: AI को पहेलियाँ सुलझाना सिखाना
कल्पना कीजिए कि आप एक रोबोट को गणित की समस्याएं हल करने या कोड लिखने के लिए प्रशिक्षित कर रहे हैं। आप उसे एक प्रॉम्प्ट देते हैं, और वह एक उत्तर देने का प्रयास करता है। इसे सिखाने के लिए, आप Verifiable Rewards के साथ Reinforcement Learning (RLVR) नामक विधि का उपयोग करते हैं।
इसे एक गेम शो की तरह समझें। रोबोट (AI) एक ही प्रश्न के लिए कई अलग-अलग उत्तर (responses) उत्पन्न करता है। एक रेफरी (एक सरल कंप्यूटर प्रोग्राम) उनकी जाँच करता है:
- यदि उत्तर सही है, तो रोबोट को "थम्स अप" (सकारात्मक इनाम) मिलता है।
- यदि यह गलत है, तो उसे "थम्स डाउन" (नकारात्मक इनाम) मिलता है।
लक्ष्य यह है कि रोबोट को अधिक "थम्स अप" वाले उत्तर और कम "थम्स डाउन" वाले उत्तर उत्पन्न करना सिखाना। यह पेपर एक विशिष्ट प्रशिक्षण विधि पर केंद्रित है जिसे GRPO कहा जाता है, जो लोकप्रिय है क्योंकि यह सरल है और अच्छा काम करती है।
समस्या: वोटों की गिनती कैसे करें
मुख्य मुद्दा जिसे यह पेपर संबोधित करता है, वह एक सूक्ष्म लेकिन महत्वपूर्ण प्रश्न है: जब रोबोट उत्तरों का एक समूह बनाता है, तो हमें सीखने के लिए "औसत सबक" की गणना कैसे करनी चाहिए?
रोबोट एक बार में 16 उत्तर उत्पन्न कर सकता है। कुछ छोटे (5 शब्द) होते हैं, और कुछ लंबे (500 शब्द)। कुछ सही होते हैं, और कुछ गलत। प्रशिक्षण एल्गोरिदम को रोबोट के मस्तिष्क को बेहतर बनाने के लिए इन सभी व्यक्तिगत शब्दों को एक बड़े "अपडेट" में संयोजित करने की आवश्यकता होती है।
लोग दो मुख्य तरीकों से ऐसा कर रहे थे, और यह पेपर तर्क देता है कि दोनों में एक छिपा हुआ दोष है:
1. "शब्द-गणना" विधि (Token Aggregation)
- यह कैसे काम करती है: आप प्रत्येक उत्तर से प्रत्येक शब्द (टोकन) को गिनते हैं और उन सभी का औसत निकालते हैं।
- दोष (The "Long-Winded Villain" - बातूनी खलनायक): कल्पना कीजिए कि छात्रों का एक समूह एक परीक्षा दे रहा है।
- छात्र A उत्तर सही देता है लेकिन बहुत संक्षिप्त स्पष्टीकरण (10 शब्द) लिखता है।
- छात्र B उत्तर गलत देता है लेकिन एक विशाल, भ्रामक निबंध (500 शब्द) लिखता है।
- यदि आप केवल शब्दों को गिनते हैं, तो छात्र B के गलत उत्तर का औसत में छात्र A के सही उत्तर की तुलना में 50 गुना अधिक "वजन" होगा।
- परिणाम: AI भ्रमित हो जाता है। उसे लगता है कि लंबे, गलत उत्तर अधिक महत्वपूर्ण हैं क्योंकि वे अधिक जगह घेरते हैं। इसे "Sign-Length Coupling" कहा जाता है। उत्तर की लंबाई गलती से सबक के संकेत (सकारात्मक या नकारात्मक) को बदल देती है।
2. "प्रति-व्यक्ति" विधि (Sequence Aggregation)
- यह कैसे काम करती है: आप पहले प्रत्येक उत्तर के लिए व्यक्तिगत रूप से औसत सबक की गणना करते हैं, और फिर उन उत्तरों का औसत निकालते हैं।
- दोष (The "Lazy Voter" - आलसी मतदाता): उसी छात्र के उदाहरण का उपयोग करते हुए:
- छात्र A (छोटा, सही) को 1 वोट मिलता है।
- छात्र B (लंबा, गलत) को 1 वोट मिलता है।
- परिणाम: यह "बातूनी खलनायक" की समस्या को ठीक करता है। लेकिन अब, यह 10-शब्द के उत्तर को 500-शब्द के उत्तर के समान ही मानता है। यदि AI एक लंबे, विस्तृत स्पष्टीकरण से बहुत कुछ सीखता है, तो यह विधि उस अतिरिक्त प्रयास को अनदेखा कर देती है। यह लंबे उत्तरों को "डाउनवेट" (कम महत्व देना) करती है, उन्हें ऐसे मानती है जैसे कि वे छोटे उत्तरों जितने ही सरल हों।
समाधान: "Balanced Aggregation" (BA)
लेखक एक नई विधि प्रस्तावित करते हैं जिसे Balanced Aggregation (BA) कहा जाता है। यह एक स्मार्ट रेफरी की तरह है जो पिछले दोनों तरीकों के दोषों को ठीक करता है।
यह कैसे काम करता है:
- उत्तरों को छाँटना: पहले, रेफरी उत्तरों को दो ढेरों में अलग करता है: "अच्छा" ढेर (थम्स अप) और "बुरा" ढेर (थम्स डाउन)।
- ढेरों के अंदर शब्दों को गिनना: "अच्छे" ढेर के अंदर, वे सभी शब्दों को गिनते हैं और उनका औसत निकालते हैं। "बुरे" ढेर के अंदर, वे सभी शब्दों को गिनते हैं और उनका औसत निकालते हैं।
- ढेरों को संतुलित करना: अंत में, वे दोनों ढेशनों को मिलाते हैं। लेकिन यहाँ एक ट्रिक है: वे उन्हें बेतरतीब ढंग से नहीं मिलाते हैं। वे यह सुनिश्चित करते हैं कि अंतिम निर्णय पर "अच्छे" ढेर और "बुरे" ढेर का समान प्रभाव हो, चाहे प्रत्येक ढेर में कितने भी शब्द क्यों न हों।
उपमा (Analogy):
कल्पना कीजिए कि एक नगर परिषद एक नए पार्क पर मतदान कर रही है।
- पुरानी विधि 1 (शब्द गणना): जो लोग सबसे लंबे समय तक बोलते हैं, उन्हें सबसे अधिक वोट मिलते हैं, भले ही वे गलत हों।
- पुरानी विधि 2 (प्रति-व्यक्ति): प्रत्येक व्यक्ति को एक वोट मिलता है, भले ही एक व्यक्ति ने 50 पन्नों की रिपोर्ट लिखी हो और दूसरे ने बस "हाँ" कहा हो।
- Balanced Aggregation: परिषद "पक्ष में" और "विपक्ष में" समूहों में विभाजित होती है। वे प्रत्येक समूह के भीतर के तर्कों का औसत निकालते हैं। फिर, वे अंतिम निर्णय के लिए "पक्ष" समूह और "विपक्ष" समूह को समान महत्व देते हैं, यह सुनिश्चित करते हुए कि तर्कों की लंबाई परिणाम को प्रभावित न करे।
उन्होंने क्या पाया?
शोधकर्ताओं ने दो अलग-अलग AI मॉडल (Qwen2.5-Math-7B और Qwen3-1.7B) पर गणित और कोडिंग डेटासेट का उपयोग करके इस नई विधि का परीक्षण किया।
- स्थिरता महत्वपूर्ण है: पुराने तरीके अक्सर शुरुआत में अच्छा काम करते थे लेकिन प्रशिक्षण के दौरान बाद में क्रैश या अस्थिर हो जाते थे। "शब्द-गणना" विधि विशेष रूप से अस्थिर थी जब AI बहुत लंबे, गलत उत्तर लिखना शुरू करता था।
- बेहतर परिणाम: Balanced Aggregation विधि लगातार बेहतर अंतिम स्कोर प्रदान करती है। यह अधिक स्थिर थी, जिसका अर्थ है कि AI बिना किसी उतार-चढ़ाव के निरंतर सीखता रहा।
- यह क्यों मायने रखता है: यह पेपर दिखाता है कि AI को प्रशिक्षित करने का "सर्वश्रेष्ठ" तरीका इस बात पर निर्भर करता है कि उत्तरों की लंबाई कितनी भिन्न होती है।
- यदि उत्तरों की लंबाई बहुत अधिक भिन्न होती है, तो "शब्द-गणना" विधि जोखिम भरी हो सकती है।
- यदि "अच्छे" और "बुरे" उत्तरों की लंबाई का अंतर बहुत बड़ा है, तो "प्रति-व्यक्ति" विधि अनुचित हो सकती है।
- Balanced Aggregation दोनों स्थितियों में अच्छी तरह से काम करता है क्योंकि यह प्रत्येक विधि के विशिष्ट पूर्वाग्रह (bias) को ठीक करता है।
निष्कर्ष (The Takeaway)
पेपर यह निष्कर्ष निकालता है कि AI प्रशिक्षण में आप "सामग्री को कैसे मिलाते हैं" (डेटा को एग्रीगेट करना) यह केवल एक छोटा तकनीकी विवरण नहीं है; यह एक प्रमुख डिज़ाइन विकल्प है जो यह निर्धारित करता है कि AI प्रभावी ढंग से सीखेगा या भ्रमित होगा। "अच्छे" और "बुरे" उदाहरणों को औसत निकालने से पहले अलग करके, लेखकों ने एक ऐसी विधि बनाई जो अधिक मजबूत, स्थिर और प्रभावी है जिससे AI को तर्क करने और कोड करने के लिए सिखाया जा सके।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।