AAPO: Enhancing the Reasoning Capabilities of LLMs with Advantage Margin
यह शोध पत्र एडवांटेज-ऑगमेंटेड पॉलिसी ऑप्टिमाइज़ेशन (AAPO) को प्रस्तुत करता है, जो एक नवीन सुदृढीकरण शिक्षण (रिनफोर्समेंट लर्निंग) एल्गोरिदम है जो मार्जिन-आधारित अनुमान योजना और क्रॉस-एन्ट्रॉपी लॉस ऑप्टिमाइज़ेशन के माध्यम से ग्रुप रिलेटिव एडवांटेज एस्टीमेशन में प्रशिक्षण अक्षमताओं को संबोधित करके लार्ज लैंग्वेज मॉडल्स की तर्क क्षमताओं को बढ़ाता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
यहाँ सरल भाषा और रचनात्मक उपमाओं (analogies) का उपयोग करके शोध पत्र "AAPO: Enhancing the Reasoning Capabilities of LLMs with Advantage Margin" की व्याख्या दी गई है।
बड़ी तस्वीर: एक रोबोट को सोचना सिखाना
कल्पना कीजिए कि आप एक बहुत ही स्मार्ट रोबोट (एक लार्ज लैंग्वेज मॉडल या LLM) को जटिल गणित की समस्याएं हल करना सिखाने की कोशिश कर रहे हैं। आप उसे केवल उत्तर नहीं बता सकते; आपको उसे यह सिखाना होगा कि समस्या के बारे में कैसे कदम-दर-कदम सोचना है।
अतीत में, शोधकर्ताओं ने रीइन्फोर्समेंट लर्निंग (RL) नामक एक विधि का उपयोग किया था। इसे एक कुत्ते को प्रशिक्षित करने जैसा समझें:
- कुत्ता एक करतब दिखाने की कोशिश करता है।
- यदि वह अच्छा करता है, तो उसे एक इनाम (ट्रीट) मिलता है।
- यदि वह खराब प्रदर्शन करता है, तो उसे कोई इनाम नहीं मिलता।
- कुत्ता उन कार्यों को दोहराना सीख जाता है जिनसे उसे इनाम मिलते हैं।
समस्या: "ग्रुप हग" (Group Hug) का जाल
हाल ही में, एक लोकप्रिय विधि जिसे GRPO कहा जाता है, इन AI मॉडलों को प्रशिक्षित करने के लिए मानक बन गई है। यह इस प्रकार काम करती है:
- आप AI को एक गणित की समस्या को 10 बार हल करने के लिए कहते हैं (10 उत्तरों का एक समूह बनाना)।
- आप उन सभी 10 उत्तरों को देखते हैं।
- यदि 9 उत्तर खराब हैं और 1 बहुत अच्छा है, तो उस बेहतरीन वाले को एक बड़ा "इनाम" (ट्रीट) मिलता है, और खराब वालों को "डांट" मिलती है। AI जल्दी सीख जाता है।
लेकिन यहाँ एक गड़बड़ है:
क्या होगा अगर सभी 10 उत्तर वास्तव में बहुत अच्छे हों? या क्या होगा अगर सभी 10 उत्तर बहुत खराब हों?
- "सब अच्छे हैं" वाली स्थिति: यदि AI पहले से ही स्मार्ट है, तो सभी 10 उत्तर सही हो सकते हैं। चूंकि वे सभी समान हैं, AI यह नहीं बता सकता कि कौन सा "बेहतर" है। "इनाम" शून्य हो जाता है क्योंकि तुलना करने के लिए कोई अंतर नहीं है। AI सीखना बंद कर देता है क्योंकि वह सोचता है, "खैर, मैं ठीक कर रहा हूँ, बदलने की कोई आवश्यकता नहीं है।"
- "सब बुरे हैं" वाली स्थिति: यदि समस्या बहुत कठिन है, तो सभी 10 उत्तर गलत हो सकते हैं। फिर से, वे सभी समान रूप से गलत हैं। AI को सुधार करने के बारे में कोई फीडबैक नहीं मिलता।
शोध पत्र इसे "जीरो एडवांटेज" (Zero Advantage) समस्या कहता है। यह एक कोच की तरह है जो अपनी टीम से कहता है, "आप सबने एक जैसा खेला," जबकि वास्तव में उन्हें बेहतर होने के लिए विशिष्ट सलाह की आवश्यकता होती है। इससे प्रशिक्षण रुक जाता है।
समाधान: AAPO (द "रेफरेंस पॉइंट" कोच)
लेखक एक नई विधि प्रस्तावित करते हैं जिसे AAPO (एडवांटेज-ऑगमेंटेड पॉलिसी ऑप्टिमाइज़ेशन) कहा जाता है।
केवल AI के उत्तरों की एक-दूसरे से तुलना करने के बजाय (GRPO विधि की तरह), AAPO एक रेफरेंस मॉडल (Reference Model) जोड़ता है। इसे एक "बेसलाइन कोच" या "मानक छात्र" के रूप में समझें।
यहाँ नई उपमा है:
- पुराना तरीका (GRPO): आप एक कक्षा में 10 छात्रों की आपस में तुलना करते हैं। यदि सभी को 'A' ग्रेड मिलता है, तो कोई भी अलग नहीं दिखता। कोई भी कुछ नया नहीं सीख पाता।
- नया तरीका (AAPO): आप 10 छात्रों की तुलना न केवल एक-दूसरे से करते हैं, बल्कि एक रेफरेंस स्टूडेंट (जो AI का पिछला, थोड़ा कम स्मार्ट संस्करण है) से भी करते हैं।
यह कैसे काम करता है:
- AI 10 उत्तर उत्पन्न करता है।
- "रेफरेंस स्टूडेंट" (AI का एक स्थिर, पुराना संस्करण) भी 10 उत्तर उत्पन्न करता है।
- सिस्टम पूछता है: "क्या AI के उत्तर 'रेफरेंस स्टूडेंट' के उत्तरों से बेहतर हैं?"
- जादू: भले ही AI के सभी 10 उत्तर एकदम सही हों (और एक-दूसरे के समान हों), वे अभी भी "रेफरेंस स्टूडेंट" के उत्तरों से बेहतर हैं।
- क्योंकि वे बेसलाइन से बेहतर हैं, AI को "इनाम" (एक सकारात्मक संकेत) मिलता है ताकि वह सुधार करना जारी रखे, भले ही वह अपने स्वयं के उत्तरों के बीच अंतर न बता सके।
यह "एडवांटेज मार्जिन" यह सुनिश्चित करता है कि AI कभी भी फीडबैक मिलना बंद न करे। यह AI को अपने वर्तमान साथियों से बेहतर होने के बजाय अपने पिछले स्वरूप से बेहतर बनने के लिए प्रेरित करता रहता है।
यह क्यों महत्वपूर्ण है
- कोई रुकावट नहीं: AI उस लूप में नहीं फंसता जहाँ वह सोचता है, "मैं हो गया, मैं परफेक्ट हूँ।" यह सीखता रहता है क्योंकि यह हमेशा अपने स्वयं के बेसलाइन को पछाड़ने की कोशिश करता है।
- बेहतर गणित कौशल: शोधकर्ताओं ने कठिन गणित बेंचमार्क (जैसे AIME और MATH डेटासेट) पर इसका परीक्षण किया। AAPO-प्रशिक्षित मॉडलों ने पुराने तरीकों से प्रशिक्षित मॉडलों की तुलना में काफी अधिक समस्याओं को सही ढंग से हल किया।
- दक्षता (Efficiency): इसके लिए उत्तरों का न्याय करने के लिए किसी विशाल, अलग कंप्यूटर प्रोग्राम (एक "वैल्यू मॉडल") की आवश्यकता नहीं है, जिससे पैसे और कंप्यूटिंग शक्ति की बचत होती है।
कमी (सीमाएं)
शोध पत्र दो छोटी कमियों को स्वीकार करता है:
- इसमें थोड़ा अधिक समय लगता है: चूंकि AI को "रेफरेंस स्टूडेंट" से भी उत्तर उत्पन्न करने होते हैं, इसलिए इसमें प्रत्येक प्रशिक्षण चरण में थोड़ा अधिक समय लगता है। हालांकि, लेखक कहते हैं कि बेहतर परिणामों के लिए यह एक छोटा सा मूल्य है।
- यह सब कुछ ठीक नहीं करता: हालांकि यह "जीरो फीडबैक" की समस्या को हल करता है, लेकिन यह जादू से AI को तुरंत पूर्ण नहीं बना देता। यह केवल प्रशिक्षण प्रक्रिया को बहुत अधिक सुचारू और प्रभावी बनाता है।
सारांश
कल्प Imagine कीजिए कि आप एक दौड़ दौड़ रहे हैं।
- पुराना तरीका: आप अपने बगल में दौड़ रहे अपने दोस्तों को ही देखते हैं। यदि सभी आपकी ही गति से दौड़ रहे हैं, तो आपको पता नहीं चलता कि आप तेज़ हो रहे हैं या नहीं।
- AAPO तरीका: आप पिछले सप्ताह का अपना एक वीडियो भी देखते हैं। भले ही आपके दोस्त भी आपके साथ उसी गति से दौड़ रहे हों, फिर भी आप जानते हैं कि आप पहले की तुलना में तेज़ हैं। यह आपको अपनी सीमाओं को आगे बढ़ाने के लिए प्रेरित करता है।
AAPO केवल AI को एक "हाई-फाइव" देने का एक स्मार्ट तरीका है ताकि वह सीखना जारी रखे, भले ही वह पहले से ही बहुत अच्छा काम कर रहा हो।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।