ASymPO: Asymmetric-Scale Policy Optimization for Asynchronous LLM Post-Training Without Behavior Information
यह शोध पत्र एसिमेट्रिक-स्केल पॉलिसी ऑप्टिमाइज़ेशन (ASymPO) का प्रस्ताव करता है, जो एक ऐसी विधि है जो स्टेल रिस्पॉन्स के कारण होने वाले स्केल असंतुलन को ठीक करने के लिए वर्तमान-पॉलिसी प्रोबेबिलिटीज के साथ टोकन लॉस को नॉर्मलाइज़ करके एसिंक्रोनस एलएलएम पोस्ट-ट्रेनिंग को स्थिर करती है, जिससे बिहेवियर-पॉलिसी जानकारी की आवश्यकता समाप्त हो जाती है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को गणित की समस्याएं हल करना सिखाने की कोशिश कर रहे हैं। आपके पास काम करने वालों की एक टीम (रोलआउट टीम) है जो उत्तर उत्पन्न करती है, और एक शिक्षक (लर्नर) है जो रोबोट के मस्तिष्क को उन उत्तरों के आधार पर अपडेट करता है।
एक आदर्श दुनिया में, कार्यकर्ता और शिक्षक एक पूर्ण तालमेल में काम करेंगे। लेकिन वास्तविक दुनिया में, इसे तेज़ बनाने के लिए, वे अतुल्यकालिक (asynchronously) रूप से काम करते हैं। कार्यकर्ता रोबोट के मस्तिष्क के एक पुराने संस्करण के आधार पर उत्तर उत्पन्न करना जारी रखते हैं, जबकि शिक्षक पहले से ही एक नए, अधिक स्मार्ट संस्करण का उपयोग करके सीख रहा होता है।
समस्या: "पुराने" (Stale) उत्तर का जाल
यह शोध पत्र एक विशिष्ट समस्या की पहचान करता है जो तब होती है जब शिक्षक इन "पुराने" (stale) उत्तरों से सीखने की कोशिश करता है।
इसे इस तरह सोचें:
- अच्छे उत्तर: रोबोट एक गणित की समस्या सही हल करता है। शिक्षक कहता है, "बहुत बढ़िया! ऐसा ही करते रहो!"
- बुरे उत्तर: रोबोट एक समस्या गलत हल करता है। शिक्षक कहता है, "ऐसा मत करो!"
एक मानक, पूरी तरह से सिंक्रनाइज़ सिस्टम में, "बहुत बढ़िया!" और "ऐसा मत करो!" के संकेत एक-दूसरे को पूरी तरह से संतुलित करते हैं।
हालाँकि, इस अतुल्यकालिक (asynchronous) सेटअप में, "ऐसा मत करो!" के संकेत खतरनाक रूप से तेज़ हो जाते हैं। क्योंकि बुरा उत्तर उत्पन्न होने के बाद से रोबोट का मस्तिष्क बदल चुका है, शिक्षक उस पुराने बुरे उत्तर को देखता है और सोचता है, "वाह, रोबोट अब इसमें बहुत बुरा है! हमें इस उत्तर को बहुत कड़ाई से दंडित करने की आवश्यकता है!"
इस बीच, "बहुत बढ़िया!" वाले उत्तरों को उतनी कड़ी सजा नहीं मिलती। परिणाम यह होता है कि शिक्षक नकारात्मक फीडबैक से अभिभूत हो जाता है। वह "बुरे" उत्तरों को ठीक करने की कोशिश में इतना आक्रामक हो जाता है कि वह "अच्छे" उत्तरों को सुदृढ़ करना भूल जाता है। पूरी सीखने की प्रक्रिया क्रैश हो जाती है, और रोबोट सीखना पूरी तरह से बंद कर देता है। शोध पत्र इसे "स्केल-इम्बैलेंस फेलियर" (scale-imbalance failure) कहता है।
पुराना समाधान: भारी बैकपैक
आमतौर पर, इसे ठीक करने के लिए, सिस्टम अतिरिक्त जानकारी का एक "बैकपैक" ले जाने की कोशिश करते हैं। वे उन सटीक संभावनाओं (probabilities) को सहेजते हैं जो पुराने रोबोट ने तब सोची थीं जब उसने उत्तर उत्पन्न किया था। यह शिक्षक को यह गणना करने की अनुमति देता है कि रोबोट कितना बदला है और दंड को निष्पक्ष रूप से समायोजित करने की अनुमति देता है।
लेकिन यह भारी और धीमा है। इसके लिए कार्यकर्ताओं और शिक्षक के बीच भारी मात्रा में डेटा भेजने और यह ट्रैक रखने की आवश्यकता होती है कि किस संस्करण ने क्या किया। यह वैसा ही है जैसे किसी को पत्र पहुँचाने के लिए कार्यकर्ताओं से 50 पाउंड का बैकपैक ले जाने के लिए कहना।
नया समाधान: ASymPO
लेखक ASymPO (Asymmetric-Scale Policy Optimization) नामक एक नई विधि प्रस्तावित करते हैं। वे पूछते हैं: क्या हम भारी बैकपैक ले जाए बिना इस क्रैश को ठीक कर सकते हैं?
उपमा: वॉल्यूम नॉब (Volume Knob)
कल्पना कीजिए कि शिक्षक एक गायक दल (choir) को सुन रहा है।
- अच्छे उत्तर वे गायक हैं जो सामान्य आवाज़ में गा रहे हैं।
- बुरे उत्तर वे गायक हैं जो, समय की देरी के कारण, अब कान फाड़ देने वाली आवाज़ में चिल्ला रहे हैं।
पुराना तरीका (बैकपैक) यह रिकॉर्ड करने की कोशिश करता है कि गायक मूल रूप से कितने तेज़ थे ताकि अंतर की गणना की जा सके।
ASymPO कुछ सरल करता है। यह बुरे गायकों के वर्तमान वॉल्यूम को देखता है और कहता है, "ठीक है, आप अभी बहुत ज़ोर से चिल्ला रहे हैं। चलिए आपका वॉल्यूम कम करके अच्छे गायकों के बराबर कर देते हैं।"
इसे यह जानने की आवश्यकता नहीं है कि कल गायक कैसे सुनाई दे रहे थे। यह केवल वर्तमान स्थिति को देखता है और वॉल्यूम को सामान्य (normalize) करता है।
- यदि कोई बुरा उत्तर वर्तमान में "चिल्ला" (नए मस्तिष्क के तहत बहुत कम संभावना वाला) रहा है, तो ASymPO उसके वॉल्यूम को कम कर देता है ताकि वह पाठ पर हावी न हो।
- यदि कोई अच्छा उत्तर सामान्य रूप से गा रहा है, तो यह उसका वॉल्यूम बनाए रखता है।
यह एक आदर्श संतुलन बनाता है। शिक्षक "चिल्लाने" वाले बुरे उत्तरों से अभिभूत हुए बिना अच्छे और बुरे दोनों उत्तरों से सीख सकता है, और उसे भारी, पुराने डेटा का बोझ उठाने की आवश्यकता नहीं है।
एक सरल संबंधी: SPO
शोध पत्र एक सरल संस्करण भी पेश करता है जिसे SPO (Scaled Policy Optimization) कहा जाता है। यह एक निश्चित नियम की तरह है: "हमेशा बुरे उत्तरों के वॉल्यूम को 80% कम कर दें।" यह अच्छा काम करता है और स्थिर है, लेकिन यह थोड़ा कठोर है। ASymPO अधिक स्मार्ट है क्योंकि यह स्वचालित रूप से वॉल्यूम नॉब को इस आधार पर समायोजित करता है कि प्रत्येक विशिष्ट उत्तर कितना ज़ोर से चिल्ला रहा है।
परिणाम
लेखकों ने विभिन्न AI मॉडल के साथ गणितीय तर्क कार्यों पर इसका परीक्षण किया।
- ASymPO/SPO के बिना: प्रशिक्षण क्रैश हो गया। रोबोट भ्रमित हो गया और उसने सीखना बंद कर दिया।
- ASymPO/SPO के साथ: प्रशिक्षण स्थिर रहा। रोबोट प्रभावी ढंग से सीखता रहा।
- प्रदर्शन: नए तरीकों ने पुराने, भारी "बैकपैक" तरीकों के समान ही प्रदर्शन किया, लेकिन वे बहुत सरल थे क्योंकि उन्हें सारा अतिरिक्त डेटा स्थानांतरित करने की आवश्यकता नहीं थी।
सारांश
यह शोध पत्र उस क्रैश को हल करता है जो तब होता है जब AI बहुत तेज़ी से (अतुल्यकालिक रूप से) सीखता है। यह क्रैश इसलिए होता है क्योंकि पुराने "बुरे" उत्तर बहुत ज़ोर से चिल्ला रहे होते हैं। समाधान (ASymPO) एक चतुर तरीका है जिससे उन तेज़ आवाज़ वाले बुरे उत्तरों के वॉल्यूम को स्वचालित रूप से कम किया जाता है, जिससे AI बिना किसी भारी, पुराने डेटा के सुचारू रूप से सीख पाता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।