SALT: When More Rollouts Don't Help in Group-Based Policy Optimization and How to Make Them Matter
यह शोध पत्र SALT को पेश करता है, जो ग्रुप रिलेटिव पॉलिसी ऑप्टिमाइज़ेशन (GRPO) के लिए एक प्लग-इन घटक है जो एक साझा उप-स्थान (shared subspace) के भीतर हस्ताक्षरित ग्रेडिएंट रद्दीकरण (signed gradient cancellation) का मुकाबला करने के लिए अपडेट गुणांकों को अनुकूल रूप से पुन: भारित (reweight) करके बढ़ते रोलआउट द्वारा होने वाली प्रदर्शन गिरावट को कम करता है।
मूल पेपर CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/) के तहत सार्वजनिक डोमेन को समर्पित है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
यहाँ "SALT: जब अधिक रोलआउट्स मदद नहीं करते और उन्हें कैसे काम करने लायक बनाया जाए" नामक शोध पत्र का सरल, रोजमर्रा की भाषा और रचनात्मक उपमाओं के साथ अनुवाद दिया गया है।
बड़ी समस्या: AI प्रशिक्षण का "इको चैंबर" (Echo Chamber)
कल्पना कीजिए कि आप एक छात्र (एक AI मॉडल) को एक कठिन गणित की समस्या हल करना सिखाने की कोशिश कर रहे हैं। केवल एक बार पूछने के बजाय, आप उनसे एक ही समय में कई अलग-अलग समाधान (जिन्हें "रोलआउट्स" कहा जाता है) उत्पन्न करने के लिए कहते हैं। फिर आप इन समाधानों की तुलना करते हैं: यदि कोई समाधान सही है, तो आप उसे उच्च स्कोर देते हैं; यदि वह गलत है, तो कम स्कोर देते हैं।
वर्तमान AI प्रशिक्षण विधियों (जैसे GRPO) में, सिस्टम इन सभी समाधानों को एक समूह के रूप में देखता है। यह सभी समाधानों का "औसत" निकालता है और AI को बताता है: "तुम औसत से बेहतर थे, इसलिए ऐसा ही करते रहो," या "तुम औसत से खराब थे, इसलिए ऐसा करना बंद करो।"
शोध की खोज:
लेखकों ने इस प्रक्रिया में एक छिपे हुए दोष का पता लगाया। भले ही AI कई अलग-अलग दिखने वाले समाधान उत्पन्न करता है, लेकिन जिस तरह से वह उनसे सीखता है, वह अक्सर दोषपूर्ण होता है।
इसे एक गायक दल (choir) के गाने की तरह समझें।
- लक्ष्य: आप चाहते हैं कि गायक दल तालमेल में गाए, एक सुरीली और एकजुट आवाज़ पैदा करे जो दर्शकों को मंत्रमुग्ध कर दे (यह 'लर्निंग सिग्नल' है)।
- वास्तविकता: कई मामलों में, गायक दल के सदस्य वास्तव में एक ही सुर में गा रहे होते हैं, लेकिन विपरीत दिशाओं में—कुछ "सा-रे-गा" गा रहे होते हैं, जबकि अन्य "सा-रे-गा" ही गा रहे होते हैं लेकिन एक नकारात्मक चिह्न के साथ (जो एक-दूसरे को काट देते हैं)।
- परिणाम: जब कंडक्टर (AI का लर्निंग एल्गोरिदम) सभी आवाजों को जोड़ता है, तो सकारात्मक और नकारात्मक ध्वनियाँ एक-दूसरे को रद्द कर देती हैं। परिणाम सन्नाटा होता है। चाहे आप गायक दल में कितने भी गायक जोड़ दें, यदि वे केवल एक-दूसरे को काट रहे हैं, तो संगीत कभी तेज़ या बेहतर नहीं होगा।
शोध पत्र इसे "साइंड लो-रैंक रिडंडेंसी" (Signed Low-Rank Redundancy) कहता है। सरल शब्दों में: AI कई उत्तर उत्पन्न कर रहा है, लेकिन उन सभी में एक ही तरह का "शोर" (noise) है जो खुद को रद्द कर देता है, जिससे वास्तविक सीखने की प्रक्रिया बहुत कम हो जाती है।
समाधान: SALT (एक "स्मार्ट साउंड इंजीनियर")
लेखक एक नया टूल प्रस्तावित करते हैं जिसे SALT (Subspace-Adaptive geometry pLug-in componenT) कहा जाता है।
यदि AI प्रशिक्षण एक अराजक गायक दल है, तो SALT एक स्मार्ट साउंड इंजीनियर है जो अंतिम मिक्सिंग से पहले समूह को सुनता है।
- "साझा शोर" को सुनना: SALT उत्तरों के समूह का विश्लेषण करता है और उन हिस्सों की पहचान करता है जहाँ सभी एक ही चीज़ गा रहे हैं (जिसे "शेयर्ड सबस्पेस" कहा जाता है)। वर्तमान सिस्टम में, यह साझा शोर रद्द हो जाता है और बर्बाद हो जाता है।
- सिग्नल को अलग करना: SALT समूह को दो चैनलों में विभाजित करता है:
- कॉमन चैनल (The Common Channel): वह चीज़ जिस पर सभी सहमत हैं (जो आमतौर पर रद्द हो जाती है)।
- यूनिक चैनल (The Unique Channel): उत्तरों के बीच के दुर्लभ और अनूठे अंतर (यानी "रेसिड्यूअल" सिग्नल)।
- विशिष्टता की आवाज़ बढ़ाना: जब SALT देखता है कि समूह मुख्य रूप से एक-दूसरे को रद्द कर रहा है (एक "साइंड कैंसलेशन"), तो यह स्वचालित रूप से यूनिक चैनल की आवाज़ बढ़ा देता है। यह AI को बताता है: "उस उबाऊ, रद्द होने वाले शोर को अनदेखा करो। इन उत्तरों के बीच के अनूठे और विविध अंतरों पर पूरी तरह ध्यान केंद्रित करो।"
यह क्यों महत्वपूर्ण है?
1. अधिक होना हमेशा बेहतर नहीं होता।
SALT से पहले, यदि आप चाहते थे कि AI बेहतर सीखे, तो आप सोच सकते थे, "आइए इसे 10 के बजाय 100 उत्तर देने के लिए कहें।" शोध पत्र दिखाता है कि SALT के बिना, 100 उत्तर माँगने से अक्सर एक ही तरह के 'कैंसलेशन' की 100 कॉपियाँ ही मिलती हैं। आपको अधिक काम (कंप्यूट) मिलता है लेकिन बेहतर परिणाम नहीं।
2. SALT अतिरिक्त प्रयास को सार्थक बनाता है।
SALT के साथ, यदि आप इसे 100 उत्तर देने के लिए कहते हैं, तो सिस्टम वास्तव में उन 100 उत्तरों की विविधता का उपयोग सीखने के लिए करता है। यह "रद्द करने वाले" शोर को फ़िल्टर करता है और "विविध" संकेतों को बढ़ाता है।
3. यह नियमों को बदले बिना काम करता है।
SALT के लिए किसी नए शिक्षक (रिवॉर्ड मॉडल) या सवाल पूछने के नए तरीके की आवश्यकता नहीं है। यह एक "प्लग-इन" है जो मौजूदा प्रशिक्षण प्रक्रिया के भीतर बैठता है, गणित को ठीक करता है, और लर्निंग सिग्नल को मजबूत बनाता है।
परिणाम: एक स्पष्ट आवाज़
लेखकों ने कठिन गणित और तर्क संबंधी बेंचमार्क (जैसे जटिल गणितीय समस्याओं को हल करना या कोड लिखना) पर SALT का परीक्षण किया।
- प्रदर्शन: SALT का उपयोग करने वाले AI मॉडल मानक तरीकों का उपयोग करने वालों की तुलना में अधिक समस्याओं को सही ढंग से हल करते हैं।
- दक्षता: उन्होंने AI के आर्किटेक्चर को बदले बिना या भारी मात्रा में अतिरिक्त कंप्यूटिंग पावर का उपयोग किए बिना ये बेहतर परिणाम प्राप्त किए।
- "ज्यामिति" (Geometry) की जाँच: लेखकों ने लर्निंग सिग्नल्स के "आकार" को मापा। SALT के साथ, सिग्नल कम "सपाट" (redundant) और अधिक "फैले हुए" (diverse) थे, जिसका अर्थ था कि AI वास्तव में विशिष्ट और मूल्यवान अंतरों से सीख रहा था, न कि रद्द होने वाले शोर से।
सारांश उपमा
कल्पना कीजिए कि आप एक धुंधले जंगल में छिपे हुए खजाने को खोजने की कोशिश कर रहे हैं।
- पुरानी विधि (GRPO): आप 50 स्काउट्स (खोजकर्ता) भेजते हैं। वे सभी दिशाएँ चिल्लाते हैं। लेकिन क्योंकि वे सभी एक ही धुंध की ओर देख रहे हैं, वे परस्पर विरोधी दिशाएँ चिल्लाते हैं जो एक-दूसरे को रद्द कर देती हैं। आपको भ्रम का एक तेज़ शोर सुनाई देता है, लेकिन आपको पता नहीं चलता कि किस दिशा में जाना है।
- समस्या: 50 और स्काउट्स भेजने से केवल भ्रम का शोर और तेज़ हो जाएगा।
- SALT: SALT एक फिल्टर है जो उन 50 स्काउट्स को सुनता है। यह समझ जाता है, "अरे, आप में से 40 एक ही गलत चीज़ चिल्ला रहे हैं, और 10 कुछ अनूठा चिल्ला रहे हैं।" SALT उन 40 को शांत कर देता है और उन 10 अनूठी आवाजों को तेज़ कर देता है। अचानक, खजाने का रास्ता साफ हो जाता है।
मुख्य बात: SALT यह सिखाता है कि AI को उस शोर को सुनना कैसे छोड़ना है जो खुद को रद्द कर देता है और उन अनूठे संकेतों पर ध्यान कैसे देना है जो वास्तव में उसे सीखने में मदद करते हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।