← नवीनतम पेपर
💻 computer science

SALT: When More Rollouts Don't Help in Group-Based Policy Optimization and How to Make Them Matter

यह शोध पत्र SALT को पेश करता है, जो ग्रुप रिलेटिव पॉलिसी ऑप्टिमाइज़ेशन (GRPO) के लिए एक प्लग-इन घटक है जो एक साझा उप-स्थान (shared subspace) के भीतर हस्ताक्षरित ग्रेडिएंट रद्दीकरण (signed gradient cancellation) का मुकाबला करने के लिए अपडेट गुणांकों को अनुकूल रूप से पुन: भारित (reweight) करके बढ़ते रोलआउट द्वारा होने वाली प्रदर्शन गिरावट को कम करता है।

मूल लेखक: Powei Chang, Jinpeng Zhang, Chaoqun Sun, MiniWell Tsao, Lianrui Li, Jianxiang Xiang, Chenyu Wang, Yukang Gao, Dongying Kong

प्रकाशित 2026-06-05
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Powei Chang, Jinpeng Zhang, Chaoqun Sun, MiniWell Tsao, Lianrui Li, Jianxiang Xiang, Chenyu Wang, Yukang Gao, Dongying Kong

मूल पेपर CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/) के तहत सार्वजनिक डोमेन को समर्पित है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ "SALT: जब अधिक रोलआउट्स मदद नहीं करते और उन्हें कैसे काम करने लायक बनाया जाए" नामक शोध पत्र का सरल, रोजमर्रा की भाषा और रचनात्मक उपमाओं के साथ अनुवाद दिया गया है।

बड़ी समस्या: AI प्रशिक्षण का "इको चैंबर" (Echo Chamber)

कल्पना कीजिए कि आप एक छात्र (एक AI मॉडल) को एक कठिन गणित की समस्या हल करना सिखाने की कोशिश कर रहे हैं। केवल एक बार पूछने के बजाय, आप उनसे एक ही समय में कई अलग-अलग समाधान (जिन्हें "रोलआउट्स" कहा जाता है) उत्पन्न करने के लिए कहते हैं। फिर आप इन समाधानों की तुलना करते हैं: यदि कोई समाधान सही है, तो आप उसे उच्च स्कोर देते हैं; यदि वह गलत है, तो कम स्कोर देते हैं।

वर्तमान AI प्रशिक्षण विधियों (जैसे GRPO) में, सिस्टम इन सभी समाधानों को एक समूह के रूप में देखता है। यह सभी समाधानों का "औसत" निकालता है और AI को बताता है: "तुम औसत से बेहतर थे, इसलिए ऐसा ही करते रहो," या "तुम औसत से खराब थे, इसलिए ऐसा करना बंद करो।"

शोध की खोज:
लेखकों ने इस प्रक्रिया में एक छिपे हुए दोष का पता लगाया। भले ही AI कई अलग-अलग दिखने वाले समाधान उत्पन्न करता है, लेकिन जिस तरह से वह उनसे सीखता है, वह अक्सर दोषपूर्ण होता है।

इसे एक गायक दल (choir) के गाने की तरह समझें।

  • लक्ष्य: आप चाहते हैं कि गायक दल तालमेल में गाए, एक सुरीली और एकजुट आवाज़ पैदा करे जो दर्शकों को मंत्रमुग्ध कर दे (यह 'लर्निंग सिग्नल' है)।
  • वास्तविकता: कई मामलों में, गायक दल के सदस्य वास्तव में एक ही सुर में गा रहे होते हैं, लेकिन विपरीत दिशाओं में—कुछ "सा-रे-गा" गा रहे होते हैं, जबकि अन्य "सा-रे-गा" ही गा रहे होते हैं लेकिन एक नकारात्मक चिह्न के साथ (जो एक-दूसरे को काट देते हैं)।
  • परिणाम: जब कंडक्टर (AI का लर्निंग एल्गोरिदम) सभी आवाजों को जोड़ता है, तो सकारात्मक और नकारात्मक ध्वनियाँ एक-दूसरे को रद्द कर देती हैं। परिणाम सन्नाटा होता है। चाहे आप गायक दल में कितने भी गायक जोड़ दें, यदि वे केवल एक-दूसरे को काट रहे हैं, तो संगीत कभी तेज़ या बेहतर नहीं होगा।

शोध पत्र इसे "साइंड लो-रैंक रिडंडेंसी" (Signed Low-Rank Redundancy) कहता है। सरल शब्दों में: AI कई उत्तर उत्पन्न कर रहा है, लेकिन उन सभी में एक ही तरह का "शोर" (noise) है जो खुद को रद्द कर देता है, जिससे वास्तविक सीखने की प्रक्रिया बहुत कम हो जाती है।

समाधान: SALT (एक "स्मार्ट साउंड इंजीनियर")

लेखक एक नया टूल प्रस्तावित करते हैं जिसे SALT (Subspace-Adaptive geometry pLug-in componenT) कहा जाता है।

यदि AI प्रशिक्षण एक अराजक गायक दल है, तो SALT एक स्मार्ट साउंड इंजीनियर है जो अंतिम मिक्सिंग से पहले समूह को सुनता है।

  1. "साझा शोर" को सुनना: SALT उत्तरों के समूह का विश्लेषण करता है और उन हिस्सों की पहचान करता है जहाँ सभी एक ही चीज़ गा रहे हैं (जिसे "शेयर्ड सबस्पेस" कहा जाता है)। वर्तमान सिस्टम में, यह साझा शोर रद्द हो जाता है और बर्बाद हो जाता है।
  2. सिग्नल को अलग करना: SALT समूह को दो चैनलों में विभाजित करता है:
    • कॉमन चैनल (The Common Channel): वह चीज़ जिस पर सभी सहमत हैं (जो आमतौर पर रद्द हो जाती है)।
    • यूनिक चैनल (The Unique Channel): उत्तरों के बीच के दुर्लभ और अनूठे अंतर (यानी "रेसिड्यूअल" सिग्नल)।
  3. विशिष्टता की आवाज़ बढ़ाना: जब SALT देखता है कि समूह मुख्य रूप से एक-दूसरे को रद्द कर रहा है (एक "साइंड कैंसलेशन"), तो यह स्वचालित रूप से यूनिक चैनल की आवाज़ बढ़ा देता है। यह AI को बताता है: "उस उबाऊ, रद्द होने वाले शोर को अनदेखा करो। इन उत्तरों के बीच के अनूठे और विविध अंतरों पर पूरी तरह ध्यान केंद्रित करो।"

यह क्यों महत्वपूर्ण है?

1. अधिक होना हमेशा बेहतर नहीं होता।
SALT से पहले, यदि आप चाहते थे कि AI बेहतर सीखे, तो आप सोच सकते थे, "आइए इसे 10 के बजाय 100 उत्तर देने के लिए कहें।" शोध पत्र दिखाता है कि SALT के बिना, 100 उत्तर माँगने से अक्सर एक ही तरह के 'कैंसलेशन' की 100 कॉपियाँ ही मिलती हैं। आपको अधिक काम (कंप्यूट) मिलता है लेकिन बेहतर परिणाम नहीं।

2. SALT अतिरिक्त प्रयास को सार्थक बनाता है।
SALT के साथ, यदि आप इसे 100 उत्तर देने के लिए कहते हैं, तो सिस्टम वास्तव में उन 100 उत्तरों की विविधता का उपयोग सीखने के लिए करता है। यह "रद्द करने वाले" शोर को फ़िल्टर करता है और "विविध" संकेतों को बढ़ाता है।

3. यह नियमों को बदले बिना काम करता है।
SALT के लिए किसी नए शिक्षक (रिवॉर्ड मॉडल) या सवाल पूछने के नए तरीके की आवश्यकता नहीं है। यह एक "प्लग-इन" है जो मौजूदा प्रशिक्षण प्रक्रिया के भीतर बैठता है, गणित को ठीक करता है, और लर्निंग सिग्नल को मजबूत बनाता है।

परिणाम: एक स्पष्ट आवाज़

लेखकों ने कठिन गणित और तर्क संबंधी बेंचमार्क (जैसे जटिल गणितीय समस्याओं को हल करना या कोड लिखना) पर SALT का परीक्षण किया।

  • प्रदर्शन: SALT का उपयोग करने वाले AI मॉडल मानक तरीकों का उपयोग करने वालों की तुलना में अधिक समस्याओं को सही ढंग से हल करते हैं।
  • दक्षता: उन्होंने AI के आर्किटेक्चर को बदले बिना या भारी मात्रा में अतिरिक्त कंप्यूटिंग पावर का उपयोग किए बिना ये बेहतर परिणाम प्राप्त किए।
  • "ज्यामिति" (Geometry) की जाँच: लेखकों ने लर्निंग सिग्नल्स के "आकार" को मापा। SALT के साथ, सिग्नल कम "सपाट" (redundant) और अधिक "फैले हुए" (diverse) थे, जिसका अर्थ था कि AI वास्तव में विशिष्ट और मूल्यवान अंतरों से सीख रहा था, न कि रद्द होने वाले शोर से।

सारांश उपमा

कल्पना कीजिए कि आप एक धुंधले जंगल में छिपे हुए खजाने को खोजने की कोशिश कर रहे हैं।

  • पुरानी विधि (GRPO): आप 50 स्काउट्स (खोजकर्ता) भेजते हैं। वे सभी दिशाएँ चिल्लाते हैं। लेकिन क्योंकि वे सभी एक ही धुंध की ओर देख रहे हैं, वे परस्पर विरोधी दिशाएँ चिल्लाते हैं जो एक-दूसरे को रद्द कर देती हैं। आपको भ्रम का एक तेज़ शोर सुनाई देता है, लेकिन आपको पता नहीं चलता कि किस दिशा में जाना है।
  • समस्या: 50 और स्काउट्स भेजने से केवल भ्रम का शोर और तेज़ हो जाएगा।
  • SALT: SALT एक फिल्टर है जो उन 50 स्काउट्स को सुनता है। यह समझ जाता है, "अरे, आप में से 40 एक ही गलत चीज़ चिल्ला रहे हैं, और 10 कुछ अनूठा चिल्ला रहे हैं।" SALT उन 40 को शांत कर देता है और उन 10 अनूठी आवाजों को तेज़ कर देता है। अचानक, खजाने का रास्ता साफ हो जाता है।

मुख्य बात: SALT यह सिखाता है कि AI को उस शोर को सुनना कैसे छोड़ना है जो खुद को रद्द कर देता है और उन अनूठे संकेतों पर ध्यान कैसे देना है जो वास्तव में उसे सीखने में मदद करते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →