← नवीनतम पेपर
🤖 machine learning

Early Verdicts, Better Budgets: Sequential Adaptive Rollout Allocation for Compute-Efficient RLVR

यह शोध पत्र SARA को प्रस्तुत करता है, जो एक अनुक्रमिक अनुकूली रोलआउट आवंटन विधि (sequential adaptive rollout allocation method) है जो प्रारंभिक प्रभावशीलता संकेतों के आधार पर प्रॉम्प्ट सैंपलिंग को जारी रखने या छोड़ने का गतिशील रूप से निर्णय लेकर, वेरिफिएबल रिवॉर्ड्स के साथ सुदृढीकरण लर्निंग (RLVR) में कंप्यूट दक्षता को अनुकूलित करता है, जिससे मॉडल के प्रदर्शन को बनाए रखते हुए या उसमें सुधार करते हुए व्यर्थ रोलआउट्स को काफी कम किया जा सकता है।

मूल लेखक: Pixel Nomand, Elena Voss, Marcus Hale, Sofia Reyes

प्रकाशित 2026-07-30
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Pixel Nomand, Elena Voss, Marcus Hale, Sofia Reyes

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट शेफ को प्रशिक्षित करने के लिए एक विशाल कुकिंग प्रतियोगिता चला रहे हैं। लक्ष्य रोबोट को जटिल पहेलियाँ हल करना सिखाना है, जैसे गणित की समस्याएँ या किसी यात्रा की योजना बनाना, यह करके कि वह हज़ारों रेसिपी आज़माए और प्रत्येक प्रयास के लिए उसे एक सरल "हाँ, यह काम कर गया!" या "नहीं, यह विफल रहा!" मिले। इस प्रक्रिया को 'वेरिफिएबल रिवार्ड्स के साथ रिइन्फोर्समेंट लर्निंग' (Reinforcement Learning with Verifiable Rewards) कहा जाता है। पेच यह है कि रोबोट धीमा है और इसे चलाना महंगा है। हर बार जब वह एक रेसिपी आज़माता है, तो वह बहुत अधिक कंप्यूटर शक्ति (जिसे "रोलआउट्स" कहा जाता है) का उपयोग करता है।

यहाँ समस्या यह है कि रोबोट अक्सर एक लूप में फंस जाता है। कभी-कभी, वह एक बहुत ही आसान रेसिपी आज़माता है और हर बार इसे सही कर लेता है। दूसरी ओर, कभी-कभी वह एक बहुत कठिन रेसिपी आज़माता है और हर बार इसमें विफल हो जाता है। दोनों ही मामलों में, परिणाम उबाऊ रूप से अनुमानित होता है। यदि एक बैच में प्रत्येक प्रयास एक सफलता है, या प्रत्येक प्रयास एक विफलता है, तो रोबोट कुछ भी नया नहीं सीख पाता क्योंकि विश्लेषण करने के लिए कोई आश्चर्य (सरप्राइज) नहीं बचता। यह एक ऐसे शिक्षक की तरह है जो उस टेस्ट को ग्रेड कर रहा है जहाँ हर छात्र ने 100% या 0% प्राप्त किया है; शिक्षक यह नहीं बता सकता कि किसे मदद की ज़रूरत है या कौन अगले स्तर के लिए तैयार है। इसे ठीक करने का वर्तमान तरीका यह है कि पर्याप्त "मिश्रित" बैच (कुछ सही, कुछ गलत) मिलने तक खाना बनाना जारी रखें, लेकिन यह उबाऊ और अनुमानित वाले बैचों पर बहुत अधिक ऊर्जा बर्बाद करता है।

यह शोध पत्र एक चतुर नई रणनीति पेश करता है जिसे SARA (सीक्वेंशियल एडेप्टिव रोलआउट एलोकेशन) कहा जाता है ताकि इस ऊर्जा को बर्बाद होने से रोका जा सके। अंधे होकर रेसिपी के पूरे बैच बनाने और बेहतर परिणाम की उम्मीद करने के बजाय, SARA एक स्मार्ट 'सू-शेफ' (sous-chef) की तरह कार्य करता है जो केवल कुछ निवालों के बाद ही व्यंजन का स्वाद चख लेता है। यदि शेफ को जल्दी ही एहसास हो जाता है कि एक रेसिपी पूरी तरह से आपदा होने वाली है (सभी गलत) या एक गारंटीकृत जीत (सभी सही) होने वाली है, तो SARA उस रेसिपी को तुरंत बनाना बंद कर देता है। वह उस विशिष्ट व्यंजन के लिए बाकी सामग्री को फेंक देता है और बची हुई ऊर्जा का उपयोग एक बिल्कुल नई, अज्ञात रेसिपी बनाना शुरू करने के लिए करता है।

लेखकों ने गणित और प्लानिंग समस्याओं का उपयोग करते हुए एक सिंगल ग्राफिक्स कार्ड पर छोटे AI मॉडल पर इसका परीक्षण किया। उन्होंने पाया कि SARA अविश्वसनीय रूप से कुशल है। इसने पुराने, बर्बादी वाले तरीकों की तुलना में रोबोट को समान रूप से अच्छी तरह से प्रशिक्षित किया, लेकिन 22% कम कुकिंग प्रयासों (रोलआउट्स) का उपयोग किया। इससे भी बेहतर बात यह है कि जब उन्होंने SARA को एक ऐसी विधि के साथ जोड़ा जो अनुमान लगा सकती है कि कौन सी रेसिपी दिलचस्प हो सकती है, तो परिणाम अब तक की सर्वश्रेष्ठ सटीकता वाला रहा, जिसमें मानक "सब कुछ आज़माने" वाले दृष्टिकोण की तुलना में 67% कम प्रयास लगे। यह शोध पत्र गणितीय रूप से सिद्ध करता है कि यह 'अर्ली स्टॉपिंग' (early stopping) विश्वसनीय है और यह गलती से सीखने के अच्छे अवसरों को नहीं फेंकता है। संक्षेप में, SARA रोबोट को सिखाता है कि वह कब जीत हासिल हो रही हो (या हार हो रही हो) तो रुक जाए और अपनी ऊर्जा केवल उन पहेलियों पर खर्च करे जो वास्तव में उसे और स्मार्ट बनाती हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →