← नवीनतम पेपर
🤖 machine learning

ReBRAC-v2: The Return of the King

ReBRAC-v2 यह प्रदर्शित करता है कि एक पारंपरिक व्यवहार-नियमित (behavior-regularized) एक्टर-क्रिटिक को विशिष्ट इंजीनियरिंग विकल्पों—जैसे कि नॉर्मलाइजिंग फ्लो एक्टर्स, मिश्रित व्यवहार नियमितीकरण और चरणबद्ध अनुकूलन—के साथ व्यवस्थित रूप से आधुनिक बनाकर, बिना किसी कार्य-विशिष्ट संरचनात्मक परिवर्तनों के, एक एकल, हस्तांतरणीय कॉन्फ़िगरेशन का उपयोग करके विविध ऑफलाइन सुदृढीकरण शिक्षण (reinforcement learning) बेंचमार्क पर अत्याधुनिक प्रदर्शन प्राप्त किया जा सकता है।

मूल लेखक: Denis Tarasov, Robert K. Katzschmann

प्रकाशित 2026-08-04
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Denis Tarasov, Robert K. Katzschmann

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

एक ऐसी दुनिया की कल्पना करें जहाँ रोबोट वास्तविक दुनिया में परीक्षण और त्रुटि (trial and error) के माध्यम से चलना, नाचना या फुटबॉल खेलना नहीं सीखते, बल्कि पिछले वीडियो के एक विशाल पुस्तकालय का अध्ययन करके सीखते हैं। यह ऑफलाइन रीइन्फोर्समेंट लर्निंग (Offline Reinforcement Learning) का क्षेत्र है। वास्तविक दुनिया में, चलना सीखने वाला एक रोबोट हजार बार गिर सकता है, जिससे उसके पैर टूट सकते हैं और घंटों बर्बाद हो सकते हैं। लेकिन इस डिजिटल पुस्तकालय में, रोबोट बिना एक भी बार गिरने के जोखिम के, "अच्छे" मूव्स के एक निश्चित डेटासेट से सीख सकता है। पकड़ क्या है? रोबोट थोड़ा किताबी कीड़ा है; वह कुछ भी ऐसा नया आज़माने से डरता है जो उसकी किताबों में नहीं है। यदि वह कोई ऐसा मूव अनुमान लगाता है जो लाइब्रेरी में नहीं था, तो उसे बहुत खराब स्कोर मिल सकता है क्योंकि उसके पास यह जांचने का कोई तरीका नहीं है कि वह अनुमान वास्तव में सुरक्षित है या नहीं।

वर्षों से, वैज्ञानिक ऐसे "सुपर-स्मार्ट" रोबोट बनाने की कोशिश कर रहे हैं जो इन किताबों को पढ़ सकें और फिर लाइब्रेरी में मौजूद मूव्स से भी बेहतर नए मूव्स का आविष्कार कर सकें। इसे करने के लिए, कई शोधकर्ताओं ने अविश्वसनीय रूप से जटिल मशीनें बनाई हैं—सोचिए उन्हें कन्वेयर बेल्ट, डिस्टिलेशन वाट्स (distillation vats) और सहायक पॉलिसी वर्कशॉप्स वाली विशाल, बहु-स्तरीय फैक्ट्रियों के रूप में। ये मशीनें हजारों संभावनाओं को उत्पन्न करके और उन्हें जटिल मूल्य प्रणालियों के माध्यम से फ़िल्टर करके सबसे अच्छे मूव का अनुमान लगाने की कोशिश करती हैं। लेकिन बड़ा सवाल अभी भी बना हुआ है: क्या हमें बेहतरीन परिणाम प्राप्त करने के लिए वास्तव में इतनी बड़ी, जटिल फैक्ट्री की आवश्यकता है? या क्या एक सरल, अधिक अनुशासित वर्कशॉप, जिसे आधुनिक उपकरणों के साथ अपडेट किया गया हो, वही काम समान रूप से कर सकती है?

यहाँ ReBRAC-v2 आता है, जो एक साहसिक प्रश्न पूछता है: "क्या होगा यदि हम बड़ी फैक्ट्रियां बनाना बंद कर दें और बस अपने मौजूदा वर्कशॉप के औजारों को ठीक कर दें?" शोधकर्ताओं, डेनिस टारसोव और रॉबर्ट के. काट्ज़शमैन (ETH ज्यूरिख से), ने एक पारंपरिक, सीधा तरीका जिसे "बिहेवियर-रेगुलराइज्ड एक्टर-क्रिटिक" कहा जाता है, उसे एक गंभीर, व्यवस्थित अपग्रेड देने का निर्णय लिया। एक नया, जटिल एल्गोरिदम आविष्कार करने के बजाय, उन्होंने पुराने को आधुनिक बनाया। उन्होंने रोबोट के "मस्तिष्क" (एक्टर) को एक शक्तिशाली गणितीय उपकरण से बदल दिया जिसे नॉर्मलाइजिंग फ्लो (normalizing flow) कहा जाता है, जो एक सुपर-स्मार्ट मानचित्र की तरह है जो तुरंत सटीक मूव्स उत्पन्न कर सकता है और यह भी जान सकता है कि उनके कितने अच्छे होने की संभावना है। उन्होंने एक "रेसिडुअल क्रिटिक" (एक जज जो मूव्स को स्कोर देता है) भी जोड़ा जो अधिक सटीक होने के लिए एक चतुर वर्गीकरण (classification) ट्रिक का उपयोग करता है, और उन्होंने एक "स्टेज्ड ट्रेनिंग" शेड्यूल पेश किया, जो एक छात्र को दौड़ने से पहले चलना सिखाने जैसा है।

इस "आधुनिकीकरण रेसिपी" के परिणाम आश्चर्यजनक हैं। दस अलग-अलग चुनौतीपूर्ण रोबोट कार्यों (भूलभुलैया से लेकर वस्तुओं के हेरफेर तक) पर परीक्षण करने पर, इस सुव्यवस्थित दृष्टिकोण ने न केवल मुकाबला किया, बल्कि दबदबा भी बनाया। नए तरीके, ReBRAC-v2 ने एक औसत स्कोर 74.8 प्राप्त किया, जिसने पिछला सर्वश्रेष्ठ कुल स्कोर 52.3 को ध्वस्त कर दिया। इसने दस में से आठ श्रेणियों में प्रथम स्थान प्राप्त किया। इससे भी अधिक प्रभावशाली बात यह है कि यह हर कार्य के लिए रोबोट को ट्यून करने का मामला नहीं था। टीम ने पाया कि एक "साझा रेसिपी" (सेटिंग्स का एक विशिष्ट सेट) जो लगभग हर चीज़ के लिए काम करती थी, जिसे विभिन्न वातावरणों के अनुकूल बनाने के लिए केवल दो छोटे समायोजन की आवश्यकता थी। उन्होंने इसी रेसिपी का परीक्षण अन्य प्रसिद्ध रोबोट डेटासेट्स (AntMaze और Adroit) पर किया और यह अभी भी शीर्ष पर रहा, जिसने क्रमशः 90.2 और 33.6 स्कोर किया।

यह पेपर सुझाव देता है कि सफलता का रहस्य अधिक जटिलता जोड़ना नहीं था, बल्कि "अनुशासित इंजीनियरिंग" था। कुछ आधुनिक तकनीकों को सावधानीपूर्वक संयोजित करके—जैसे कि मूव्स उत्पन्न करने और उनकी संभावना की जांच करने के लिए नॉर्मलाइजिंग फ्लो का उपयोग करना, और एक बहु-चरणीय "रिफाइनमेंट" प्रक्रिया का उपयोग करना जहाँ रोबोट कार्य करने से पहले अपने सर्वश्रेष्ठ अनुमानों की दोबारा जांच करता है—उन्होंने पारंपरिक शिक्षण के सरल, विश्वसनीय आधार को छोड़े बिना अत्याधुनिक प्रदर्शन हासिल किया। हालांकि वे स्वीकार करते हैं कि अभी भी कुछ पहेलियाँ बाकी हैं (जैसे कि एक विशिष्ट "क्यूब डबल" कार्य जहाँ रोबोट लड़खड़ा गया), समग्र संदेश स्पष्ट है: कभी-कभी, सबसे शक्तिशाली उपकरण एक नया आविष्कार नहीं, बल्कि एक पुराने पसंदीदा का बहुत अच्छी तरह से ट्यून किया गया, आधुनिक संस्करण होता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →