← नवीनतम पेपर
🤖 machine learning

The Latent That Never Was: A Forensic Re-run of the CVAE Ablation in Action Chunking Transformer

यह शोध पत्र एक्शन चंकिंग ट्रांसफॉर्मर (ACT) के मूल निष्कर्षों को चुनौती देता है, यह प्रदर्शित करते हुए कि इसके कंडीशनल वेरिएशनल ऑटोएनकोडर एनकोडर को हटाने से होने वाली रिपोर्ट की गई महत्वपूर्ण प्रदर्शन गिरावट उनके पुन: परीक्षणों (re-runs) में पुनरावृत्त नहीं होती है, जो यह सुझाव देता है कि एनकोडर की उपयोगिता मॉडल के लिए एक मौलिक आवश्यकता के बजाय प्रशिक्षण और मूल्यांकन प्रोटोकॉल के प्रति अत्यधिक संवेदनशील है।

मूल लेखक: Bo Kang

प्रकाशित 2026-09-16
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Bo Kang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

रोबोट जो इंसानों के हाथ हिलाने के तरीके को देखकर सीखते हैं, वे अब केवल विज्ञान कथा (साइंस फिक्शन) नहीं रह गए हैं; वे एक वास्तविकता हैं जिसे दुनिया भर की प्रयोगशालाओं में बनाया जा रहा है। किसी मशीन को यह सिखाने के लिए कि ब्लॉक कैसे उठाना है या छेद में पेग (peg) कैसे डालना है, शोधकर्ता अक्सर 'इमिटेशन लर्निंग' (imitation learning) नामक एक विधि का उपयोग करते हैं, जहाँ रोबोट मानव प्रदर्शनों के एक संग्रह का अध्ययन करता है। इसके लिए एक लोकप्रिय उपकरण 'एक्शन चंकिंग ट्रांसफॉर्मर' (Action Chunking Transformer) नामक प्रणाली है। यह एक परिष्कृत भविष्यवाणी इंजन की तरह काम करता है: यह देखता है कि रोबोट क्या देख रहा है और उसके जोड़ (joints) कहाँ हैं, और फिर भविष्य की गतिविधियों के एक पूरे क्रम का अनुमान लगाता है। इस तथ्य को संभालने के लिए कि इंसान एक ही वस्तु को थोड़े अलग तरीकों से हिला सकते हैं, इस प्रणाली में एक विशेष आंतरिक घटक, एक 'एनकोडर' (encoder) शामिल है, जिसे उन सूक्ष्म अंतरों को पकड़ने के लिए डिज़ाइन किया गया है। प्रशिक्षण के दौरान, यह एनकोडर मानव क्रियाओं को एक संक्षिप्त कोड में संकुचित करता है, जो एक छिपा हुआ चर (variable) है जो रोबोट को बताता है कि उसे अपने व्यवहार में कैसे बदलाव करना है। हालाँकि, जब रोबोट वास्तव में अपने आप कार्य करता है, तो इस एनकोडर को बंद कर दिया जाता है, और रोबोट को यह मानने के लिए कहा जाता है कि छिपा हुआ कोड शून्य है। इस प्रणाली के मूल रचनाकारों ने दावा किया था कि यह एनकोडर महत्वपूर्ण था, उन्होंने बताया कि इसे हटाने से रोबोट की सफलता दर एक सम्मानजनक 35 प्रतिशत से गिरकर लगभग पूर्ण विफलता के 2 प्रतिशत तक पहुँच गई।

बो कांग (Bo Kang) नामक एक शोधकर्ता ने इस दावे का परीक्षण शून्य से करने का निर्णय लिया। मूल अध्ययन का स्वतंत्र रूप से पुनरुत्पादन नहीं किया गया था, और इसके कोड में एनकोडर को बंद करने के लिए कोई सरल स्विच शामिल नहीं था, जिससे इसकी पुष्टि करना कठिन था। कांग ने प्रयोग को फिर से बनाया, उन्हीं मानव प्रदर्शनों के साथ उन्हीं रोबोट कार्यों को चलाया, लेकिन इस बार एनकोडर के साथ और बिना एनोडर के सिस्टम की तुलना करने की स्पष्ट क्षमता के साथ। लक्ष्य यह देखना था कि प्रदर्शन में आई भारी गिरावट तकनीक का एक मौलिक सत्य है या मूल प्रयोग के सेटअप का एक संयोग। परिणाम आश्चर्यजनक थे। कांग के पुन: परीक्षणों में, एनकोडर ने स्थिति को नहीं संभाला। वास्तव में, जब शोधकर्ताओं ने एनकोडर को हटाया, तो रोबोट अक्सर एनकोडर की उपस्थिति की तुलना में उतना ही अच्छा या कभी-कभी उससे भी बेहतर प्रदर्शन करता था। 35 प्रतिशत और 2 प्रतिशत के बीच का विशाल अंतर इन नए परीक्षणों में दिखाई ही नहीं दिया।

शोधकर्ताओं ने यह समझने के लिए गहराई से जांच की कि मूल संख्याएँ इतनी अलग क्यों थीं। शोधकर्ताओं ने पाया कि इन रोबोट प्रयोगों का परिणाम बहुत छोटे विवरणों के प्रति अविश्वसनीय रूप से संवेदनशील है। उदाहरण के लिए, रोबोट कितने समय तक प्रशिक्षण लेता है, यह मायने रखता है। यदि रोबोट प्रशिक्षण जल्दी रोक देता है, तो एनकोडर सहायक लग सकता है, लेकिन यदि वह लंबे समय तक प्रशिक्षण लेता है, तो वह लाभ गायब हो सकता है या उल्टा भी हो सकता है। इसी तरह, परीक्षण के लिए रोबोट के मस्तिष्क के सबसे अच्छे संस्करण को चुनने की विधि भी परिणामों को बदल सकती है। मूल अध्ययन ने संभवतः प्रशिक्षण के एक विशिष्ट क्षण का चयन किया था जो संयोग से एनकोडर के पक्ष में था, जबकि अन्य क्षण बिना एनकोडर वाले सिस्टम के पक्ष में थे। जब शोधकर्ताओं ने इन कारकों को नियंत्रित किया, जिसमें समान प्रशिक्षण समय और समान चयन नियम शामिल थे, तो एनकोडर की कथित सुपरपावर गायब हो गई। सफलता दर में अंतर इतना कम हो गया कि यह निश्चितता के साथ कहना असंभव था कि एनकोडर ने मदद की या नुकसान पहुँचाया।

यह समझने के लिए कि एनकोडर वास्तव में क्या कर रहा था, टीम ने रोबोट के "मन" के भीतर झाँका ताकि यह देखा जा सके कि एनकोडर कौन सी जानकारी संग्रहीत कर रहा है। उन्होंने जाँच की कि क्या छिपा हुआ कोड मानव की शैली के बारे में उपयोगी विवरण ले जाता है, जैसे कि वे कितनी तेजी से चलते थे या कितनी सहजता से मुड़ते थे। मानक प्रशिक्षण सेटिंग्स के साथ परीक्षण किए गए विशिष्ट कार्यों पर, एनकोडर ने लगभग कोई लाभ नहीं दिया। हालाँकि, शोधकर्ताओं ने पाया कि एनकोडर स्वाभाविक रूप से बेकार नहीं था; जब उन्होंने उस दंड (penalty) को हटा दिया जो सामान्य रूप से एनकोडर की जानकारी को प्रतिबंधित करता है, तो छिपे हुए कोड ने क्रियाओं के पुनर्निर्माण (reconstruction) में 84 प्रतिशत तक सुधार किया। इसके अलावा, एनकोडर पूरी तरह से मौन नहीं था; इसने लघु एक्शन चंक्स (action chunks) के भीतर गति (motion) के बारे में जानकारी को सफलतापूर्वक कैप्चर किया, जैसे कि गति और त्वरण (acceleration) में परिवर्तन, भले ही यह पूरे प्रदर्शनों के समय या सहजता को विश्वसनीय रूप से पुनः प्राप्त करने में विफल रहा। जब उन्होंने एक अलग, सरल कार्य पर सिस्टम का परीक्षण किया जहाँ एनकोडर उपयोगी था, तो उनके द्वारा बनाए गए उपकरणों ने सफलतापूर्वक एनकोडर के मूल्य का पता लगाया, जिससे सिद्ध हुआ कि उनकी परीक्षण विधियाँ सटीक थीं। लेकिन मानक स्थितियों में जटिल रोबोट कार्यों पर, एनकोडर ने बहुत कम मापने योग्य लाभ प्रदान किया।

इस अध्ययन ने एक व्यावहारिक दुष्प्रभाव भी प्रकट किया। चूँकि एनकोडर रोबोट के सॉफ़्टवेयर का एक बड़ा हिस्सा है, इसलिए इसे हटाने से प्रशिक्षण प्रक्रिया तेज़ और सस्ती हो जाती है। परीक्षणों में, एनकोडर गणना को छोड़ने से रोबोट के सीखने की गति लगभग 25 प्रतिशत बढ़ गई। चूँकि रोबोट वास्तव में कार्य करते समय एनकोडर का उपयोग नहीं करता है, इसलिए प्रशिक्षण के दौरान इसे रखना एक अनावश्यक खर्च लगता है जिसका कोई स्पष्ट लाभ नहीं है। शोधकर्ताओं ने निष्कर्ष निकाला कि हालांकि मूल पेपर ने दावा किया था कि एनकोडर आवश्यक है, साक्ष्य बताते हैं कि यह नहीं है। मूल अध्ययन में रिपोर्ट की गई नाटकीय विफलता एक रहस्य बनी हुई है, जो संभवतः प्रशिक्षण की लंबाई और चयन विकल्पों के एक विशिष्ट संयोजन के कारण हुई है जिसे दोहराया नहीं जा सका है। फिलहाल, इन रोबोटों को बनाने के लिए सबसे विश्वसनीय मार्ग बिना एनकोडर वाला सरल संस्करण प्रतीत होता है, जो अन्य शोधकर्ताओं के लिए विभिन्न कार्यों और विभिन्न डेटा पर इन निष्कर्षों का परीक्षण करने के लिए द्वार खुला छोड़ता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →