← नवीनतम पेपर
💻 computer science

Why Does Action Chunking Improve Behavioral Cloning Performance in Robotic Control?

यह शोध पत्र प्रकट करता है कि एक्शन चंकिंग (action chunking) रोबोटिक नियंत्रण प्रदर्शन में मुख्य रूप से विविध टेम्पोरल संबंधों के "इम्प्लिसिट एनसेम्बलिंग" (implicit ensembling) के माध्यम से सुधार करती है, न कि पहले से परिकल्पित कारकों के माध्यम से, जो यह प्रदर्शित करता है कि एक्शन चंकिंग की आवश्यकता के बिना विलंबित पॉलिसियों (delayed policies) के एनसेम्बल्स को स्पष्ट रूप से तैनात करके तुलनीय या बेहतर परिणाम प्राप्त किए जा सकते हैं।

मूल लेखक: Filippo Lazzati, Kyle Stachowicz, William Chen, Alberto Maria Metelli, Andrew Wagenmaker, Sergey Levine

प्रकाशित 2026-08-04
📖 8 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Filippo Lazzati, Kyle Stachowicz, William Chen, Alberto Maria Metelli, Andrew Wagenmaker, Sergey Levine

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को एक जटिल कार्य करना सिखाने की कोशिश कर रहे हैं, जैसे कि सैंडविच बनाना या दराज खोलना, किसी इंसान को देखकर। इस क्षेत्र को इमिटेशन लर्निंग (Imitation Learning), या अधिक विशेष रूप से, बिहेवियरल क्लोनिंग (Behavioral Cloning) कहा जाता है। इसे ऐसे समझें जैसे एक छात्र अपने शिक्षक का होमवर्क कॉपी कर रहा हो। रोबोट इंसान के हाथ हिलाने के वीडियो को देखता है और यह सीखने की कोशिश करता है कि वह भी वैसा ही कैसे कर सकता है।

बड़ी चुनौती यह है कि दुनिया बहुत अव्यवस्थित है। यदि रोबोट एक छोटी सी गलती करता है, तो अगला क्षण उस प्रशिक्षण वीडियो से बिल्कुल अलग दिख सकता है जो उसने देखा था। यह एक रस्सी पर चलने (tightrope) जैसा है; यदि आप लड़खड़ाते हैं, तो आप पूरी तरह से रास्ते से बाहर गिर सकते हैं। इस स्थिति को संभालने के लिए, वैज्ञानिक अक्सर एक तरकीब का उपयोग करते हैं जिसे एक्शन चंकिंग (Action Chunking) कहा जाता है। रोबोट को यह बताने के बजाय कि "अपना हाथ एक इंच आगे बढ़ाओ" और फिर अगला निर्देश देने से पहले रुकना, वे उसे एक साथ कहते हैं: "अपना हाथ एक इंच आगे बढ़ाओ, फिर दूसरा, फिर तीसरा..." यह केवल एक शब्द के बजाय निर्देशों का एक पूरा वाक्य देने जैसा है। यह 'सीक्रेट सॉस' रहा है जिससे रोबोट अकेले काम करने में बहुत बेहतर हो गए हैं, लेकिन कोई वास्तव में यह नहीं जानता था कि यह केवल एक बार में एक निर्देश देने की तुलना में इतना बेहतर क्यों काम करता है।

यह शोध पत्र इसी रहस्य की गहराई में उतरता है। लेखक, जो यूसी बर्कले और पॉलिटेक्निको डी मिलानो जैसे विश्वविद्यालयों के शोधकर्ताओं की एक टीम है, ने एक जासूस की भूमिका निभाने का निर्णय लिया। वे जानना चाहते थे: क्या ऐसा इसलिए है क्योंकि रोबोट अधिक सुसंगत (consistent) हो रहा है? क्या ऐसा इसलिए है क्योंकि वह भविष्य में अधिक देख रहा है? या यह कुछ और ही है? उन्होंने कंप्यूटर सिमुलेशन में और लैब में वास्तविक रोबोटों पर सैकड़ों प्रयोग किए ताकि एक्शन चंकिंग के जादू के पीछे के असली कारण का पता लगाया जा सके।

महान "क्यों" की जांच

लंबे समय तक, सभी को लगता था कि रोबोट को क्रियाओं का एक "चंक" (समूह) देने के तीन मुख्य कारण थे:

  1. टेम्पोरल कंसिस्टेंसी (Temporal Consistency): यह विचार कि इंसान सुचारू रूप से चलते हैं, और चंकिंग रोबोट को उस सुचारू गति की नकल करने में मदद करती है, जबकि एक रोबोट जो केवल एक समय में एक कदम के बारे में सोचता है, वह ऐसा नहीं कर पाता।
  2. होराइजन रिडक्शन (Horizon Reduction): यह विचार कि कई कदमों की योजना बनाकर, रोबोट को भविष्य में होने वाली गलतियों की चिंता करने की आवश्यकता नहीं होती, जिससे उसके भटकने की संभावना कम हो जाती है।
  3. रिप्रेजेंटेशन लर्निंग (Representation Learning): यह विचार कि गतिविधियों के पूरे क्रम की भविष्यवाणी करने की कोशिश करने से रोबोट का मस्तिष्क दुनिया के बारे में बेहतर "विशेषताएं" (features) सीख पाता है, जिससे वह समग्र रूप से अधिक स्मार्ट बनता है।

लेखकों ने इन विचारों का परीक्षण करने का फैसला किया। उन्होंने एक विशेष प्रकार की रोबोट पॉलिसी (कार्य करने के नियमों का एक सेट) बनाई जो एक बार में 20 क्रियाओं का पूर्वानुमान लगा सकती थी। फिर, उन्होंने इस पॉलिसी का एक "डिलेड" (विलंबित) संस्करण बनाया। एक डिलेड पॉलिसी एक ऐसे रोबोट की तरह है जो यह तय करने के लिए कि अब क्या करना है, देखता है कि उसने 5 या 10 सेकंड पहले क्या देखा था। यह भविष्य के पूरे क्रम की भविष्यवाणी नहीं करता है; यह केवल अगली चाल की भविष्यवाणी करता है, लेकिन यह भविष्यवाणी एक पुराने अवलोकन (observation) पर आधारित होती है।

ट्विस्ट: जब उन्होंने इन विचारों का परीक्षण किया, तो उन्होंने पाया कि पहले दो लोकप्रिय सिद्धांत वास्तव में गलत थे, या कम से कम वे पूरी कहानी नहीं थे।

  • उन्होंने पाया कि टेम्पोरल कंसिस्टेंसी नायक नहीं थी। एक रोबोट जो केवल अतीत को देखता है (एक डिलेड पॉलिसी), वह एक ऐसे रोबोट की तरह ही मानवीय सुचारू गति की नकल कर सकता है जो पूरे चंक की भविष्यवाणी करता है।
  • उन्होंने यह भी पाया कि होराइजन रिडक्शन मुख्य कारण नहीं था। हालांकि एक चंक की भविष्यवाणी करना "होराइजन" (भविष्य में योजना बनाने की दूरी) को कम करता है, लेकिन एक डिलेड पॉलिसी बिना पूरे क्रम की योजना बनाए भी त्रुटियों को उसी स्तर तक कम कर सकती है।

तो, यदि वे प्रसिद्ध सिद्धांत उत्तर नहीं हैं, तो क्या है?

असली रहस्य: "इम्प्लिसिट एनसेम्बल" (Implicit Ensemble)

यह शोध पत्र प्रकट करता है कि एक्शन चंकिंग की असली सुपरपावर क्या है, जिसे लेखक इम्प्लिसिट एनसेम्बलिंग (Implicit Ensembling) कहते हैं।

कल्प laइए कि आप मौसम का अनुमान लगाने की कोशिश कर रहे हैं। आप एक ऐसे दोस्त से पूछ सकते हैं जो हर घंटे खिड़की से बाहर देखता है। या, आप पांच अलग-अलग दोस्तों से पूछ सकते हैं जो अलग-अलग समय पर खिड़की से बाहर देखते हैं: एक 9:00 बजे देखता है, एक 9:05 बजे, एक 9:10 बजे, इत्यादि। भले ही वे सभी एक ही आसमान को देख रहे हों, उनके अलग-अलग दृष्टिकोण आपको बेहतर अनुमान लगाने में मदद कर सकते हैं।

एक एक्शन-चंकिंग रोबोट बिल्कुल यही करता है। जब वह 20 क्रियाओं के क्रम की भविष्यवाणी करना सीखता है, तो वह वास्तव में एक ही समय में समस्या के 20 अलग-अलग "दृष्टिकोणों" को सीख रहा होता है।

  • चंक की पहली क्रिया की भविष्यवाणी करने के लिए, वह वर्तमान अवलोकन को देखता है।
  • दूसरी क्रिया की भविष्यवाणी करने के लिए, वह वर्तमान अवलोकन को देखता है (लेकिन कल्पना करता है कि यह भविष्य का एक कदम है)।
  • तीसरी क्रिया की भविष्यवाणी करने के लिए, वह वर्तमान अवलोकन को देखता है (कल्पना करता है कि यह भविष्य के दो कदम हैं)।

एक साथ इन सभी अलग-अलग समय-परिवर्तित संबंधों पर प्रशिक्षण प्राप्त करके, रोबोट प्रभावी रूप से अपने स्वयं के मस्तिष्क के भीतर विशेषज्ञों की एक टीम बनाता है। यह एक समिति की तरह है जिसमें 20 अलग-अलग रोबोट हैं, जिनमें से प्रत्येक का दुनिया को देखने में थोड़ा अलग "विलंब" (delay) है, और वे सभी अगले कदम पर वोट दे रहे हैं। यह "समिति" प्रभाव रोबोट को बहुत अधिक मजबूत बनाता है और मूर्खतापूर्ण गलती करने की संभावना को कम करता है।

"आहा!" क्षण और नया समाधान

इस खोज का सबसे रोमांचक हिस्सा वह है जो उन्होंने किया। चूंकि उन्हें एहसास हुआ कि जादू "चंक" में नहीं था, बल्कि इस तथ्य में था कि चंक ने विभिन्न समय दृष्टिकोणों का यह "समिति" प्रभाव पैदा किया, उन्होंने पूछा: क्या हम बिना चंक का उपयोग किए भी वही लाभ प्राप्त कर सकते हैं?

उन्होंने रैंडमाइज्ड डिले एनसेम्बल्स (Randomized Delay Ensembles) नामक एक चतुर तकनीक का परीक्षण किया। एक रोबोट को क्रियाओं का एक चंक भविष्यवाणी करने के लिए प्रशिक्षित करने के बजाय, उन्होंने रोबोटों का एक समूह प्रशिक्षित किया। समूह में प्रत्येक रोबोट एक "डिलेड" पॉलिसी था, लेकिन उन सभी को अलग-अलग विलंब (delay) के साथ अतीत को देखने के लिए प्रशिक्षित किया गया था (एक 1 कदम पीछे देखता है, दूसरा 2 कदम पीछे, तीसरा 3 कदम पीछे, आदि)। जब कार्य करने का समय आया, तो उन्होंने केवल एक रोबोट को नहीं चुना; उन्होंने निर्णय लेने के लिए समूह में से बेतरतीब ढंग से एक को चुना।

परिणाम अद्भुत थे। कंप्यूटर सिमुलेशन और वास्तविक दुनिया के परीक्षणों में (जैसे कटोरे में गाजर रखना या टोस्टर से ब्रेड निकालना), इस "रैंडमाइज्ड डिले" टीम ने पारंपरिक एक्शन-चंकिंग रोबोट के समान प्रदर्शन किया। कुछ मामलों में, इसने बेहतर भी प्रदर्शन किया!

भविष्य के लिए इसका क्या अर्थ है

यह शोध पत्र सुझाव देता है कि हमें रोबोट को स्मार्ट बनाने के लिए आवश्यक रूप से लंबी क्रियाओं के अनुक्रमों की भविष्यवाणी करने के लिए मजबूर करने की आवश्यकता नहीं है। "चंक" केवल एक सुविधाजनक तरीका था जिससे अनजाने में विशेषज्ञों की एक टीम बन गई। विभिन्न समय विलंबों का उपयोग करके उस टीम को स्पष्ट रूप से बनाकर, हम वही (या बेहतर) परिणाम प्राप्त कर सकते हैं।

इसका मतलब यह नहीं है कि एक्शन चंकिंग बेकार है; इसका मतलब केवल यह है कि अब हम समझते हैं कि यह क्यों काम करता है। यह यह समझने जैसा है कि एक कार का इंजन पेंट के रंग के कारण नहीं, बल्कि स्पार्क प्लग के कारण चलता है। अब जब हम जानते हैं कि स्पार्क प्लग (एनसेम्बल प्रभाव) ही मुख्य कुंजी है, तो हम बेहतर इंजन बना सकते हैं जिन्हें तेजी से चलने के लिए भारी, जटिल पेंट की परत (लंबे एक्शन चंक) की आवश्यकता नहीं है।

लेखक दिखाते हैं कि रोबोटों की इस अस्त-व्यस्त दुनिया में, अतीत को अलग-अलग कोणों से देखना सीखने का एक शक्तिशाली तरीका है। उन्होंने इसे 90 अलग-अलग कार्यों के साथ कंप्यूटर सिमुलेशन में और वास्तविक भौतिक कार्यों को करने वाले रोबोटों पर सिद्ध किया। हालांकि वे यह वादा नहीं कर सकते कि यह दुनिया की हर रोबोट समस्या को हल कर देगा, उनके प्रयोग दृढ़ता से संकेत देते हैं कि रोबोट लर्निंग का भविष्य दूर के भविष्य की भविष्यवाणी करने के बारे में कम और अभी क्या करना है, यह तय करने के लिए "समय-यात्रा करने वाले" विशेषज्ञों की एक विविध टीम बनाने के बारे में अधिक हो सकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →