← नवीनतम पेपर
💻 computer science

Data Scaling Laws in Imitation Learning for Robotic Manipulation

यह शोध पत्र प्रदर्शित करता है कि रोबोटिक मैनिपुलेशन में, सामान्यीकरण प्रदर्शन (generalization performance) प्रदर्शनों की विशाल मात्रा के बजाय प्रशिक्षण वातावरण और वस्तुओं की विविधता के साथ पावर-लॉ स्केलिंग का अनुसरण करता है, जो एक केंद्रित डेटा संग्रह रणनीति के माध्यम से अत्यधिक प्रभावी ज़ीरो-शॉट नीतियों को सक्षम बनाता है।

मूल लेखक: Fanqi Lin, Yingdong Hu, Pingyue Sheng, Chuan Wen, Jiacheng You, Yang Gao

प्रकाशित 2026-06-29
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Fanqi Lin, Yingdong Hu, Pingyue Sheng, Chuan Wen, Jiacheng You, Yang Gao

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को एक विशिष्ट काम करना सिखाने की कोशिश कर रहे हैं, जैसे कि बोतल से कप में पानी डालना। अतीत में, आप शायद यह सोचते कि रोबोट को सिखाने का सबसे अच्छा तरीका उसे एक ही रसोई में हजारों बार बिल्कुल वही क्रिया दिखाना होगा। आप सोचते, "अगर मैं इसे पर्याप्त अभ्यास करा दूँ, तो यह एकदम सटीक हो जाएगा।"

यह शोध पत्र कहता है: नहीं, यह सबसे कुशल तरीका नहीं है।

एक ही हरकत को बार-बार करने का अभ्यास करने के बजाय, आपको रोबोट को कई अलग-अलग रसोईघरों में और कई अलग-अलग बोतलों के साथ वही काम करना सिखाना चाहिए।

यहाँ उनके निष्कर्षों का सरल उपमाओं (analogies) का उपयोग करके विवरण दिया गया है:

1. "विविधता" बनाम "मात्रा" का नियम (The "Variety" vs. "Volume" Rule)

शोधकर्ताओं ने रोबोट के सीखने के बारे में एक आश्चर्यजनक नियम की खोज की। उन्होंने पाया कि विविधता, मात्रा से कहीं अधिक महत्वपूर्ण है।

  • पुराना तरीका (मात्रा): एक विशिष्ट रसोई में एक विशिष्ट नीली बोतल के साथ पानी डालने के 1,000 वीडियो दिखाना।
  • नया तरीका (विविधता): रोबोट को केवल 50 वीडियो दिखाना, लेकिन 50 अलग-अलग रसोईघरों में, 50 अलग-अलग प्रकार की बोतलों (कांच, प्लास्टिक, लंबी, छोटी, लाल, पारदर्शी) का उपयोग करते हुए।

उपमा: इसे गाड़ी चलाना सीखने के रूप में सोचें।

  • यदि आप केवल एक धूप वाले दिन अपने घर के ड्राइववे में गाड़ी चलाने का अभ्यास करते हैं (उच्च मात्रा, कम विविधता), तो जैसे ही आप किसी बरसाती सड़क या व्यस्त चौराहे पर पहुँचेंगे, आपका एक्सीडेंट हो जाएगा।
  • यदि आप 32 अलग-अलग मोहल्लों में, बारिश, बर्फ और ट्रैफिक में, लेकिन प्रत्येक में कम समय के लिए गाड़ी चलाने का अभ्यास करते हैं (उच्च विविधता, कम मात्रा), तो आप बहुत तेज़ी से एक बेहतर ड्राइवर बन जाएंगे।

शोध में पाया गया कि एक बार जब आपके पास पर्याप्त अलग-अलग परिदृश्य (लगभग 32 अलग-अलग वातावरण) हो जाते हैं, तो उसी परिदृश्य के लिए अधिक अभ्यास वीडियो जोड़ने से बहुत कम मदद मिलती है।

2. सीखने का "पावर लॉ" (The "Power Law" of Learning)

शोधकर्ताओं ने पाया कि रोबोट की नई, अनदेखी स्थितियों को संभालने की क्षमता एक पूर्वानुमानित गणितीय वक्र (curve) का पालन करती है जिसे पावर लॉ (Power Law) कहा जाता है।

उपमा: कल्पना कीजिए कि रोबोट का "सामान्यीकरण कौशल" (generalization skill) एक मांसपेशी है।

  • यदि आप एक बार वजन उठाते हैं (एक नया वातावरण या वस्तु जोड़ते हैं), तो आपकी मांसपेशी थोड़ी बढ़ती है।
  • यदि आप 2 अलग-अलग जिम में वजन उठाते हैं, तो यह और बढ़ती है।
  • यदि आप 32 अलग-अलग जिम में वजन उठाते हैं, तो आपकी मांसपेशी अविश्वसनीय रूप से मजबूत हो जाती है।
  • शोध से पता चलता है कि यह वृद्धि यादृच्छिक (random) नहीं है; यह एक सुचारू, पूर्वानुमानित रेखा का अनुसरण करती है। आप जितने अधिक अलग-अलग स्थानों और वस्तुओं पर प्रशिक्षण देंगे, रोबोट नए स्थानों और वस्तुओं को संभालने में उतना ही बेहतर होगा।

3. "एक दोपहर" की सफलता (The "One Afternoon" Breakthrough)

इस शोध पत्र का सबसे रोमांचक हिस्सा इस पद्धति की दक्षता है।

शोधकर्ताओं ने इसे चार अलग-अलग कार्यों पर परखा: पानी डालना, कंप्यूटर माउस को व्यवस्थित करना, तौलिये को मोड़ना और चार्जर को अनप्लग करना।

  • उन्होंने चार लोगों (डेटा संग्रहकर्ता) का उपयोग किया।
  • उन्होंने केवल एक दोपहर के लिए काम किया।
  • उन्होंने 32 अलग-अलग वातावरणों में डेटा एकत्र किया, जिसमें प्रत्येक के लिए 50 प्रदर्शन (demonstrations) शामिल थे।

परिणाम: उन्होंने ऐसे रोबोटों को प्रशिक्षित किया जो पूरी तरह से नए कमरों में और उन वस्तुओं के साथ जिन्हें उन्होंने पहले कभी नहीं देखा था, 90% सफलता दर के साथ इन कार्यों को करने में सक्षम थे। उन्हें रोबोट को फाइन-ट्यून करने या फिर से प्रशिक्षित करने की आवश्यकता नहीं थी; यह तुरंत काम करने लगा (zero-shot)।

4. रोबोट के "मस्तिष्क" के बारे में क्या? (What About the Robot's "Brain"?)

शोध पत्र ने रोबोट के "मस्तिष्क" (AI मॉडल) के आकार को भी देखा।

  • विजुअल एनकोडर (आँखें): रोबोट की "आँखों" को बड़ा और स्मार्ट बनाने (एक बड़े मॉडल का उपयोग करने) से निश्चित रूप से इसे बेहतर देखने और बेहतर प्रदर्शन करने में मदद मिली।
  • एक्शन मॉडल (हाथ): आश्चर्यजनक रूप से, मस्तिष्क के "हाथ" वाले हिस्से को बड़ा बनाने से कोई मदद नहीं मिली। इन विशिष्ट कार्यों के लिए एक छोटा, सरल मॉडल एक विशाल मॉडल के समान ही अच्छा था। ऐसा लगता है कि "हाथों" को अधिक जटिल होने की आवश्यकता नहीं थी; उन्हें बस अधिक विविधता देखने की आवश्यकता थी।

निचोड़ (The Bottom Line)

यह शोध पत्र तर्क देता है कि वास्तविक दुनिया को संभालने के लिए रोबोट बनाने के लिए, हमें केवल इसमें भारी मात्रा में दोहराव वाला डेटा नहीं डालना चाहिए। इसके बजाय, हमें विविधता पर ध्यान केंद्रित करना चाहिए।

यदि आप एक ऐसा रोबोट चाहते हैं जो किसी भी घर में किसी भी कप में पानी डाल सके, तो उसे एक ही रसोई में पानी डालने के 10,000 वीडियो न दिखाएं। उसे 32 अलग-अलग कपों के साथ 32 अलग-अलग रसोईघरों में 1,600 वीडियो (32 स्थान × 50 प्रयास) दिखाएं। वह छोटा, विविध डेटासेट रोबोट को वास्तव में अनुकूलन योग्य बनाने का "सीक्रेट सॉस" है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →