← नवीनतम पेपर
💻 computer science

MINERVA: How Small Can a Manipulation Policy Be and Still Solve LIBERO?

यह शोध पत्र MINERVA को प्रस्तुत करता है, जो एक अत्यधिक संक्षिप्त 0.54M-पैरामीटर वाला विजन-लैंग्वेज-एक्शन पॉलिसी है जो LIBERO बेंचमार्क पर अत्याधुनिक प्रदर्शन (near-state-of-the-art performance) प्राप्त करता है, जो यह दर्शाता है कि कार्य की क्षमता का निचला स्तर (capacity floor) आश्चर्यजनक रूप से कम है जबकि यह निर्देश कंडीशनिंग की मजबूती में महत्वपूर्ण सीमाओं और फ्लो मैचिंग (flow matching) से लाभ की कमी को उजागर करता है।

मूल लेखक: Kohei Sendai, Tatsuya Matsushima, Yusuke Iwasawa

प्रकाशित 2026-09-04
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Kohei Sendai, Tatsuya Matsushima, Yusuke Iwasawa

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

रोबोट ऐसी कुशलता के साथ हिलना-डुलना सीख रहे हैं जो कभी असंभव लगती थी, जैसे कि वस्तुओं को उठाना, ब्लॉकों को एक के ऊपर एक रखना और सरल मौखिक निर्देशों का पालन करना। यह प्रगति एक नए प्रकार के कृत्रिम बुद्धिमत्ता (आर्टिफिशियल इंटेलिजेंस) द्वारा संचालित है जो दृष्टि (विज़न), भाषा और क्रिया को एक एकल प्रणाली में संयोजित करती है। ये प्रणालियाँ, जिन्हें अक्सर विजन-लैंग्वेज-एक्शन मॉडल कहा जाता है, रोबोट के मस्तिष्क के रूप में कार्य करती हैं, जो एक दृश्य को देखती हैं, "लाल ब्लॉक उठाओ" जैसे अनुरोध को समझती हैं, और फिर कार्य को पूरा करने के लिए आवश्यक सटीक गतिविधियों की गणना करती हैं। इन मस्तिष्कों को प्रशिक्षित करने के लिए, शोधकर्ता बेंचमार्क के रूप में जाने जाने वाले मानकों के एक मानक सेट का उपयोग करते हैं, जो एक मापक यंत्र के रूप में कार्य करते हैं कि रोबोट कितनी अच्छी तरह प्रदर्शन करता है। वर्षों से, रोबोटिक मैनिपुलेशन के लिए सबसे लोकप्रिय बेंचमार्क एक सिम्युलेटेड वातावरण में वस्तुओं को हिलाने से जुड़े चालीस अलग-अलग कार्यों का एक संग्रह रहा है। क्षेत्र में प्रचलित विश्वास यह रहा है कि इन कार्यों को अच्छी तरह से हल करने के लिए, एक रोबोट को एक विशाल मस्तिष्क की आवश्यकता होती है—एक डिजिटल मॉडल जिसमें अरबों पैरामीटर, या आंतरिक सेटिंग्स होती हैं, जिसे चलाने के लिए शक्तिशाली, महंगे कंप्यूटर हार्डवेयर की आवश्यकता होती है।

हालाँकि, टोक्यो विश्वविद्यालय के शोधकर्ताओं ने एक सरल, अधिक व्यावहारिक प्रश्न पूछा है: मस्तिष्क वास्तव में कितना बड़ा होना चाहिए? यदि किसी रोबोट को कारखाने या घर में विशिष्ट कार्यों को करने के लिए तैनात किया जाता है, तो उसे दुनिया की हर भाषा को समझने या उस हर वस्तु को पहचानने की क्षमता की आवश्यकता नहीं है जिसे उसने पहले कभी नहीं देखा है। उसे केवल उन विशिष्ट कार्यों को हल करने की आवश्यकता है जिनके लिए उसे काम पर रखा गया है। शोधकर्ता उस रोबोट मस्तिष्क के सबसे छोटे संभव संस्करण की तलाश कर रहे थे जो अभी भी मानक चालीस कार्यों को पूरी तरह से हल कर सके। वे उस न्यूनतम कंप्यूटिंग शक्ति की तलाश कर रहे थे जो काम पूरा करने के लिए आवश्यक थी, एक ऐसा थ्रेशोल्ड (सीमा) जो यह निर्धारित करेगा कि क्या एक रोबोट एक छोटे, सस्ते चिप पर चल सकता है या इसे हमेशा एक विशाल सर्वर की आवश्यकता होगी।

इस सीमा को खोजने के लिए, टीम ने रोबोट नीतियों (पॉलिसीज़) का एक परिवार बनाया, जो वे प्रोग्राम हैं जो रोबोट को बताते हैं कि कैसे हिलना है, और व्यवस्थित रूप से उन्हें छोटा करती गई। उन्होंने लगभग दस मिलियन आंतरिक सेटिंग्स वाले एक मॉडल से शुरुआत की और उसे चरण-दर-चरण छोटा करना शुरू किया, और यह देखते रहे कि रोबोट कब विफल होने लगता है। उन्होंने बड़े मॉडलों में सामान्य जटिल विशेषताओं को हटा दिया, जैसे कि प्राकृतिक भाषा वाक्यों को पढ़ने या पूर्व-प्रशिक्षित विजन सिस्टम का उपयोग करने की क्षमता। इसके बजाय, उन्होंने रोबोट को चालीस कार्यों के नामों की एक सरल सूची दी, जो संख्याओं द्वारा दर्शाई गई थी, और एक कैमरा जो शून्य से देखना सीखता था। फिर उन्होंने इन मॉडलों को मानक चालीस कार्यों पर प्रशिक्षित किया और यह देखने के लिए दो हजार बार से अधिक परीक्षण किया कि वे कितनी बार सफल होते हैं।

परिणामों ने एक आश्चर्यजनक निचली सीमा (फ्लोर) का खुलासा किया। शोधकर्ताओं ने पाया कि केवल 0.54 मिलियन पैरामीटर वाला एक मॉडल कार्यों को 95.1 प्रतिशत सफलता दर के साथ हल करने में सक्षम था। इस छोटे से मॉडल ने क्षेत्र के सबसे बड़े, सबसे प्रसिद्ध मॉडलों के लगभग समान प्रदर्शन किया, जिनमें अरबों पैरामीटर होते हैं और जो हजारों गुना बड़े होते हैं। जब मॉडल का आकार लगभग एक मिलियन पैरामीटर तक पहुँच गया, तो रोबोट के प्रदर्शन में कोई महत्वपूर्ण सुधार नहीं हुआ; उस बिंदु के आगे अधिक कंप्यूटिंग शक्ति जोड़ने से मिलने वाला लाभ कम होता गया। इसके विपरीत, जब मॉडल को एक चौथाई मिलियन पैरामीटर से कम कर दिया गया, तो रोबोट की कार्य करने की क्षमता ढह गई, विशेष रूप से अधिक जटिल, लंबी अवधि के कार्यों पर। यह सुझाव देता है कि इस विशिष्ट सेट की चुनौतियों के लिए, रोबोट को एक विशाल मस्तिष्क की आवश्यकता नहीं है; उसे केवल एक छोटे, कुशल मस्तिष्क की आवश्यकता है।

अध्ययन ने यह भी उजागर किया कि रोबोट के मस्तिष्क के कौन से हिस्से वास्तव में महत्वपूर्ण हैं। शोधकर्ताओं ने मॉडल को व्यवस्थित करने के विभिन्न तरीकों का परीक्षण किया और पाया कि सबसे महत्वपूर्ण संसाधन वह हिस्सा था जो दृश्य जानकारी को संसाधित करता है—रोबोट की "आंखें"। यदि उन्होंने विजुअल सिस्टम से बहुत अधिक क्षमता छीन ली, तो रोबोट विफल हो गया, चाहे गतिविधियों की योजना बनाने वाले हिस्से के पास कितनी भी शक्ति बची हो। उन्होंने यह भी खोजा कि चिकनी, तरल गति उत्पन्न करने के लिए अक्सर उपयोग की जाने वाली जटिल गणितीय विधियों की इस स्तर के प्रदर्शन के लिए आवश्यकता नहीं थी। गतिविधियों की गणना करने की एक सरल, तेज़ विधि भी उतनी ही अच्छी तरह काम करती थी और इसने रोबोट को एक सेकंड के अंश में निर्णय लेने की अनुमति दी।

शायद सबसे उल्लेखनीय खोज यह थी कि रोबोट निर्देशों को कैसे समझता था। बड़े मॉडलों में, रोबोट "कप उठाओ" जैसा वाक्य पढ़ता है और शब्दों के अर्थ को समझने की कोशिश करता है। इस छोटे मॉडल में, शोधकर्ताओं ने भाषा को एक सरल संख्या कोड से बदल दिया। जब उन्होंने इन कोडों को उलट-पुलट दिया ताकि रोबोट को किसी कार्य के लिए गलत नंबर दिया गया, तो रोबोट की सफलता दर शून्य के करीब गिर गई। इसने सिद्ध किया कि इस विशिष्ट बेंचमार्क पर, रोबोट वास्तव में सामान्य अर्थ में भाषा को "समझ" नहीं रहा था; वह केवल यह याद कर रहा था कि कौन सा दृश्य पैटर्न किस संख्या कोड से मेल खाता है। निर्देश केवल एक विशिष्ट याद किए गए व्यवहार को अनलॉक करने वाली एक कुंजी मात्र थी।

यह अंतर रोबोट बनाने और उपयोग करने के तरीके के लिए गहरे निहितार्थ रखता है। शोधकर्ताओं ने दिखाया कि इस बेंचमार्क पर विशाल मॉडलों द्वारा रिपोर्ट की गई उच्च सफलता दर काफी हद तक इस बात का माप है कि रोबोट ने विशिष्ट कार्यों को कितनी अच्छी तरह से याद किया है, न कि यह कि वह नई स्थितियों में कितनी अच्छी तरह सामान्यीकरण (जनरलाइजेशन) कर सकता है। जब उन्होंने इन छोटे मॉडलों का कार्यों के विविध रूपों के विरुद्ध परीक्षण किया—जैसे कि प्रकाश व्यवस्था, पृष्ठभूमि या वस्तुओं के आकार को बदलना—तो सफलता दर नाटकीय रूप से गिर गई, जिससे पता चला कि मॉडलों ने दुनिया के अंतर्निहित भौतिक विज्ञान को नहीं सीखा था, बल्कि केवल प्रशिक्षण कार्यों के विशिष्ट स्वरूप को सीखा था। हालाँकि, एक रोबोट के लिए जो हर दिन उन्हीं चालीस कार्यों को करने के लिए तैनात किया जाता है, यह याद रखना (मेमोराइजेशन) बिल्कुल वही है जिसकी आवश्यकता होती है।

इस शोध का व्यावहारिक परिणाम एक अत्यंत कुशल रोबोट नीति है। 0.54 मिलियन पैरामीटर वाला मॉडल बिना किसी विशेष ग्राफिक्स कार्ड के एक मानक लैपटॉप कंप्यूटर पर चल सकता है, और दस मिलीसेकंड से भी कम समय में निर्णय ले सकता है। यह वर्तमान अत्याधुनिक (स्टेट-ऑफ-द-आर्ट) मॉडलों की तुलना में सैकड़ों गुना तेज़ है, जो अक्सर एक एकल चाल की योजना बनाने में सेकंडों का समय लेते हैं। यह सिद्ध करके कि एक छोटा, विशिष्ट मॉडल मानक बेंचमार्क को हल कर सकता है, शोधकर्ताओं ने दिखाया है कि व्यावहारिक, किफायती रोबोटों का मार्ग आवश्यक रूप से और भी बड़े मस्तिष्क बनाने की आवश्यकता नहीं रखता है। इसके बजाय, इसके लिए सबसे छोटे, सबसे कुशल मस्तिष्क को खोजने की आवश्यकता है जो विशिष्ट कार्य के अनुकूल हो, एक ऐसी खोज जो रोबोट को घरों और कारखानों में तैनात करने की अनुमति दे सकती है जहाँ स्थान, शक्ति और लागत सीमित है। अध्ययन यह दावा नहीं करता है कि ये छोटे मॉडल खुले अन्वेषण के लिए आवश्यक बड़े, सामान्य-उद्देश्य वाले सिस्टम की जगह ले सकते हैं, लेकिन यह दृढ़ता से स्थापित करता है कि एक निश्चित सेट के कार्यों के लिए, आवश्यक क्षमता पहले के विश्वास की तुलना में बहुत कम है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →