Revisiting the "Push-T" Robot Manipulation Task with Agentic Robotics
यह शोध पत्र प्रदर्शित करता है कि एक LLM-आधारित एजेंटिक कोडिंग सिस्टम बिना किसी मानवीय प्रदर्शन के, सिमुलेशन मैकेनिक्स को पुनरावृत्ति से सीखकर, स्वायत्त रूप से पुश-टी (Push-T) मैनिपुलेशन बेंचमार्क और इसके वर्णमाला विस्तार (alphabet extensions) को हल कर सकता है, और अंततः सफलता दर और स्टेप दक्षता दोनों में पारंपरिक विज़ुओमोटर इमिटेशन लर्निंग पॉलिसियों को पीछे छोड़ देता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
रोबोटिक्स के उस शांत कोने में जहाँ मशीनें हिलना-डुलना सीखती हैं, एक सरल लेकिन जिद्दी चुनौती है: एक रोबोट को किसी वस्तु को पकड़े बिना उसे एक विशिष्ट स्थान पर धकेलने के लिए तैयार करना। कल्पना कीजिए कि एक मेज पर टी-आकार (T-shaped) का एक ब्लॉक रखा है। एक रोबोटिक हाथ को उसे केवल एक संपर्क बिंदु का उपयोग करके तब तक धकेलना है, जब तक कि वह एक सटीक दिशा में न पहुँच जाए। इस कार्य को, जिसे 'पुश-टी' (Push-T) कहा जाता है, आर्टिफिशियल इंटेलिजेंस के लिए एक मानक परीक्षण बना दिया गया है। वर्षों तक, इसे हल करने का प्रचलित तरीका 'इमिटेशन लर्निंग' (imitation learning) रहा है, जहाँ एक रोबोट इंसानों के ब्लॉक को धकेलने के सैकड़ों वीडियो देखता है और उनके आंदोलनों की नकल करने की कोशिश करता है। यह दृष्टिकोण काम तो करता है, लेकिन इसके लिए मानव डेटा की विशाल मात्रा की आवश्यकता होती है और यह अक्सर एक ऐसा रोबोट तैयार करता है जो नकल करने में तो अच्छा है, लेकिन जरूरी नहीं कि वह इस बात की भौतिक समझ रखता हो कि एक धक्का क्यों काम करता है। एक नया विचार उभर रहा है: बजाय इसके कि हम रोबोट को उदाहरण दिखाकर सिखाएं, क्या हम एक कंप्यूटर प्रोग्राम को समस्या के बारे में तर्क देकर अपने स्वयं के निर्देश लिखने के लिए सिखा सकते हैं?
यह प्रश्न कैलिफोर्निया विश्वविद्यालय, बर्कले के शोधकर्ताओं के एक हालिया अध्ययन के केंद्र में है। उन्होंने पुश-टी कार्य को इसलिए नहीं दोहराया कि वे किसी मानव डेटा पर रोबोट को प्रशिक्षित कर सकें, बल्कि यह देखने के लिए कि क्या एक आर्टिफिशियल इंटेलिजेंस कोडिंग एजेंट इस पहेली को शून्य से हल कर सकता है। उन्होंने एक परिष्कृत भाषा मॉडल (language model) का उपयोग किया, जो कोड लिखने और उसे सुधारने (debug) में सक्षम एक AI है, और उससे एक रोबोट के लिए कंट्रोलर बनाने को कहा। निर्देश सख्त थे: AI किसी भी सीखे हुए नीति (learned policies) या मानव प्रदर्शनों का उपयोग नहीं कर सकता था। उसे एक ऐसा प्रोग्राम लिखना था जो ब्लॉक की ज्यामिति, सतह के घर्षण और धकेलने की यांत्रिकी को समझता हो। शोधकर्ता यह जानना चाहते थे कि क्या एक मशीन एक ऐसा समाधान निकाल सकती है जो न केवल प्रभावी हो, बल्कि सर्वोत्तम मानव-अनुकूलित तरीकों से अधिक कुशल भी हो।
परिणाम एक शानदार प्रदर्शन था कि क्या होता है जब एक AI को केवल नकल करने के बजाय सोचने की स्वतंत्रता दी जाती है। कोडिंग एजेंट ने, एक सिम्युलेटेड वातावरण में काम करते हुए, अंधेरे में तीर नहीं चलाए। उसने पहले कार्य के डिजिटल सिमुलेशन को खोजा और फिर वह कोड लिखना शुरू किया जो यह वर्णन करता था कि एक रोबोट को कैसे हिलना चाहिए। उसने एक बुनियादी योजना के साथ शुरुआत की: ब्लॉक के पास जाना, उसे छूना, उसे धकेलना और फिर पीछे हट जाना। लेकिन एजेंट वहीं नहीं रुका। उसने कोड चलाया, सिमुलेशन देखा, और देखा कि रोबोट कहाँ विफल हुआ। जब ब्लॉक सही ढंग से नहीं घूम सका या दीवार से टकराकर फंस गया, तो एजेंट ने त्रुटि का विश्लेषण किया, अपने कोड में घर्षण के मापदंडों (friction parameters) को समायोजित किया, और फिर से प्रयास किया। लिखने, परीक्षण करने और सुधारने का यह चक्र बार-बार चलता रहा। एजेंट ने ब्लॉक के हिलने-डुलने के तरीके का एक आंतरिक मॉडल बनाया, यह सीखते हुए कि ब्लॉक के केंद्र से धकेलने पर वह आगे बढ़ता है, जबकि किनारे से धकेलने पर वह घूमने लगता है।
स्वयं-सुधार के कई दौरों के बाद, एजेंट ने एक ऐसा समाधान प्रस्तुत किया जिसने मानक तरीकों को पछाड़ दिया। दो सौ अलग-अलग शुरुआती स्थितियों वाले एक परीक्षण में, AI द्वारा लिखे गए कोड ने शत-प्रतिशत सफलता दर हासिल की, जिसने हर बार ब्लॉक को लक्ष्य तक पहुँचाया। इसकी तुलना में, दो सौ मानव प्रदर्शनों पर प्रशिक्षित एक अत्याधुनिक रोबोट पॉलिसी केवल लगभग बासठ प्रतिशत समय सफल रही। AI का समाधान न केवल अधिक विश्वसनीय था; बल्कि वह अधिक कुशल भी था। मानव-प्रशिक्षित रोबोट ने कार्य पूरा करने में औसतन दो सौ से अधिक कदम उठाए, जबकि AI के प्रोग्राम ने इसे लगभग एक सौ बीस कदमों में पूरा किया। इसने कम अलग-अलग धक्कों की भी आवश्यकता महसूस की, जो प्रति कार्य औसतन चार से भी कम थे, जबकि मानव-प्रशिक्षित मॉडल के लिए यह संख्या छह से अधिक थी। AI ने मानव के 'ट्रायल एंड एरर' (trial and error) की नकल करने के बजाय धक्के की यांत्रिकी को समझकर लक्ष्य तक पहुँचने का अधिक सीधा रास्ता खोज लिया था।
शोधकर्ताओं ने फिर सीमाओं को और आगे बढ़ाया। उन्होंने एजेंट को न केवल टी-आकार, बल्कि वर्णमाला के हर अक्षर को हल करने के लिए कहा, 'A' से लेकर 'Z' तक। प्रत्येक अक्षर एक नई ज्यामितीय पहेली पेश करता था, जिसमें अलग-अलग वक्र (curves), कोने और संतुलन के केंद्र होते थे। एजेंट को वही निर्देश दिया गया था: मानव उदाहरणों के बिना इन आकृतियों को धकेलने के लिए कोड लिखें। AI ने अपनी रणनीति को अनुकूलित किया, एक ऐसा पाठ्यक्रम (curriculum) बनाया जहाँ उसने उन अक्षरों का अभ्यास किया जिन्हें उसने सबसे कठिन पाया। उसने 'C' के घुमावों और 'Q' के तीखे कोनों को संभालने के लिए अपनी पद्धति को समायोजित करना सीखा। अंत में, एजेंट ने सभी छब्बीस अक्षरों में लगभग निन्यानवे प्रतिशत सफलता दर हासिल की। उसने विभिन्न संपर्क बिंदुओं के बीच स्विच करके और एक ऐसी नियंत्रण रणनीति का उपयोग करके यह प्रबंधित किया जो लगातार अपनी चालों की पुनर्रचना (replanning) करती थी, जिससे यह सुनिश्चित हुआ कि वह कभी भी डेड एंड (dead end) में न फंसे।
यह सुनिश्चित करने के लिए कि यह केवल विशिष्ट सिमुलेशन का कोई चमत्कार नहीं है, शोधकर्ताओं ने AI के कोड का परीक्षण दो अलग-अलग प्रकार के सिम्युलेटेड रोबोटिक आर्म्स पर किया, जिनमें से एक फ्रैंका (Franka) आर्म पर आधारित था और दूसरा UR5 आर्म पर। वही तर्क जो टी-आकार और वर्णमाला के लिए काम आया, दोनों मशीनों के लिए भी काम कर गया। AI के प्रोग्राम ने विभिन्न रोबोटों को अक्षरों को धकेलने के लिए सफलतापूर्वक निर्देशित किया, जिससे सिद्ध हुआ कि विकसित की गई तर्क प्रक्रिया पोर्टेबल (portable) थी। इसे नए हाथ के लिए पुनः प्रशिक्षित करने की आवश्यकता नहीं थी; इसने बस संपर्क और गति की अपनी समझ को नए भौतिक रूप पर लागू किया। यह सुझाव देता है कि एजेंट ने किसी एक रोबिक के लिए विशिष्ट ट्रिक के बजाय हेरफेर के एक सामान्य सिद्धांत को सीखा था।
अध्ययन ने इस दृष्टिकोण की लागत और जटिलता पर भी प्रकाश डाला। AI एजेंट ने प्रक्रिया के दौरान कोड और विश्लेषण के लाखों शब्द उत्पन्न किए, जो स्वचालित कार्य के दो सौ घंटों से अधिक का कार्य था और कंप्यूटिंग संसाधनों की एक महत्वपूर्ण लागत थी। शोधकर्ताओं ने नोट किया कि एजेंट ने सिमुलेशन को एक आदर्श दुनिया माना, जो कि एक सीमा है। वास्तविक दुनिया में, घर्षण भिन्न हो सकता है, या कैमरा थोड़ा आउट ऑफ फोकस हो सकता है, ऐसी चीजें जिनका सिमुलेशन ने हिसाब नहीं रखा था। हालाँकि, तथ्य यह है कि एजेंट इस तरह की जटिल, बहु-चरणीय समस्या को बिना किसी मानव डेटा के हल कर सका, एक शक्तिशाली नई दिशा का संकेत देता है। यह दिखाता है कि एक AI एक शोधकर्ता के रूप में कार्य कर सकता है, अपने स्वयं के परिकल्पना (hypotheses) बना सकता है कि एक रोबोट को कैसे हिलना चाहिए, उनका परीक्षण कर सकता है, और एक समाधान खोजने तक अपनी समझ को परिष्कृत कर सकता है जो न केवल सही है, बल्कि उत्कृष्ट भी है।
यह कार्य यह दावा नहीं करता है कि रोबोट कल कारखानों में मानव श्रमिकों को बदलने के लिए तैयार हैं। सिमुलेशन आदर्शित थे, और वास्तविक दुनिया अव्यवस्थित है। लेकिन निष्कर्ष एक दृष्टिकोण में एक शांत बदलाव की पेशकश करते हैं। रोबोट को यह सिखाने के बजाय कि उन्हें क्या करना है, अब हम उन्हें यह सोचने के लिए कह सकते हैं कि वे इसे स्वयं कैसे करें। एजेंट ने केवल एक ब्लॉक को नहीं धकेला; उसने धक्के के भौतिकी के माध्यम से तर्क किया, अपनी गलतियों से सीखा, और एक बेहतर तरीका खोजा। ऐसा करके, उसने प्रदर्शित किया कि सही उपकरणों के साथ, आर्टिफिशियल इंटेलिजेंस नकल करने से आगे बढ़कर एक वास्तविक समस्या समाधानकर्ता बन सकता है, जो उन कार्यों को संभालने में सक्षम है जो मानव द्वारा हाथ से दिखाने के लिए बहुत जटिल या विविध हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।