CaP-X: A Framework for Benchmarking and Improving Coding Agents for Robot Manipulation
यह शोध पत्र CaP-X को प्रस्तुत करता है, जो CaP-Gym वातावरण और CaP-Bench बेंचमार्क से युक्त एक व्यापक ढांचा है, जो यह प्रदर्शित करता है कि हालांकि Code-as-Policy एजेंट शुरू में मानव-निर्मित अमूर्तता (abstractions) पर भारी निर्भर होते हैं, लेकिन टेस्ट-टाइम स्केलिंग रणनीतियों और सत्यापन योग्य पुरस्कारों (verifiable rewards) के साथ सुदृढीकरण लर्निंग (reinforcement learning) के माध्यम से रोबोटिक हेरफेर कार्यों में उनकी मजबूती और मानव-स्तर का प्रदर्शन प्राप्त करने की क्षमता को महत्वपूर्ण रूप से बढ़ाया जा सकता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को सैंडविच बनाना सिखाना चाहते हैं। आपके पास इसे करने के दो मुख्य तरीके हैं:
"ब्लैक बॉक्स" वाला तरीका (वर्तमान मानक): आप रोबोट को लोगों के सैंडविच बनाने के लाखों वीडियो खिलाते हैं। रोबोट पैटर्न मैचिंग के जरिए सीखता है, जैसे कोई तोता गाना दोहरा रहा हो। यह तब बहुत अच्छा काम करता है जब ब्रेड ठीक उसी जगह पर हो जहाँ वह उम्मीद करता है, लेकिन अगर आप ब्रेड को थोड़ा हिला दें या उससे किसी अलग तरह का सैंडविच बनाने को कहें, तो वह भ्रमित हो जाता है और रुक जाता है। यह उस छात्र की तरह है जिसने किसी विशिष्ट परीक्षा के उत्तर रट लिए हैं लेकिन वह नई समस्या को हल नहीं कर सकता।
"प्रोग्रामर" वाला तरीका (इस पेपर का विचार): रोबोट को वीडियो दिखाने के बजाय, आप उसे एक ऐसा दिमाग देते हैं जो कोड लिखना जानता है। आप उसे कहते हैं, "यहाँ बुनियादी चालों (पकड़ना, उठाना, हिलाना) का एक टूलबॉक्स है, और यहाँ लक्ष्य है। अपने निर्देश खुद लिखो।" यह Code-as-Policy दृष्टिकोण है।
CaP-X शोधकर्ताओं द्वारा बनाया गया एक नया "जिम" और "परीक्षा" है जो यह परीक्षण करता है कि इन रोबोट-प्रोग्रामर दिमागों में कितनी कुशलता है।
यहाँ उनके निष्कर्षों का विवरण दिया गया है, जिसे कुछ मजेदार उपमाओं (analogies) का उपयोग करके समझाया गया है:
1. समस्या: "ट्रेनिंग व्हील्स" का जाल
शोधकर्ताओं ने पाया कि जब उन्होंने रोबोटों को "ट्रेनिंग व्हील्स" (उच्च-स्तरीय, पूर्व-लिखित निर्देश जैसे stack_objects()) दिए, तो रोबोटों ने बहुत अच्छा काम किया। लेकिन जैसे ही उन्होंने ट्रेनिंग व्हील्स हटा दिए और रोबोटों से केवल कच्चे, बुनियादी उपकरणों (जैसे move_arm_to_coordinate(x,y,z)) का उपयोग करने को कहा, रोबोट पूरी तरह विफल हो गए।
- उपमा: यह उस छात्र की तरह है जो गणित की समस्या हल कर सकता है यदि शिक्षक उन्हें एक विशिष्ट फॉर्मूला दे दे जिसमें उन्हें नंबर भरने हों। लेकिन यदि आप उनसे शून्य से फॉर्मूला निकालने के लिए कहें, तो वे घबरा जाते हैं। रोबलेट "मानवीय मचान" (human scaffolding) पर निर्भर थे, न कि वास्तव में कार्य को समझने पर।
2. समाधान: "स्विस आर्मी नाइफ" एजेंट
यह पेपर CaP-Agent0 पेश करता है, जो एक ढांचा (framework) है जो इन रोबोटों को आत्मनिर्भर बनाना सिखाता है। केवल एक स्क्रिप्ट लिखने और सफल होने की उम्मीद करने के बजाय, यह एजेंट कुछ चतुर तरकीबों का उपयोग करता है:
- "विजुअल ट्रांसलेटर" (VDM): रोबोट चित्र देखकर यह समझने में खराब होते हैं कि क्या बदला है। इसलिए, CaP-Agent0 एक "अनुवादक" का उपयोग करता है जो कैमरा फीड को देखता है और एक सरल टेक्स्ट रिपोर्ट लिखता है: "लाल ब्लॉक अब मेज पर है, लेकिन नीला ब्लॉक अभी भी फर्श पर है।" यह एक भ्रमित करने वाली छवि को स्पष्ट टेक्स्ट में बदल देता है जिसके साथ रोबोट तर्क कर सके।
- "स्किल लाइब्रेरी" (Auto-Synthesis): जब रोबोट सफलतापूर्वक कुछ कठिन करता है (जैसे ब्लॉक को स्टैक करना), तो वह उस विशिष्ट कोड अनुक्रम को अपने टूलबॉक्स में एक नए "टूल" के रूप में सहेज लेता है। अगली बार, उसे पहिये का पुनरुत्पादन करने की आवश्यकता नहीं होती; वह बस उस टूल को उठा लेता है। यह एक बढ़ई की तरह है जो, एक आदर्श कुर्सी बनाने के बाद, अगली बार के लिए अपने टूलबॉक्स में "कुर्सी बनाओ" बटन जोड़ देता है।
- "विशेषज्ञों की परिषद" (Ensemble Reasoning): एक AI से कोड लिखने के लिए कहने के बजाय, CaP-Agent0 तीन अलग-अलग AI को तीन अलग-अलग समाधान लिखने के लिए कहता है। फिर, एक "जज" AI उन तीनों को देखता है, प्रत्येक के सबसे अच्छे हिस्सों को चुनता है, और उन्हें एक पूर्ण योजना में मिला देता है। यह एक समिति की बैठक की तरह है जहाँ निर्माण शुरू होने से पहले हर कोई पुल बनाने के सबसे अच्छे तरीके पर बहस करता है।
3. परिणाम: "नौसिखिए" से "ग्रैंडमास्टर" तक
इन तरकीबों का उपयोग करके, शोधकर्ताओं ने पाया कि उनका एजेंट बिना किसी विशिष्ट प्रशिक्षण डेटा के भी लगभग एक मानव विशेषज्ञ के समान प्रदर्शन कर सकता है।
- "वास्तविक दुनिया" का परीक्षण: उन्होंने इसे वास्तविक रोबोटों पर परखा (केवल सिमुलेशन में नहीं)। एक कप के नीचे छिपी हुई वस्तु को खोजने (एक "भूसे के ढेर में सुई" वाला कार्य) या भौतिक ब्लॉकों का उपयोग करके गणित की समस्या हल करने के लिए कहे जाने पर, रोबोट ने केवल अनुमान नहीं लगाया। उसने देखा, सोचा, अपना हाथ चलाने के लिए कोड लिखा, जांचा कि क्या यह काम कर रहा है, और यदि यह विफल हुआ, तो उसने एक अलग कोण से प्रयास करने के लिए नया कोड लिखा।
- "रीइन्फोर्समेंट लर्निंग" का बढ़ावा: उन्होंने यह भी दिखाया कि यदि आप रोबोट को सिमुलेशन में अभ्यास करने देते हैं और हर बार सफल होने पर उसे एक "गोल्ड स्टार" (पुरस्कार) देते हैं, तो वह और भी बेहतर हो जाता है। सबसे अच्छी बात? वीडियो गेम (सिमुलेशन) में जो कौशल उसने सीखे, वे बिना कुछ दोबारा सीखे पूरी तरह से वास्तविक रोबोट पर स्थानांतरित हो गए।
बड़ी तस्वीर
CaP-X साबित करता है कि रोबोटिक्स का भविष्य केवल रोबोटों को याद करने के लिए अधिक डेटा खिलाने के बारे में नहीं है। यह उन्हें सोचने, निर्देश लिखने और अपनी गलतियों को सुधारने (debug) की क्षमता देने के बारे में है।
इसे इस तरह सोचें:
- पुराना तरीका: एक डांसर का वीडियो बार-बार दिखाकर रोबोट को डांस करना सिखाना।
- CaP-X तरीका: रोबोट को डांस के स्टेप्स सिखाना, फिर उसे पेन और कागज थमाना और कहना, "तुम इस नए गाने के लिए कोरियोग्राफी खुद तय करो।"
पेपर दिखाता है कि सही उपकरणों (विजुअल ट्रांसलेशन, स्किल लाइब्रेरी, और टीम रीजनिंग) के साथ, रोबोट वास्तव में खुद कोरियोग्राफी का पता लगा सकते हैं, जिससे वे अधिक अनुकूलन योग्य (adaptable) बन जाते हैं, जो वास्तविक दुनिया की अव्यवस्थित और अप्रत्याशित स्थितियों के लिए आवश्यक है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।