← नवीनतम पेपर
💻 computer science

CaP-X: A Framework for Benchmarking and Improving Coding Agents for Robot Manipulation

यह शोध पत्र CaP-X को प्रस्तुत करता है, जो CaP-Gym वातावरण और CaP-Bench बेंचमार्क से युक्त एक व्यापक ढांचा है, जो यह प्रदर्शित करता है कि हालांकि Code-as-Policy एजेंट शुरू में मानव-निर्मित अमूर्तता (abstractions) पर भारी निर्भर होते हैं, लेकिन टेस्ट-टाइम स्केलिंग रणनीतियों और सत्यापन योग्य पुरस्कारों (verifiable rewards) के साथ सुदृढीकरण लर्निंग (reinforcement learning) के माध्यम से रोबोटिक हेरफेर कार्यों में उनकी मजबूती और मानव-स्तर का प्रदर्शन प्राप्त करने की क्षमता को महत्वपूर्ण रूप से बढ़ाया जा सकता है।

मूल लेखक: Max Fu, Justin Yu, Karim El-Refai, Ethan Kou, Haoru Xue, Huang Huang, Wenli Xiao, Guanzhi Wang, Fei-Fei Li, Guanya Shi, Jiajun Wu, Shankar Sastry, Yuke Zhu, Ken Goldberg, Linxi "Jim" Fan

प्रकाशित 2026-03-25
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Max Fu, Justin Yu, Karim El-Refai, Ethan Kou, Haoru Xue, Huang Huang, Wenli Xiao, Guanzhi Wang, Fei-Fei Li, Guanya Shi, Jiajun Wu, Shankar Sastry, Yuke Zhu, Ken Goldberg, Linxi "Jim" Fan

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को सैंडविच बनाना सिखाना चाहते हैं। आपके पास इसे करने के दो मुख्य तरीके हैं:

  1. "ब्लैक बॉक्स" वाला तरीका (वर्तमान मानक): आप रोबोट को लोगों के सैंडविच बनाने के लाखों वीडियो खिलाते हैं। रोबोट पैटर्न मैचिंग के जरिए सीखता है, जैसे कोई तोता गाना दोहरा रहा हो। यह तब बहुत अच्छा काम करता है जब ब्रेड ठीक उसी जगह पर हो जहाँ वह उम्मीद करता है, लेकिन अगर आप ब्रेड को थोड़ा हिला दें या उससे किसी अलग तरह का सैंडविच बनाने को कहें, तो वह भ्रमित हो जाता है और रुक जाता है। यह उस छात्र की तरह है जिसने किसी विशिष्ट परीक्षा के उत्तर रट लिए हैं लेकिन वह नई समस्या को हल नहीं कर सकता।

  2. "प्रोग्रामर" वाला तरीका (इस पेपर का विचार): रोबोट को वीडियो दिखाने के बजाय, आप उसे एक ऐसा दिमाग देते हैं जो कोड लिखना जानता है। आप उसे कहते हैं, "यहाँ बुनियादी चालों (पकड़ना, उठाना, हिलाना) का एक टूलबॉक्स है, और यहाँ लक्ष्य है। अपने निर्देश खुद लिखो।" यह Code-as-Policy दृष्टिकोण है।

CaP-X शोधकर्ताओं द्वारा बनाया गया एक नया "जिम" और "परीक्षा" है जो यह परीक्षण करता है कि इन रोबोट-प्रोग्रामर दिमागों में कितनी कुशलता है।

यहाँ उनके निष्कर्षों का विवरण दिया गया है, जिसे कुछ मजेदार उपमाओं (analogies) का उपयोग करके समझाया गया है:

1. समस्या: "ट्रेनिंग व्हील्स" का जाल

शोधकर्ताओं ने पाया कि जब उन्होंने रोबोटों को "ट्रेनिंग व्हील्स" (उच्च-स्तरीय, पूर्व-लिखित निर्देश जैसे stack_objects()) दिए, तो रोबोटों ने बहुत अच्छा काम किया। लेकिन जैसे ही उन्होंने ट्रेनिंग व्हील्स हटा दिए और रोबोटों से केवल कच्चे, बुनियादी उपकरणों (जैसे move_arm_to_coordinate(x,y,z)) का उपयोग करने को कहा, रोबोट पूरी तरह विफल हो गए।

  • उपमा: यह उस छात्र की तरह है जो गणित की समस्या हल कर सकता है यदि शिक्षक उन्हें एक विशिष्ट फॉर्मूला दे दे जिसमें उन्हें नंबर भरने हों। लेकिन यदि आप उनसे शून्य से फॉर्मूला निकालने के लिए कहें, तो वे घबरा जाते हैं। रोबलेट "मानवीय मचान" (human scaffolding) पर निर्भर थे, न कि वास्तव में कार्य को समझने पर।

2. समाधान: "स्विस आर्मी नाइफ" एजेंट

यह पेपर CaP-Agent0 पेश करता है, जो एक ढांचा (framework) है जो इन रोबोटों को आत्मनिर्भर बनाना सिखाता है। केवल एक स्क्रिप्ट लिखने और सफल होने की उम्मीद करने के बजाय, यह एजेंट कुछ चतुर तरकीबों का उपयोग करता है:

  • "विजुअल ट्रांसलेटर" (VDM): रोबोट चित्र देखकर यह समझने में खराब होते हैं कि क्या बदला है। इसलिए, CaP-Agent0 एक "अनुवादक" का उपयोग करता है जो कैमरा फीड को देखता है और एक सरल टेक्स्ट रिपोर्ट लिखता है: "लाल ब्लॉक अब मेज पर है, लेकिन नीला ब्लॉक अभी भी फर्श पर है।" यह एक भ्रमित करने वाली छवि को स्पष्ट टेक्स्ट में बदल देता है जिसके साथ रोबोट तर्क कर सके।
  • "स्किल लाइब्रेरी" (Auto-Synthesis): जब रोबोट सफलतापूर्वक कुछ कठिन करता है (जैसे ब्लॉक को स्टैक करना), तो वह उस विशिष्ट कोड अनुक्रम को अपने टूलबॉक्स में एक नए "टूल" के रूप में सहेज लेता है। अगली बार, उसे पहिये का पुनरुत्पादन करने की आवश्यकता नहीं होती; वह बस उस टूल को उठा लेता है। यह एक बढ़ई की तरह है जो, एक आदर्श कुर्सी बनाने के बाद, अगली बार के लिए अपने टूलबॉक्स में "कुर्सी बनाओ" बटन जोड़ देता है।
  • "विशेषज्ञों की परिषद" (Ensemble Reasoning): एक AI से कोड लिखने के लिए कहने के बजाय, CaP-Agent0 तीन अलग-अलग AI को तीन अलग-अलग समाधान लिखने के लिए कहता है। फिर, एक "जज" AI उन तीनों को देखता है, प्रत्येक के सबसे अच्छे हिस्सों को चुनता है, और उन्हें एक पूर्ण योजना में मिला देता है। यह एक समिति की बैठक की तरह है जहाँ निर्माण शुरू होने से पहले हर कोई पुल बनाने के सबसे अच्छे तरीके पर बहस करता है।

3. परिणाम: "नौसिखिए" से "ग्रैंडमास्टर" तक

इन तरकीबों का उपयोग करके, शोधकर्ताओं ने पाया कि उनका एजेंट बिना किसी विशिष्ट प्रशिक्षण डेटा के भी लगभग एक मानव विशेषज्ञ के समान प्रदर्शन कर सकता है।

  • "वास्तविक दुनिया" का परीक्षण: उन्होंने इसे वास्तविक रोबोटों पर परखा (केवल सिमुलेशन में नहीं)। एक कप के नीचे छिपी हुई वस्तु को खोजने (एक "भूसे के ढेर में सुई" वाला कार्य) या भौतिक ब्लॉकों का उपयोग करके गणित की समस्या हल करने के लिए कहे जाने पर, रोबोट ने केवल अनुमान नहीं लगाया। उसने देखा, सोचा, अपना हाथ चलाने के लिए कोड लिखा, जांचा कि क्या यह काम कर रहा है, और यदि यह विफल हुआ, तो उसने एक अलग कोण से प्रयास करने के लिए नया कोड लिखा।
  • "रीइन्फोर्समेंट लर्निंग" का बढ़ावा: उन्होंने यह भी दिखाया कि यदि आप रोबोट को सिमुलेशन में अभ्यास करने देते हैं और हर बार सफल होने पर उसे एक "गोल्ड स्टार" (पुरस्कार) देते हैं, तो वह और भी बेहतर हो जाता है। सबसे अच्छी बात? वीडियो गेम (सिमुलेशन) में जो कौशल उसने सीखे, वे बिना कुछ दोबारा सीखे पूरी तरह से वास्तविक रोबोट पर स्थानांतरित हो गए।

बड़ी तस्वीर

CaP-X साबित करता है कि रोबोटिक्स का भविष्य केवल रोबोटों को याद करने के लिए अधिक डेटा खिलाने के बारे में नहीं है। यह उन्हें सोचने, निर्देश लिखने और अपनी गलतियों को सुधारने (debug) की क्षमता देने के बारे में है।

इसे इस तरह सोचें:

  • पुराना तरीका: एक डांसर का वीडियो बार-बार दिखाकर रोबोट को डांस करना सिखाना।
  • CaP-X तरीका: रोबोट को डांस के स्टेप्स सिखाना, फिर उसे पेन और कागज थमाना और कहना, "तुम इस नए गाने के लिए कोरियोग्राफी खुद तय करो।"

पेपर दिखाता है कि सही उपकरणों (विजुअल ट्रांसलेशन, स्किल लाइब्रेरी, और टीम रीजनिंग) के साथ, रोबोट वास्तव में खुद कोरियोग्राफी का पता लगा सकते हैं, जिससे वे अधिक अनुकूलन योग्य (adaptable) बन जाते हैं, जो वास्तविक दुनिया की अव्यवस्थित और अप्रत्याशित स्थितियों के लिए आवश्यक है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →