Revisiting Embodied Chain-of-Thought for Generalizable Robot Manipulation
यह शोध पत्र ERVLA को प्रस्तुत करता है, जो एक विजन-लैंग्वेज-एक्शन मॉडल है जो ऑटोरिग्रेसिव इन्फरेंस (autoregressive inference) के बजाय रिप्रेजेंटेशन-शेपिंग सुपरविजन (representation-shaping supervision) के लिए एक बड़े पैमाने के एम्बॉडीड चेन-ऑफ-थॉट कॉर्पस का लाभ उठाता है, जिससे रोबोटिक मैनिपुलेशन कार्यों में अत्याधुनिक सामान्यीकरण और स्थिरता प्राप्त होती है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को घर के काम करना सिखा रहे हैं, जैसे कि एक खिलौना कार को दराज में रखना। अतीत में, वैज्ञानिकों ने रोबोट को सिखाने के लिए उन्हें एक "दिमाग" (एक विजन-लैंग्वेज मॉडल) दिया जो चित्रों और शब्दों को समझ सके, और एक "हाथ" (एक एक्शन मॉडल) जो उन्हें हिला सके। लेकिन अक्सर, दिमाग भ्रमित हो जाता था, और हाथ लड़खड़ा जाता था।
यह पेपर एक नया तरीका पेश करता है जिससे रोबोट को सिखाया जाता है जिसे ERVLA (एम्बोडेड रीजनिंग विजन-लैंग्वेज-एक्शन) कहा जाता है। यहाँ बताया गया है कि उन्होंने इसे सरल तरीके से कैसे किया।
1. समस्या: वह रोबोट जो बहुत ज्यादा बोलता है (और बहुत धीरे)
कल्पना कीजिए कि आप कार चला रहे हैं, और आपका जीपीएस आपको हर मोड़ लेने से पहले ही बता देता है। "100 फीट में, बाएं मुड़ें। अब, बाएं मुड़ें। अब, बाएं मुड़ें।" यदि जीपीएस पहले वाक्य में एक छोटी सी गलती करता है, तो बाकी के निर्देश गड़बड़ा जाते हैं, और आप दुर्घटनाग्रस्त हो जाते हैं।
यही पहले के रोबोट "सोचने" के तरीकों (जिन्हें एम्बोडेड चेन-ऑफ-थॉट कहा जाता है) के साथ होता था। रोबोट को अपना हाथ हिलाने से पहले "ज़ोर से सोचने" (एक लंबा टेक्स्ट प्लान लिखने) के लिए मजबूर किया जाता था।
- समस्या: यदि रोबोट अपने प्लान में एक गलत वाक्य लिख देता था, तो पूरा प्लान विफल हो जाता था। यह धीमा था, और एक छोटी सी त्रुटि पूरे कार्य को बर्बाद कर देती थी।
- पेपर की खोज: उन्होंने पाया कि रोबोट को अधिक "बोलने" से वह अधिक स्मार्ट नहीं बनता है। वास्तव में, उसे हिलने से पहले एक लंबा प्लान लिखने के लिए मजबूर करने से वह अक्सर और भी खराब हो जाता है।
2. समाधान: करने के दौरान "सोचना", न कि पहले
लेखकों ने महसूस किया कि रोबोट को स्मार्ट होने के लिए अपने विचारों को ज़ोर से बोलने की ज़रूरत नहीं है। उसे बस अपने हिलते समय अपने दिमाग के अंदर उन विचारों को रखने की ज़रूरत है।
इसे एक मास्टर शेफ (कुशल रसोइया) की तरह समझें। एक नौसिखिया शेफ खाना पकाने से पहले कागज पर चरण-दर-चरण रेसिपी लिख सकता है। एक मास्टर शेफ कुछ भी नहीं लिखता; वह बस जानता है कि क्या करना है क्योंकि उसने चरणों का इतना अभ्यास किया है। उनकी "सोच" उनके मसल मेमोरी (पेशी स्मृति) में बसी होती है।
ERVLA रोबोट को मास्टर शेफ की तरह बनना सिखाता है:
- प्रशिक्षण (The Training): उन्होंने रोबोट को 978,000 रोबोटिक मूवमेंट्स की एक विशाल लाइब्रेरी दी (जैसे एक विशाल कुकबुक)।
- ट्रिक: उन्होंने रोबोट को एक ही समय में "रेसिपी" (प्लान) और "एक्शन" (मूवमेंट) को पढ़ने के लिए प्रशिक्षित किया।
- सीक्रेट सॉस (रीजनिंग ड्रॉपआउट): कभी-कभी, प्रशिक्षण के दौरान, उन्होंने रोबोट को बताया, "इस बार रेसिपी मत लिखो, बस मूव करो!" इसने रोबोट को बिना लिखे ही कार्य को समझने का तरीका सीखने के लिए मजबूर किया। उसने तर्क (reasoning) को आत्मसात करना सीख लिया।
3. "CoT कंटैमिनेशन" की समस्या
इस पेपर ने एक छिपे हुए जाल के बारे में भी बताया। जब उन्होंने कंप्यूटरों का उपयोग करके रोबोट के लिए स्वचालित रूप से ये "रेसिपी" लिखीं, तो कभी-कभी कंप्यूटरों ने गलतियाँ कीं (जैसे यह कहना कि कप गलत जगह पर है)।
- यदि रोबोट इन गलत रेसिपी को याद करने की कोशिश करता, तो वह भ्रमित हो जाता। इसे CoT कंटैमिनेशन कहा जाता है।
- समाधान: उन्होंने रोबोट को उन रेसिपी के हिस्सों को अनदेखा करना सिखाया जो संदिग्ध या अविश्वसनीय लग रहे थे, और केवल स्पष्ट, ठोस निर्देशों पर ध्यान केंद्रित किया।
4. परिणाम: एक रोबोट जो वास्तव में काम करता है
उन्होंने इस नए रोबोट (ERVLA) का दो तरीकों से परीक्षण किया:
- सिम्युलेटर में (वीडियो गेम): यह अपने विशिष्ट परीक्षणों में दुनिया का सर्वश्रेष्ठ रोबोट बन गया, जिसने सभी पिछले मॉडलों को पीछे छोड़ दिया। यह उन कठिन स्थितियों को संभाल सका जहाँ रोशनी बदल रही थी या वस्तुओं को हिलाया जा रहा था।
- वास्तविक दुनिया में: उन्होंने इसे एक वास्तविक भौतिक रोबोटिक आर्म पर लगाया।
- जब "उस चीज़ को रख दो जो फल नहीं है" (एक कठिन, अस्पष्ट निर्देश) के लिए कहा गया, तो अन्य रोबोट भ्रमित हो गए। ERVLA ने तर्क को समझा और इसे कर दिखाया।
- जब इसे एक लंबे, बहु-चरणीय कार्य (जैसे पूरी मेज साफ करना) के लिए कहा गया, तो ERVLA ने धैर्य बनाए रखा और काम पूरा किया, जबकि अन्य हार मान गए या भटक गए।
सारांश उपमा (Summary Analogy)
- पुराना तरीका: रोबोट एक छात्र है जिसे एक भी कदम उठाने से पहले 10 पन्नों का निबंध लिखना पड़ता है। यदि वह निबंध में एक शब्द भी गलत लिख देता है, तो वह फेल हो जाता है।
- ERVLA का तरीका: रोबोट एक अनुभवी एथलीट है। उसने इतना अभ्यास किया है कि वह गेम प्लान को तुरंत समझ जाता है। उसे खेलने के तरीके को जानने के लिए निबंध लिखने की आवश्यकता नहीं है; रणनीति उसके मूवमेंट्स में ही समाहित है।
मुख्य बात: यह पेपर दिखाता है कि रोबोटों के स्मार्ट होने के लिए, उन्हें हर कार्य के माध्यम से "बोलने" के लिए मजबूर नहीं किया जाना चाहिए। इसके बजाय, उन्हें कार्य के लॉजिक को आत्मसात करने के लिए प्रशिक्षित किया जाना चाहिए ताकि उनके कार्य स्वाभाविक रूप से सही पथ का अनुसरण करें, भले ही निर्देश अस्पष्ट हों या दुनिया अस्त-व्यस्त हो। उन्होंने इस विशाल "कुकबुक" (डेटासेट) और रोबोट के "दिमाग" (मॉडल) को दूसरों के उपयोग के लिए भी जारी किया है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।