← नवीनतम पेपर
💻 computer science

Revisiting Embodied Chain-of-Thought for Generalizable Robot Manipulation

यह शोध पत्र ERVLA को प्रस्तुत करता है, जो एक विजन-लैंग्वेज-एक्शन मॉडल है जो ऑटोरिग्रेसिव इन्फरेंस (autoregressive inference) के बजाय रिप्रेजेंटेशन-शेपिंग सुपरविजन (representation-shaping supervision) के लिए एक बड़े पैमाने के एम्बॉडीड चेन-ऑफ-थॉट कॉर्पस का लाभ उठाता है, जिससे रोबोटिक मैनिपुलेशन कार्यों में अत्याधुनिक सामान्यीकरण और स्थिरता प्राप्त होती है।

मूल लेखक: Nan Sun, Yuan Zhang, Yongkun Yang, Wentao Zhao, Peiyan Li, Jun Guo, Wenxuan Song, Pengxiang Ding, Runze Suo, Yifei Su, Xin Xiao, Xinghang Li, Huaping Liu

प्रकाशित 2026-06-03
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Nan Sun, Yuan Zhang, Yongkun Yang, Wentao Zhao, Peiyan Li, Jun Guo, Wenxuan Song, Pengxiang Ding, Runze Suo, Yifei Su, Xin Xiao, Xinghang Li, Huaping Liu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को घर के काम करना सिखा रहे हैं, जैसे कि एक खिलौना कार को दराज में रखना। अतीत में, वैज्ञानिकों ने रोबोट को सिखाने के लिए उन्हें एक "दिमाग" (एक विजन-लैंग्वेज मॉडल) दिया जो चित्रों और शब्दों को समझ सके, और एक "हाथ" (एक एक्शन मॉडल) जो उन्हें हिला सके। लेकिन अक्सर, दिमाग भ्रमित हो जाता था, और हाथ लड़खड़ा जाता था।

यह पेपर एक नया तरीका पेश करता है जिससे रोबोट को सिखाया जाता है जिसे ERVLA (एम्बोडेड रीजनिंग विजन-लैंग्वेज-एक्शन) कहा जाता है। यहाँ बताया गया है कि उन्होंने इसे सरल तरीके से कैसे किया।

1. समस्या: वह रोबोट जो बहुत ज्यादा बोलता है (और बहुत धीरे)

कल्पना कीजिए कि आप कार चला रहे हैं, और आपका जीपीएस आपको हर मोड़ लेने से पहले ही बता देता है। "100 फीट में, बाएं मुड़ें। अब, बाएं मुड़ें। अब, बाएं मुड़ें।" यदि जीपीएस पहले वाक्य में एक छोटी सी गलती करता है, तो बाकी के निर्देश गड़बड़ा जाते हैं, और आप दुर्घटनाग्रस्त हो जाते हैं।

यही पहले के रोबोट "सोचने" के तरीकों (जिन्हें एम्बोडेड चेन-ऑफ-थॉट कहा जाता है) के साथ होता था। रोबोट को अपना हाथ हिलाने से पहले "ज़ोर से सोचने" (एक लंबा टेक्स्ट प्लान लिखने) के लिए मजबूर किया जाता था।

  • समस्या: यदि रोबोट अपने प्लान में एक गलत वाक्य लिख देता था, तो पूरा प्लान विफल हो जाता था। यह धीमा था, और एक छोटी सी त्रुटि पूरे कार्य को बर्बाद कर देती थी।
  • पेपर की खोज: उन्होंने पाया कि रोबोट को अधिक "बोलने" से वह अधिक स्मार्ट नहीं बनता है। वास्तव में, उसे हिलने से पहले एक लंबा प्लान लिखने के लिए मजबूर करने से वह अक्सर और भी खराब हो जाता है।

2. समाधान: करने के दौरान "सोचना", न कि पहले

लेखकों ने महसूस किया कि रोबोट को स्मार्ट होने के लिए अपने विचारों को ज़ोर से बोलने की ज़रूरत नहीं है। उसे बस अपने हिलते समय अपने दिमाग के अंदर उन विचारों को रखने की ज़रूरत है।

इसे एक मास्टर शेफ (कुशल रसोइया) की तरह समझें। एक नौसिखिया शेफ खाना पकाने से पहले कागज पर चरण-दर-चरण रेसिपी लिख सकता है। एक मास्टर शेफ कुछ भी नहीं लिखता; वह बस जानता है कि क्या करना है क्योंकि उसने चरणों का इतना अभ्यास किया है। उनकी "सोच" उनके मसल मेमोरी (पेशी स्मृति) में बसी होती है।

ERVLA रोबोट को मास्टर शेफ की तरह बनना सिखाता है:

  • प्रशिक्षण (The Training): उन्होंने रोबोट को 978,000 रोबोटिक मूवमेंट्स की एक विशाल लाइब्रेरी दी (जैसे एक विशाल कुकबुक)।
  • ट्रिक: उन्होंने रोबोट को एक ही समय में "रेसिपी" (प्लान) और "एक्शन" (मूवमेंट) को पढ़ने के लिए प्रशिक्षित किया।
  • सीक्रेट सॉस (रीजनिंग ड्रॉपआउट): कभी-कभी, प्रशिक्षण के दौरान, उन्होंने रोबोट को बताया, "इस बार रेसिपी मत लिखो, बस मूव करो!" इसने रोबोट को बिना लिखे ही कार्य को समझने का तरीका सीखने के लिए मजबूर किया। उसने तर्क (reasoning) को आत्मसात करना सीख लिया।

3. "CoT कंटैमिनेशन" की समस्या

इस पेपर ने एक छिपे हुए जाल के बारे में भी बताया। जब उन्होंने कंप्यूटरों का उपयोग करके रोबोट के लिए स्वचालित रूप से ये "रेसिपी" लिखीं, तो कभी-कभी कंप्यूटरों ने गलतियाँ कीं (जैसे यह कहना कि कप गलत जगह पर है)।

  • यदि रोबोट इन गलत रेसिपी को याद करने की कोशिश करता, तो वह भ्रमित हो जाता। इसे CoT कंटैमिनेशन कहा जाता है।
  • समाधान: उन्होंने रोबोट को उन रेसिपी के हिस्सों को अनदेखा करना सिखाया जो संदिग्ध या अविश्वसनीय लग रहे थे, और केवल स्पष्ट, ठोस निर्देशों पर ध्यान केंद्रित किया।

4. परिणाम: एक रोबोट जो वास्तव में काम करता है

उन्होंने इस नए रोबोट (ERVLA) का दो तरीकों से परीक्षण किया:

  1. सिम्युलेटर में (वीडियो गेम): यह अपने विशिष्ट परीक्षणों में दुनिया का सर्वश्रेष्ठ रोबोट बन गया, जिसने सभी पिछले मॉडलों को पीछे छोड़ दिया। यह उन कठिन स्थितियों को संभाल सका जहाँ रोशनी बदल रही थी या वस्तुओं को हिलाया जा रहा था।
  2. वास्तविक दुनिया में: उन्होंने इसे एक वास्तविक भौतिक रोबोटिक आर्म पर लगाया।
    • जब "उस चीज़ को रख दो जो फल नहीं है" (एक कठिन, अस्पष्ट निर्देश) के लिए कहा गया, तो अन्य रोबोट भ्रमित हो गए। ERVLA ने तर्क को समझा और इसे कर दिखाया।
    • जब इसे एक लंबे, बहु-चरणीय कार्य (जैसे पूरी मेज साफ करना) के लिए कहा गया, तो ERVLA ने धैर्य बनाए रखा और काम पूरा किया, जबकि अन्य हार मान गए या भटक गए।

सारांश उपमा (Summary Analogy)

  • पुराना तरीका: रोबोट एक छात्र है जिसे एक भी कदम उठाने से पहले 10 पन्नों का निबंध लिखना पड़ता है। यदि वह निबंध में एक शब्द भी गलत लिख देता है, तो वह फेल हो जाता है।
  • ERVLA का तरीका: रोबोट एक अनुभवी एथलीट है। उसने इतना अभ्यास किया है कि वह गेम प्लान को तुरंत समझ जाता है। उसे खेलने के तरीके को जानने के लिए निबंध लिखने की आवश्यकता नहीं है; रणनीति उसके मूवमेंट्स में ही समाहित है।

मुख्य बात: यह पेपर दिखाता है कि रोबोटों के स्मार्ट होने के लिए, उन्हें हर कार्य के माध्यम से "बोलने" के लिए मजबूर नहीं किया जाना चाहिए। इसके बजाय, उन्हें कार्य के लॉजिक को आत्मसात करने के लिए प्रशिक्षित किया जाना चाहिए ताकि उनके कार्य स्वाभाविक रूप से सही पथ का अनुसरण करें, भले ही निर्देश अस्पष्ट हों या दुनिया अस्त-व्यस्त हो। उन्होंने इस विशाल "कुकबुक" (डेटासेट) और रोबोट के "दिमाग" (मॉडल) को दूसरों के उपयोग के लिए भी जारी किया है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →