← नवीनतम पेपर
💻 computer science

ReSteer: Quantifying and Refining the Steerability of Multitask Robot Policies

यह शोधपत्र ReSteer को प्रस्तुत करता है, जो एक ऐसा फ्रेमवर्क है जो कम-स्टीयरेबिलिटी (steerability) वाली अवस्थाओं की पहचान करके और सुधारात्मक डेटा को संश्लेषित करके मल्टीटास्क रोबोट नीतियों की स्टीयरेबिलिटी को परिमाणित और उन्नत करता है, ताकि सिमुलेशन और वास्तविक दुनिया दोनों परिदृश्यों में सुदृढ़, ऑन-द-फ्लाई टास्क स्विचिंग को सक्षम बनाया जा सके।

मूल लेखक: Zhenyang Chen, Alan Tian, Liquan Wang, Benjamin Joffe, Yingyan Celine Lin, Yuxiao Chen, Siddharth Karamcheti, Danfei Xu

प्रकाशित 2026-03-19
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zhenyang Chen, Alan Tian, Liquan Wang, Benjamin Joffe, Yingyan Celine Lin, Yuxiao Chen, Siddharth Karamcheti, Danfei Xu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक बहुत ही बुद्धिमान रोबोट शेफ है। आपने उसे सैंडविच बनाना, बर्तन धोना और केक बनाना सिखाया है। वह शुरुआत में दिए गए निर्देशों का पालन करने में बहुत माहिर है।

समस्या: "जिद्दी शेफ"
यहाँ समस्या यह है: यदि आप रोबोट को कहते हैं, "कटोरे को सिंक में रख दो," और वह सिंक की ओर चलना शुरू करता है, लेकिन तभी आप अचानक अपना विचार बदल देते हैं और चिल्लाते हैं, "रुको! कटोरे को ओवन में रख दो!", तो रोबोट अक्सर आपकी बात अनसुनी कर देता है। वह सिंक की ओर चलते रहना जारी रखता है, जैसे कि वह 'ऑटोपायलट' पर हो। ऐसा लगता है जैसे रोबोट को "टनल विजन" (एक ही चीज़ पर ध्यान केंद्रित करना) हो गया है और वह तब तक आपकी नई आवाज़ नहीं सुन पाता जब तक कि बहुत देर न हो जाए।

यह समस्या "स्टीयरबिलिटी" (Steerability - नियंत्रण क्षमता) की कमी कहलाती है। एक स्टीरेबल रोबोट वह है जो आपकी बात सुन सके, जो वह कर रहा है उसे रोक सके, और किसी भी कार्य के बीच में, कभी भी तुरंत अपना रास्ता या काम बदल सके।

निदान: रोबोट जिद्दी क्यों है?
लेखकों ने महसूस किया कि समस्या यह नहीं है कि रोबोट "मूर्ख" है; बल्कि समस्या यह है कि ट्रेनिंग डेटा उबाऊ था।

  • पुराना तरीका: उन्होंने रोबोट को सैंडविच बनाने के 100 वीडियो दिखाकर प्रशिक्षित किया, फिर बर्तन धोने के 100 वीडियो दिखाकर। हर वीडियो में, निर्देश कभी बदलता नहीं था। रोबोट ने एक शॉर्टकट सीख लिया: "अगर मुझे एक कटोरा दिखता है, तो मुझे पता है कि क्या करना है।" उसने भाषा को सुनना बंद कर दिया और केवल जो वह देख रहा था उस पर प्रतिक्रिया देना शुरू कर दिया।
  • परिणाम: रोबोट कार्य शुरू करने में तो विशेषज्ञ बन गया लेकिन कार्य बदलने में बहुत खराब हो गया।

समाधान: ReSteer (द "री-स्टीयरिंग" फ्रेमवर्क)
लेखकों ने इस समस्या को ठीक करने के लिए ReSteer नामक एक नया सिस्टम बनाया। इसे रोबोट के लिए तीन-चरणीय प्रशिक्षण शिविर (training camp) के रूप में समझें:

1. द "स्पॉटर" (कमजोर कड़ियों को ढूंढना)

सबसे पहले, सिस्टम को यह जानने की आवश्यकता है कि रोबोट सबसे अधिक जिद्दी कहाँ है। हर एक क्षण का परीक्षण करने के बजाय (जिसमें बहुत समय लगता है), वे कंडीशनल म्यूचुअल इंफॉर्मेशन (CMI) नामक एक चतुर गणितीय तकनीक का उपयोग करते हैं।

  • उपमा: कल्पना कीजिए कि एक शिक्षक छात्र का मूल्यांकन कर रहा है। छात्र से हर एक प्रश्न पूछने के बजाय, शिक्षक उन विशिष्ट क्षणों को देखता है जहाँ छात्र भ्रमित या केवल अनुमान लगाता हुआ प्रतीत होता है।
  • यह कैसे काम करता है: सिस्टम रोबोट के "दिमाग" को स्कैन करता है और उन सटीक क्षणों को खोजता है जहाँ रोबोट के कार्य बहुत अधिक नहीं बदलते, भले ही आप एक अलग निर्देश दें। ये "निर्देश-अंध" (instruction-blind) बिंदु हैं जहाँ रोबोट को सबसे अधिक मदद की आवश्यकता होती है।

2. द "स्क्रिप्टराइटर" (नए परिदृश्य बनाना)

एक बार जब वे उन जिद्दी बिंदुओं को ढूंढ लेते हैं, तो वे केवल रोबोट के विफल होने का इंतज़ार नहीं करते। वे विशेष रूप से उन क्षणों के लिए नकली प्रशिक्षण परिदृश्य (fake training scenarios) बनाते हैं।

  • उपमा: कल्पना कीजिए कि एक फ्लाइट सिम्युलेटर है। यदि एक पायलट 5,000 फीट की ऊँचाई पर बाएँ मुड़ते समय हमेशा दुर्घटनाग्रस्त होता है, तो इंस्ट्रक्टर केवल "फिर से प्रयास करें" नहीं कहता। वे एक विशिष्ट सिमुलेशन बनाते हैं जहाँ विमान 5,000 फीट पर है, और इंस्ट्रक्टर बार-बार चिल्लाता है, "इसके बजाय दाएँ मुड़ो!" जब तक कि पायलट तुरंत दिशा बदलने में माहिर न हो जाए।
  • यह कैसे काम करता है: सिस्टम एक रोबोट को "बर्तन धोने" के बीच में ही रोकता है और उसे ठीक उसी क्षण "कटोरे को ओवन में रखने" के कार्य में स्विच करने का अभ्यास करने के लिए मजबूर करता है। यह हजारों ऐसे "मिड-टास्क स्विच" (कार्य के बीच में बदलाव) वाले वीडियो बनाता है।

3. द "सेल्फ-कोच" (सफलता से सीखना)

अंत में, रोबोट इन नए परिदृश्यों को अपने आप आजमाता है। जब वह सफलतापूर्वक कार्य बदल लेता है, तो सिस्टम उस सफलता को सहेज लेता है। जब वह विफल होता है, तो वह उसे अनदेखा कर देता है।

  • उपमा: यह एक वीडियो गेम की तरह है जहाँ आप अपना प्रोग्रेस तभी सेव करते हैं जब आप एक लेवल जीत जाते हैं। रोबोट अभ्यास करता है, और हर बार जब वह एक नए कमांड को सुनकर सफलतापूर्वक अपना काम बदल लेता है, तो उसे एक "हाई स्कोर" मिलता है और वह सीखता है कि यह व्यवहार अच्छा है। यह कार्य बदलने के लिए "मसल मेमोरी" (मांसपेशियों की स्मृति) को मजबूत करता है।

परिणाम: एक रोबोट जो वास्तव में सुनता है
लेखकों ने कंप्यूटर सिमुलेशन और एक वास्तविक किचन में एक वास्तविक रोबोट के साथ इसका परीक्षण किया।

  • ReSteer से पहले: यदि आप रोबोट को बीच में कार्य बदलने के लिए कहते, तो वह केवल 30% बार सफल होता था। वह जिद्दी था।
  • ReSteer के बाद: सफलता दर बढ़कर 73% (दोगुने से भी अधिक!) हो गई। रोबोट सिंक में कटोरा रखना छोड़कर, आपके कहने पर तुरंत उसे ओवन में रख सकता था, बिना भ्रमित हुए या अटके।

यह क्यों महत्वपूर्ण है
वास्तविक दुनिया में, जीवन अव्यवस्थित है। आप हमेशा यह नहीं जानते कि आप शुरू से अंत तक रोबोट से क्या करवाना चाहते हैं। आप कह सकते हैं, "मेज साफ करो," लेकिन फिर आपको एहसास होता है, "ओह रुकिए, मुझे पहले फूलदान हटाना होगा।"
ReSteer एक कठोर, स्क्रिप्ट का पालन करने वाले रोबोट को एक लचीले, इंटरैक्टिव साथी में बदल देता है जो आपके बदलते विचारों को संभाल सकता है, जिससे रोबोट हमारे दैनिक जीवन में मदद करने के लिए बहुत अधिक उपयोगी बन जाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →