← नवीनतम पेपर
💻 computer science

Do Better Imagined Rollouts Mean Better Robot Control? A Controlled Study of World-Model Evaluation Under Feedback

यह शोधपत्र यह प्रदर्शित करता है कि फीडबैक पर निर्भर रहने वाले रोबोटिक्स अनुप्रयोगों के लिए, ओपन-लूप रोलआउट्स का उपयोग करके किए गए ऑफलाइन प्रेडिक्टिव मॉडल मूल्यांकन, ट्राजेक्टरी रिप्ले या क्लोज्ड-लूप टेस्टिंग की तुलना में कम विश्वसनीय होते हैं, क्योंकि वे अक्सर वास्तविक नियंत्रण प्रदर्शन के साथ सहसंबंध स्थापित करने में विफल रहते हैं जब तक कि मूल्यांकन शेड्यूलिंग स्पष्ट रूप से सिस्टम के मेजरमेंट-अपडेट पैटर्न को प्रतिबिंबित न करे।

मूल लेखक: Dharini Raghavan, Amritpal Singh

प्रकाशित 2026-09-03
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Dharini Raghavan, Amritpal Singh

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

वास्तविक दुनिया में चलने वाले रोबोट अपनी आँखों, अपने पहियों और अपने मस्तिष्क के बीच एक निरंतर, अदृश्य बातचीत पर निर्भर करते हैं। नेविगेट करने के लिए, एक रोबोट को पहले यह अनुमान लगाना चाहिए कि वह कहाँ है, फिर यह तय करना चाहिए कि उसे कैसे चलना है, और अंत में यह जाँचनी चाहिए कि क्या उसका अनुमान सही था। यह चक्र बार-बार होता है, एक घंटे में हजारों बार। यदि रोबोट का आंतरिक अनुमान थोड़ा भी गलत होता है, तो उसके द्वारा किया गया सुधार उसे रास्ते से भटका सकता है। यदि अनुमान किसी अलग तरह से गलत होता है, तो रोबोट खुद को पूरी तरह से ठीक कर सकता है। वर्षों से, इंजीनियर यह आंकने की कोशिश कर रहे हैं कि एक रोबोट के "मस्तिष्क" कितना अच्छा है, इसके लिए उन्हें एक शांत, नियंत्रित वातावरण में परीक्षण किया जाता है जहाँ वह बिना किसी नई जानकारी के भविष्य की भविष्यवाणी करता है। वे मॉडल से एक आगे के पथ की कल्पना करने के लिए कहते हैं और देखते हैं कि वह उससे कितना दूर निकल जाता है। लेकिन यह शोध पत्र एक सरल, महत्वपूर्ण प्रश्न पूछता है: क्या शून्य में भविष्य की कल्पना करने में अच्छा होना वास्तव में यह सुनिश्चित करता है कि एक रोबोट कार चलाने या जंगल में चलने में अच्छा होगा, जहाँ वास्तविक सेंसर लगातार उसके दृश्य को अपडेट कर रहे होते हैं?

जॉर्जिया टेक और एमोरी यूनिवर्सिटी के शोधकर्ताओं ने एक छोटे, पहियों वाले रोबोट के साथ एक नियंत्रित प्रयोग बनाकर इसका उत्तर देने का प्रयास किया। उन्होंने रोबोट को एक विशिष्ट पथ का पालन करने के लिए दिया, ऐसे पहिये दिए जो कभी-कभी फिसलते थे, और एक जायरोस्कोप दिया जो थोड़ा भटक जाता था। रोबोट को यह जानने में मदद करने के लिए कि वह कहाँ था, उन्होंने कमरे के चारों ओर ज्ञात लैंडमार्क (चिह्न) रखे जिन्हें रोबोट कभी-कभी देख सकता था, लेकिन लगातार नहीं। रोबोट को इन दृश्यों के बीच अपनी स्थिति का अनुमान लगाने के लिए अपने व्हील सेंसर का उपयोग करना था। टीम ने छह अलग-अलग तरीकों का परीक्षण किया जिनसे रोबोट अपने स्थान का अनुमान लगा सकता था। कुछ केवल गणित और पहियों के डेटा पर निर्भर थे, जबकि अन्य उन गणितीय मॉडलों में त्रुटियों को ठीक करने के लिए सीखे गए पैटर्न का उपयोग करते थे। फिर उन्होंने इन रोबोटों के परीक्षण के तीन अलग-अलग तरीकों की तुलना की। पहला, उन्होंने एक रिकॉर्ड की गई यात्रा को फिर से चलाया जहाँ रोबोट ने अतीत में हर लैंडमार्क को ठीक उसी तरह देखा जैसा वह हुआ था। दूसरा, उन्होंने रोबोट को बिना कोई लैंडमार्क देखे, केवल अपने आंतरिक अनुमान पर भरोसा करते हुए, भविष्य की बीस-कदम की यात्रा की कल्पना करने के लिए कहा। तीसरा, उन्होंने रोबोट को वास्तविक समय में चलाने दिया, जहाँ उसके अनुमान सीधे पहियों को नियंत्रित करते थे, और जब भी लैंडमार्क अपडेट उपलब्ध होते थे, उसे प्राप्त होते थे।

परिणामों ने एक आश्चर्यजनक विच्छेद प्रकट किया। जब शोधकर्ताओं ने वास्तविक समय के ड्राइविंग परीक्षण में रोबोट के प्रदर्शन को देखा, तो विजेता का सबसे अच्छा अनुमान लगाने वाला तरीका वह था जहाँ रोबोट ने लैंडमार्क अपडेट शामिल करते हुए एक पिछली यात्रा को फिर से चलाया था। इस तरीके ने अधिकांश मामलों में सर्वश्रेष्ठ रोबोट की सही पहचान की। हालाँकि, रोबोट को बिना किसी नई जानकारी के लंबी, बीस-कदम की यात्रा की कल्पना करने के लिए कहने के लोकप्रिय तरीके ने वास्तविक दुनिया के विजेता की भविष्यवाणी करने में बहुत खराब प्रदर्शन किया। वास्तव में, इस "कल्पित रोलआउट" (imagined rollout) पद्धति ने चौबीस में से अठारह परीक्षण परिदृश्यों में गलत रोबोट को सर्वश्रेष्ठ प्रदर्शन करने वाला चुना। यह शोध पत्र दिखाता है कि एक मॉडल भविष्य की भविष्यवाणी करने में बहुत अच्छा हो सकता है यदि उसे कभी सुधारा न जाए, लेकिन वह कौशल उस रोबोट में काम नहीं आता है जिसे लगातार नए सेंसर डेटा द्वारा सुधारा जा रहा हो। बिना किसी सहायता के शून्य में सटीक रूप से भटकने की क्षमता, मदद के साथ नेविगेट करने की क्षमता के समान नहीं है।

अध्ययन ने यह समझने के लिए गहराई से जांच की कि ऐसा क्यों हुआ। शोधकर्ताओं ने महसूस किया कि समस्या केवल कल्पित यात्रा की लंबाई नहीं थी, बल्कि उस यात्रा के दौरान अपडेट की कमी थी। जब उन्होंने रोबानों के साथ एक लंबी कल्पित यात्रा का परीक्षण किया लेकिन उन्हें हर एक कदम पर एक सेंसर अपडेट प्राप्त करने की अनुमति दी, तो परीक्षण फिर से सटीक हो गया। यह केवल तभी विफल हुआ जब उन्होंने एक लंबी भविष्यवाणी के समय को अपडेट की पूर्ण कमी के साथ जोड़ा। यह सुझाव देता है कि फीडबैक लूप में काम करने वाले रोबोटों के लिए—जहाँ वे कार्य करते हैं, महसूस करते हैं और सुधार करते हैं—जिस तरह से हम उनका परीक्षण करते हैं, उसे उनके वास्तविक कार्य करने के तरीके की नकल करनी चाहिए। यदि एक रोबोट वास्तविक दुनिया में बार-बार अपडेट प्राप्त करता है, तो उसका परीक्षण करने के लिए उसे बिना किसी मदद के लंबे समय तक अनुमान लगाने के लिए कहना भ्रामक है।

टीम ने यह भी पता लगाया कि क्या वे रोबोटों को इन लंबी, बिना सुधारी गई भविष्यवाणियों में बेहतर होने के लिए प्रशिक्षित कर सकते हैं। उन्होंने कुछ सीखने-आधारित (learning-based) रोबोटों को बिना किसी लैंडमार्क को देखे लंबे समय तक निपटने के लिए प्रशिक्षित किया। कुछ मामलों में, इससे मदद मिली। उन रोबोटों के लिए जो एक मजबूत गणितीय आधार के साथ शुरू हुए थे, उन्हें लंबे अंतराल को संभालने के लिए प्रशिक्षित करने से उनके त्रुटियों में काफी कमी आई, जिससे उनके भटकने की दूरी एक और आधा मीटर से घटकर केवल एक मीटर से थोड़ी अधिक रह गई। हालाँकि, यह सुधार सार्वभौमिक नहीं था। उन रोबोटों के लिए जिनका गणितीय आधार कमजोर था, उन्हें लंबे अंतराल को संभालने के लिए प्रशिक्षित करने से कोई मदद नहीं मिली; कुछ मामलों में, इससे वे थोड़े और खराब हो गए। यह निष्कर्ष बताता है कि केवल एक रोबोट को अधिक कठिन प्रशिक्षण स्थितियों के संपर्क में लाने से यह गारंटी नहीं मिलती कि वह अधिक मजबूत बनेगा। रोबोट के मस्तिष्क की अंतर्निहित संरचना उतनी ही महत्वपूर्ण है जितना कि उसे मिलने वाला प्रशिक्षण।

अंततः, यह शोध पत्र तर्क देता है कि रोबोटिक्स में प्रेडिक्टिव मॉडल के मूल्यांकन के तरीके को बदलने की आवश्यकता है। हम केवल यह नहीं माप सकते कि डेटा के बिना लंबे समय के बाद एक मॉडल कितना दूर हो जाता है। इसके बजाय, हमें यह मापना चाहिए कि मॉडल वास्तविक दुनिया में सामना किए जाने वाले अपडेट के विशिष्ट शेड्यूल के तहत कैसा प्रदर्शन करता है। यदि एक रोबोट को हर सेकंड एक कैमरा इमेज या सेंसर रीडिंग प्राप्त होती है, तो उसके मूल्यांकन में हर सेकंड वे अपडेट शामिल होने चाहिए। यदि हम इसे बिना किसी मदद के एक मिनट तक अनुमान लगाने के लिए कहकर इसका परीक्षण करते हैं, तो हम एक अलग कौशल का परीक्षण कर रहे हैं। सबसे उपयोगी बेंचमार्क वह है जो रोबोट के वास्तविक जीवन की लय को दर्शाता है: कार्य करने, नई जानकारी प्राप्त करने और पथ को सुधारने की क्रिया। अपने परीक्षणों को रोबोट के संचालन की वास्तविकता के साथ संरेखित करके, हम सही उपकरणों का चयन कर सकते हैं और ऐसी मशीनें बना सकते हैं जो वास्तव में उस दुनिया को समझती हैं जिसमें वे चलती हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →