← नवीनतम पेपर
💻 computer science

R2S-Eval: Robot Evaluation with Real-to-Sim Calibration via Vision-Language Models

यह शोध पत्र R2S-Eval का प्रस्ताव करता है, जो एक स्वचालित मूल्यांकन पाइपलाइन है जो रोबोटिक मैनिपुलेशन नीतियों की स्थिर, गुणवत्ता-जागरूक रैंकिंग उत्पन्न करने के लिए रियल-टू-सिम अंशांकन (real-to-sim calibration) को विजन-लैंग्वेज मॉडल प्राथमिकता मूल्यांकन के साथ जोड़ता है, जिससे पारंपरिक वास्तविक-दुनिया के सफलता-दर मेट्रिक्स की श्रम-गहन और सीमित प्रकृति पर विजय प्राप्त होती है।

मूल लेखक: Yidi Wang, Feixiang Ruan, Ruoqu Chen, Jie Yin, Yang Yu, Mengdi Xu, Kaifeng Zhang

प्रकाशित 2026-09-04
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yidi Wang, Feixiang Ruan, Ruoqu Chen, Jie Yin, Yang Yu, Mengdi Xu, Kaifeng Zhang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

आधुनिक रोबोटिक्स के शांत कोनों में, मशीनों की एक नई पीढ़ी नाजुक कार्यों को करने के लिए सीख रही है, जैसे कि ब्लॉकों को एक के ऊपर एक रखना या तरल पदार्थ डालना, जो उन मॉडलों द्वारा निर्देशित होते हैं जो दुनिया को देख सकते हैं और भाषा को समझ सकते हैं। इन प्रणालियों को, जिन्हें अक्सर विजन-लैंग्वेज-एक्शन मॉडल कहा जाता है, इस तरह से डिज़ाइन किया गया है कि वे "कप उठाओ" जैसे आदेश को भौतिक गतिविधियों की एक श्रृंखला में अनुवादित कर सकें। हालाँकि, एक रोबोट को चलना सिखाना केवल आधी लड़ाई है; दूसरी आधी लड़ाई यह समझने की है कि वह वास्तव में कितना अच्छा प्रदर्शन करता है। पारंपरिक रूप से, वैज्ञानिक इन रोबोटों का मूल्यांकन उन्हें एक भौतिक मेज पर बार-बार एक कार्य करने की कोशिश करते हुए देखकर करते हैं, और यह गिनते हैं कि वे कितनी बार सफल हुए और कितनी बार विफल रहे। यह विधि धीमी है, उन मानव ऑपरेटरों के लिए थकाऊ है जिन्हें हर प्रयास के बाद दृश्य को फिर से व्यवस्थित (reset) करना पड़ता है, और अक्सर एक अनाड़ी सफलता और एक सुंदर प्रदर्शन के बीच के सूक्ष्म अंतर को पकड़ने के लिए बहुत ही सतही है। यदि कोई रोबोट कप गिरा देता है लेकिन उसे फिर से उठाने में सफल रहता है, या यदि वह किसी वस्तु को रखने से पहले हिंसक रूप से डगमगाता है, तो एक साधारण "सफलता" या "विफलता" का लेबल पूरी कहानी को छोड़ देता है।

शोधकर्ताओं की एक टीम ने इन मशीनों को आंकने का एक अलग तरीका प्रस्तावित किया है, जो केवल सिरों को गिनने से हटकर पूरे प्रदर्शन को देखने की ओर बढ़ता है। उनका दृष्टिकोण, जिसे R2S-Eval कहा जाता है, दो शक्तिशाली विचारों को मिलाकर एक अधिक कुशल और अंतर्द la insightful मूल्यांकन प्रणाली बनाता है। सबसे पहले, वे वास्तविक दुनिया के परीक्षण वातावरण का एक डिजिटल जुड़वां (digital twin) बनाते हैं, एक ऐसा सिमुलेशन जो भौतिक रोबोट की गतिविधियों और उनके द्वारा इंटरैक्ट की जाने वाली वस्तुओं के साथ मेल खाने के लिए सावधानीपूर्वक कैलिब्रेट किया गया है। वास्तविक मेज पर हजारों परीक्षण करने के लिए रोबोट को मजबूर करने के बजाय, जो मानव श्रम के कई दिनों का काम होगा, टीम इन परीक्षणों को इस उच्च-गुणवत्ता वाले कंप्यूटर जगत के भीतर चलाती है। यह उन्हें वास्तविक समय के एक अंश में रोबोट द्वारा कार्य करने के सैकड़ों वीडियो क्लिप उत्पन्न करने की अनुमति देता है। उनके तरीके का दूसरा भाग एक ऐसी आर्टिफिशियल इंटेलिजेंस प्रणाली का उपयोग करना है जिसे छवियों और भाषा दोनों को समझने के लिए प्रशिक्षित किया गया है ताकि इन वीडियो को देखा जा सके। केवल यह जांचने के बजाय कि कार्य पूरा हुआ या नहीं, यह AI एक मानव न्यायाधीश की तरह कार्य करता है, जो बेहतर प्रदर्शन, सहजता या नियंत्रण को तय करने के लिए वीडियो क्लिप के जोड़ों की तुलना करता है। इन युग्मवार तुलनाओं (pairwise comparisons) को एकत्रित करके, प्रणाली रोबोट की नीतियों की एक रैंकिंग तैयार करती है जो व्यवहार की गुणवत्ता को दर्शाती है, न कि केवल अंतिम परिणाम को।

शोधकर्ताओं ने इस पाइपलाइन का परीक्षण एक ड्यूल-आर्म रोबोट प्लेटफॉर्म पर किया जो कुशल हाथों और कई कैमरों से लैस था, जिससे उन्हें सात अलग-अलग टेबलटॉप कार्य करने के लिए कहा गया, जैसे कि गेंद उठाकर बॉक्स में रखना या ब्लॉक को स्टैक करना। उन्होंने छह अलग-अलग रोबोट कंट्रोल मॉडलों की तुलना की, जिनमें बड़े, जटिल सिस्टम से लेकर छोटे, अधिक कुशल सिस्टम तक शामिल थे। पारंपरिक सेटअप में, इन मॉडलों का मूल्यांकन करने के लिए रोबोट को वास्तविक दुनिया में सैकड़ों बार प्रत्येक कार्य करने की आवश्यकता होती, और एक मानव ऑपरेटर लगातार वस्तुओं को व्यवस्थित करता और हार्डवेयर की निगरानी करता। टीम ने पाया कि उनकी नई विधि इस वीडियो डेटा को एक ऐसे सिम्युलेटेड वातावरण में उत्पन्न कर सकती है जो वास्तविक दुनिया के साथ इतनी बारीकी से ट्यून किया गया है कि कंप्यूटर में रोबोट का व्यवहार मेज पर उसके व्यवहार के लगभग समान है। जब उन्होंने वास्तविक दुनिया में रोबोट को चलाया, तो विभिन्न मॉडलों की सफलता दर उन दरों के बहुत करीब थी जो सिमुलेशन में देखी गई थीं, जिसमें औसतन केवल लगभग दो प्रतिशत का अंतर था। इसने पुष्टि की कि डिजिटल जुड़वां वास्तविक मशीन के लिए एक विश्वसनीय विकल्प था, जिससे शोधकर्ता बिना सटीकता खोए उबाऊ हार्डवेयर परीक्षणों को छोड़ सके।

एक बार वीडियो एकत्र हो जाने के बाद, टीम ने रैंकिंग के लिए आर्टिफिशियल इंटेलिजेंस जज की ओर रुख किया। उन्होंने AI को विभिन्न रोबोटों द्वारा एक ही कार्य करने वाले वीडियो के जोड़े दिखाए और उससे पूछा कि कौन सा बेहतर दिख रहा है। AI ने कारकों पर विचार किया जैसे कि रोबोट कितनी सहजता से चला, क्या वह हिचकिचाया, और असफल होने पर भी उसने कितनी प्रगति की। परिणामों ने दिखाया कि AI की रैंकिंग मानव प्राथमिकताओं के साथ नब्बे प्रतिशत से अधिक समय तक सहमत थी, जो सरल सफलता गणना की तुलना में एक महत्वपूर्ण सुधार है। अधिक महत्वपूर्ण बात यह है कि प्रणाली ने उन बारीकियों को उजागर किया जिन्हें बाइनरी पास-ऑर-फेल टेस्ट मिस कर देता। उदाहरण के लिए, एक प्रयोग में, दो रोबोटों ने सफलतापूर्वक कार्य पूरा किया, लेकिन एक ने इसे एक एकल, सहज गति के साथ किया जबकि दूसरे ने वस्तु गिरा दी और उसे फिर से प्रयास करना पड़ा। एक पारंपरिक मूल्यांकन दोनों को सफल घोषित करता, लेकिन नया सिस्टम बेहतर प्रदर्शन की सही पहचान करता। इसी तरह, जब दो रोबोट विफल हुए, तो सिस्टम उस रोबोट के बीच अंतर कर सका जिसने वास्तविक प्रयास किया और फंस गया बनाम वह जो बिल्कुल भी नहीं हिला।

अध्ययन ने इस दृष्टिकोण द्वारा बचाए गए मानव प्रयास को भी मापा। एक पारंपरिक मूल्यांकन में, मानव ऑपरेटर के लिए आवश्यक समय परीक्षणों की संख्या के साथ रैखिक रूप से बढ़ता है; यदि एक शोधकर्ता किसी कार्य पर बीस बार रोबोट का परीक्षण करना चाहता है, तो उसे दृश्य को सेट करने और रीसेट करने के लिए बीस गुना प्रयास करना होगा। शोधकर्ताओं ने अनुमान लगाया कि छह मॉडलों के सात कार्यों में से बीस परीक्षणों के पूर्ण मूल्यांकन को चलाने के लिए लगभग सत्ताईस घंटे के निरंतर मानव श्रम की आवश्यकता होगी। इस भारी काम को कैलिब्रेटेड सिमुलेशन और स्वचालित AI जज पर स्थानांतरित करके, R2S-Eval पाइपलाइन ने इस बार-बार होने वाले हार्डवेयर ऑपरेशन की आवश्यकता को पूरी तरह से समाप्त कर दिया। सिस्टम ने स्थिर रैंकिंग प्रदान की जो अधिक डेटा जोड़ने पर बेतहाशा नहीं बदली, जो यह सुझाव देती है कि यह विधि भविष्य के रोबोट डिजाइनों की तुलना करने के लिए एक मानक उपकरण के रूप में उपयोग किए जाने के लिए पर्याप्त मजबूत है।

निष्कर्ष बताते हैं कि रोबोट मूल्यांकन का भविष्य केवल सफलताओं को गिनने में नहीं बल्कि यात्रा की गुणवत्ता को समझने में निहित है। एक सिमुलेशन का उपयोग करके जो वास्तविकता को दर्शाता है और एक AI का उपयोग करके जो गति की सूक्ष्मताओं की सराहना कर सकता है, शोधकर्ता अब रोबोट नीतियों का आकलन उस स्तर के विवरण के साथ कर सकते हैं जो पहले मानव पर्यवेक्षकों की एक सेना के बिना असंभव था। यह कार्य यह दावा नहीं करता है कि इसने रोबोटिक्स की हर समस्या को हल कर दिया है, न ही यह सुझाव देता है कि सिमुलेशन सभी संदर्भों में भौतिक दुनिया के पूर्ण प्रतिस्थापन हैं। हालाँकि, यह प्रदर्शित करता है कि रोबोट व्यवहारों की रैंकिंग और सुधार के विशिष्ट लक्ष्य के लिए, एक सावधानीपूर्वक कैलिब्रेट किया गया डिजिटल वातावरण और बुद्धिमान वीडियो विश्लेषण एक विश्वसनीय, विस्तृत और मानव-संरेखित अंतर्दृष्टि प्रदान कर सकता है। यह बदलाव वैज्ञानिकों को "क्या यह काम कर गया?" के मोटे मीट्रिक से आगे बढ़कर "यह कितनी अच्छी तरह से काम कर गया?" के अधिक सार्थक प्रश्न की ओर बढ़ने की अनुमति देता है, जिससे ऐसे रोबोटों के निर्माण का मार्ग प्रशस्त होता है जो न केवल कार्यात्मक हैं, बल्कि वास्तव में कुशल भी हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →