← नवीनतम पेपर
💻 computer science

OopsieVerse: A Safety Benchmark with Damage-Aware Simulation for Robot Manipulation

यह शोध पत्र OOPSIEVERSE को प्रस्तुत करता है, जो एक एकीकृत सिमुलेशन फ्रेमवर्क और बेंचमार्क है जो भौतिक क्षति का पता लगाने और उसे मापने के लिए एक भौतिक रूप से आधारित, सिम्युलेटर-अज्ञेय (simulator-agnostic) तंत्र प्रदान करके क्षति-जागरूक रोबोट हेरफेर (robot manipulation) को सक्षम बनाता है, जिससे घरेलू रोबोटों के सुरक्षित प्रशिक्षण, मूल्यांकन और परिनियोजन की सुविधा मिलती है।

मूल लेखक: Arnav Balaji, Arpit Bahety, Sriniket Ambatipudi, Daniel Lam, Junhong Xu, Roberto Martín-Martín

प्रकाशित 2026-07-01
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Arnav Balaji, Arpit Bahety, Sriniket Ambatipudi, Daniel Lam, Junhong Xu, Roberto Martín-Martín

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को अपने घर के काम करने के लिए सिखा रहे हैं। आप चाहते हैं कि वह मेज पर एक कप रखे, लेकिन आप यह भी नहीं चाहते कि वह कप को चकनाचूर कर दे, मेज को जला दे, या आपके लैपटॉप पर पानी गिरा दे।

रोबोट ट्रेनिंग की वर्तमान समस्या यह है कि अधिकांश कंप्यूटर सिमुलेशन एक वीडियो गेम की तरह होते हैं जहाँ कुछ भी वास्तव में टूट नहीं सकता। यदि रोबोट सिमुलेशन में एक फूलदान गिरा देता है, तो वह बस फर्श से टकराकर उछल जाता है। रोबोट काम को जल्दी और कुशलता से पूरा करना सीखता है, लेकिन वह चीजों से टकराकर काम पूरा करना सीखता है क्योंकि, खेल में, इसके कोई परिणाम नहीं होते। जब आप अंततः उस रोबोट को वास्तविक दुनिया में रखते हैं, तो वह कार्य को सफलतापूर्वक पूरा तो कर सकता है, लेकिन इस प्रक्रिया में आपके घर को नष्ट कर सकता है।

OOPSIEVERSE एक नया टूल है जिसे टेक्सास विश्वविद्यालय, ऑस्टिन के शोधकर्ताओं द्वारा इसे ठीक करने के लिए बनाया गया है। इसे एक "डैमेज डिटेक्टर" (नुकसान का पता लगाने वाला) प्लगइन के रूप में समझें जो एक मानक रोबोट सिम्युलेटर को एक वास्तविक प्रशिक्षण मैदान में बदल देता है जहाँ चीजें वास्तव में घायल हो सकती हैं।

यह कैसे काम करता है, इसे सरल भागों में यहाँ दिया गया है:

1. "हेल्थ बार" सिस्टम (DAMAGESIM)

वीडियो गेम में, पात्रों के पास हेल्थ बार होते हैं जो चोट लगने पर कम हो जाते हैं। DAMAGESIM रोबोट के संसार की हर वस्तु (और स्वयं रोबोट) को एक छिपा हुआ हेल्थ बार देता है।

यह तीन मुख्य तरीकों को ट्रैक करता है जिनसे चीजों को नुकसान पहुँचता है:

  • मैकेनिकल डैमेज (यांत्रिक क्षति): जैसे वाइन की बोतल गिराना या अंडे को बहुत जोर से दबाना। सिस्टम टक्कर या दबाव के बल को मापता है।
  • थर्मल डैमेज (तापीय क्षति): जैसे प्लास्टिक के खिलौने को आग के पास रखना या धातु के हिस्से को जमा देना। सिस्टम यह जाँचता है कि क्या वस्तु बहुत गर्म या बहुत ठंडी हो गई है।
  • फ्लुइड डैमेज (तरल क्षति): जैसे लैपटॉप पर पानी गिराना या कागज के कप को गीला करना। सिस्टम यह मापता है कि कितना तरल संवेदनशील वस्तुओं को छू रहा है।

सिर्फ "कार्य पूर्ण" कहने के बजाय, सिस्टम अब कहता है, "कार्य पूर्ण, लेकिन आपने तीन चीजें तोड़ दीं और कमरे के कुल स्वास्थ्य को 40% कम कर दिया।"

2. प्रशिक्षण मैदान (OOPSIEBENCH)

शोधकर्ताओं ने रोबोटों के लिए एक "जिम" बनाया है जिसे OOPSIEBENCH कहा जाता है। इसमें 32 अलग-अलग घरेलू कार्य शामिल हैं, जैसे माइक्रोवेव खोलना, पानी डालना, या अनाज का डिब्बा शेल्फ पर रखना।

इस जिम की चतुराई यह है कि लगभग हर कार्य के लिए, इसे हल करने के दो तरीके हैं:

  • "जोखिम भरा शॉर्टकट": दरवाजा पटकना, वस्तु को गिराना, या पानी छिटकाना ताकि काम जल्दी हो जाए। यह पुराने सिम्युलेटरों में काम करता है लेकिन नुकसान पहुँचाता है।
  • "सुरक्षित तरीका": दरवाजा धीरे से खोलना, वस्तु को सावधानी से रखना, और धीरे से पानी डालना। इसमें थोड़ी अधिक कुशलता की आवश्यकता होती है लेकिन यह सब कुछ सुरक्षित रखता है।

OOPSIEBENCH रोबोट को मजबूर करता है कि यदि वह एक "अच्छा" रोबोट कहलाना चाहता है, तो वह सुरक्षित तरीके को चुने।

3. यह रोबोटों को सीखने में कैसे मदद करता है

पेपर चार तरीकों से बताता है कि यह टूल रोबोटों को सुरक्षित होने में कैसे मदद करता है:

  • इंसानों को बेहतर उदाहरण दिखाने में मदद करना: जब इंसान रोबोट को कार्य प्रदर्शित करते हैं (टेलीऑपरेशन), तो वे स्क्रीन पर वास्तविक समय में "हेल्थ बार" देख सकते हैं। यदि वे देखते हैं कि किसी बोतल का हेल्थ बार गिर रहा है, तो वे जानते हैं कि उन्हें अधिक कोमल होना चाहिए। यह उन्हें शुरुआत से ही बेहतर आदतें सिखाने में मदद करता है।
  • बुरे डेटा को फ़िल्टर करना: यदि कोई रोबोट अच्छे और बुरे प्रदर्शनों से सीखता है, तो सिस्टम स्वचालित रूप से उन "बुरे" प्रदर्शनों (जहाँ नुकसान हुआ) को पहचान सकता है और उन्हें बाहर निकाल सकता है, जिससे केवल सुरक्षित उदाहरण ही रोबोट के अध्ययन के लिए बचते हैं।
  • बुरे व्यवहार को दंडित करना: जब 'रीइन्फोर्समेंट लर्निंग' (प्रयास और त्रुटि) का उपयोग करके रोबोट को प्रशिक्षित किया जाता है, तो सिस्टम हर बार कुछ टूटने पर रोबोट को "नकारात्मक स्कोर" (दंड) देता है। रोबोट जल्दी सीख जाता है कि चीजें तोड़ना उच्च स्कोर प्राप्त करने की एक बुरी रणनीति है।
  • स्मार्ट रोबोटों का परीक्षण करना: शोधकर्ताओं ने एक बहुत ही उन्नत AI (जिसे GR00T कहा जाता है) का परीक्षण किया जो आमतौर पर कार्यों में बहुत अच्छा होता है। उन्होंने पाया कि हालांकि AI कार्य पूरे करने में सक्षम था, लेकिन वह अक्सर चीजों को मारकर काम पूरा करता था। OOPSIEVERSE ने इन छिपे हुए खतरों को उजागर किया जिन्हें मानक परीक्षणों ने मिस कर दिया होता।

4. क्या यह वास्तविक दुनिया में काम करता है?

अंत में, टीम ने इस "डैमेज-अवेयर" (नुकसान के प्रति जागरूक) सिस्टम के साथ प्रशिक्षित रोबोटों को एक लैब में एक वास्तविक रोबोटिक आर्म पर रखा। उन्होंने पाया कि OOPSIEVERSE के साथ प्रशिक्षित रोबोट, बिना इसके प्रशिक्षित रोबोटों की तुलना में, लैपटॉप पर पानी गिराने या नाजुक बोतल को गिराने की संभावना बहुत कम रखते हैं।

संक्षेप में: OOPSIEVERSE रोबोट ट्रेनिंग के लिए एक सुरक्षा जाल है। यह रोबोटों को एक नकली दुनिया में "ब्रूट फोर्स" (बल प्रयोग) की आदतें सीखने से रोकता है, यह सुनिश्चित करता है कि जब वे अंततः हमारे घरों में प्रवेश करें, तो वे हमारे बर्तन, इलेक्ट्रॉनिक्स और फर्नीचर को सुरक्षित रखने के लिए पर्याप्त कोमल हों।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →