← नवीनतम पेपर
💻 computer science

DenseReward: Dense Reward Learning via Failure Synthesis for Robotic Manipulation

यह शोध पत्र DenseReward को प्रस्तुत करता है, जो विविध विफलता मोड (failure modes) के एक सिंथेटिक रूप से जनरेट किए गए डेटासेट पर प्रशिक्षित एक डेंस रोबोटिक रिवॉर्ड मॉडल है, जो स्पार्स फीडबैक की सीमाओं को दूर करने और रोबोटिक मैनिपुलेशन पॉलिसी में सुधार करने के लिए विजुअल और लैंग्वेज इनपुट से फाइन-ग्रेन्ड, फ्रेम-लेवल रिवॉर्ड्स की भविष्यवाणी करता है।

मूल लेखक: Yu Fang, Wanxi Dong, Jiaqi Liu, Yue Yang, Mingxiao Huo, Yao Mu, Huaxiu Yao, Li Erran Li, Daniel Szafir, Mingyu Ding

प्रकाशित 2026-07-15
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yu Fang, Wanxi Dong, Jiaqi Liu, Yue Yang, Mingxiao Huo, Yao Mu, Huaxiu Yao, Li Erran Li, Daniel Szafir, Mingyu Ding

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को टोकरी में गेंद डालने के लिए सिखा रहे हैं। पुराने दिनों में, आपको रोबोट के कोशिश करने, असफल होने और फिर से कोशिश करने की पूरी फिल्म देखनी पड़ती थी, और फिर अंत में बस यह कहना होता था, "अच्छा काम किया!" या "बुरा काम किया!" यह वैसा ही है जैसे किसी छात्र को परीक्षा देकर केवल उनके अंतिम ग्रेड के बारे में बताना, जबकि वे पहले ही हर उस प्रश्न को भूल चुके हों जिसका उन्होंने उत्तर दिया था। रोबोट को इस बात का कोई अंदाजा नहीं मिलता कि वह बीच में क्यों विफल हुआ या वह कैसा प्रदर्शन कर रहा था।

यहाँ आता है DenseReward, एक नया सिस्टम जो एक अत्यंत चौकस कोच की तरह काम करता है जो रोबोट द्वारा किए गए हर एक कदम के बाद एक स्कोर फुसफुसाता है। एक साधारण "पास/फेल" के बजाय, यह रोबोट को 0 और 1 के बीच एक संख्या देता है, जो उसे बताता है कि वह अभी सफलता के कितने करीब है।

समस्या: "नकली विफलता" का जाल (The "Fake Failures" Trap)

रोबोट को इस तरह सिखाने के लिए सबसे बड़ी बाधा यह है कि आपको उदाहरणों का एक विशाल पुस्तकालय चाहिए जो यह दिखाए कि सब कुछ कैसे गलत हो सकता है। आपको यह देखना होगा कि रोबोट मेज से टकरा जाता है, गेंद गिरा देता है, बास्केट चूक जाता है, या फंस जाता है।

आमतौर पर, शोधकर्ता इन "विफलताओं" को बनाने के लिए एक सफल वीडियो को लेते थे और उसे बीच में ही काट देते थे या यह दिखावा करते थे कि वह विफल हो गया। लेकिन इस पेपर के लेखक तर्क देते हैं कि यह कार चलाने के बारे में सीखने जैसा है जहाँ आपने केवल एक ऐसा वीडियो देखा है जहाँ कार बस रुक गई है; यह आपको यह नहीं सिखाएगा कि वास्तविक दुर्घटना कैसी महसूस होती है। ये "नकली" विफलताएं उस भौतिक वास्तविकता को कैप्चर नहीं करती हैं जहाँ एक रोबोट वास्तव में किसी वस्तु को गिरा देता है या दीवार से टकरा जाता है।

समाधान: एक रोबोट "विफलता फैक्ट्री" (A Robot "Failure Factory")

इसे ठीक करने के लिए, टीम ने कंप्यूटर सिमुलेशन में एक स्वचालित फैक्ट्री बनाई। उन्होंने इंसानों से चीजों को मैन्युअल रूप से तोड़ने के लिए नहीं कहा (जो धीमा और उबाऊ है)। इसके बजाय, उन्होंने रोबोट को पांच विशिष्ट चरणों से गुजरने के लिए प्रोग्राम किया: रीच (पहुँचना), ग्रैस्प (पकड़ना), लिफ्ट (उठाना), मूव (हिलाना), और प्लेस (रखना)।

फिर, उन्होंने "लक्षित विक्षेपण" (targeted perturbations) पेश किए—मूल रूप से, उन्होंने रोबोट को जानबूझकर गलती करने के लिए थोड़ा सा धक्का दिया।

  • उन्होंने रोबोट के हाथ को थोड़ा लक्ष्य से भटका दिया, जिससे मिस (चूकना) हुआ।
  • उन्होंने रोबोट को बाधाओं को अनदेखा करने के लिए कहा, जिससे कोलिजन (टक्कर) हुई।
  • उन्होंने रोबोट को वस्तु पकड़े हुए हिला दिया, जिससे फॉल (गिरना) हुआ।
  • उन्होंने यहाँ तक कि रोबोट को टकराया और फिर वापस पटरी पर आने का तरीका भी सिखाया, जिससे रिकवर (सुधारना) परिदृश्य बना।

इसे स्वचालित रूप से करके, उन्होंने 27,000 एपिसोड्स (वह भी 27 हज़ार!) का एक डेटासेट तैयार किया, जिसमें इन सभी अलग-अलग तरीकों को कवर किया गया जिनसे एक रोबोट विफल हो सकता है, साथ ही वीडियो के हर एक फ्रेम के लिए एक सटीक स्कोर भी दिया गया।

मुख्य खिलाड़ी: DenseReward

इस विशाल डेटासेट का उपयोग करके, उन्होंने DenseReward नामक एक मॉडल को प्रशिक्षित किया। इस मॉडल को रोबोट की "छठी इंद्री" के रूप में समझें जो प्रगति का पता लगाती है। जब आप इसे कोई कार्य देते हैं (जैसे "गेंद को टोकरी में डालो"), एक दृश्य की तस्वीर, और उससे ठीक पहले क्या हुआ था उसकी कुछ तस्वीरें देते हैं, तो यह तुरंत एक स्कोर की भविष्यवाणी करता है।

  • यदि रोबोट टोकरी की ओर सुचारू रूप से बढ़ रहा है, तो स्कोर बढ़ जाता है।
  • यदि रोबोट मेज से टकराता है, तो स्कोर गिर जाता है।
  • यदि रोबोट गेंद गिरा देता है लेकिन फिर उसे वापस उठा लेता है, तो स्कोर नीचे गिरता है और फिर ऊपर चढ़ जाता है।

पेपर दिखाता है कि यह मॉडल अन्य स्मार्ट AI मॉडल (जैसे सामान्य-उद्देश्य वाले विजन-लैंग्वेज मॉडल) या पुराने रिवॉर्ड सिस्टम की तुलना में स्कोर का बेहतर अनुमान लगाता है। परीक्षणों में, इस नए मॉडल की भविष्यवाणियां औसतन केवल 0.081 की त्रुटि के साथ थीं, जबकि अन्य मॉडल लगभग 0.30 की त्रुटि के साथ थे। यह सटीकता में एक बहुत बड़ा अंतर है।

क्या यह वास्तव में काम करता है?

लेखकों ने केवल एक अच्छा गेसर (अनुमान लगाने वाला) बनाने तक ही खुद को सीमित नहीं रखा; उन्होंने यह भी परीक्षण किया कि क्या यह "कोच" वास्तव में रोबोट को बेहतर सीखने में मदद कर सकता है।

  1. सिमुलेशन में: उन्होंने स्कोर का उपयोग एक मॉडल प्रेडिक्टिव कंट्रोल (MPC) सिस्टम को निर्देशित करने के लिए किया। अगले कदम का अनुमान लगाने के बजाय, रोबोट ने 28 संभावित कदमों को देखा, DenseReward से पूछा कि कौन सा सबसे अच्छा दिख रहा है, और फिर उसे चुना। परिणाम? रोबोट लक्ष्य वस्तुओं के बहुत करीब पहुँच गया (दूरी को औसतन लगभग 0.229 तक कम कर दिया) अन्य तरीकों की तुलना में।
  2. वास्तविक दुनिया में: वे एक असली लैब में रोबोटिक आर्म लेकर गए और उन्हें कप स्टैक करना और टोकरी में गेंद डालना सिखाने की कोशिश की। बिना डेंस फीडबैक के, रोबोट कप के साथ केवल 40% बार सफल हुआ। लेकिन जब उन्होंने DenseReward को सीखने की प्रक्रिया को निर्देशित करने दिया, तो सफलता दर बढ़कर 80% हो गई। बॉल-इन-बास्केट कार्य के लिए, यह 30% से बढ़कर 70% हो गई।

यह पेपर क्या कहता है (और क्या नहीं कहता)

लेखक सावधानी बरतते हुए कहते हैं कि हालांकि ये परिणाम प्रभावशाली हैं, लेकिन ये विशिष्ट सिमुलेशन और कार्यों के एक सीमित सेट पर आधारित हैं। वे यह दावा नहीं करते कि यह हर रोबोट समस्या को हमेशा के लिए हल कर देता है। वे स्पष्ट रूप से इस विचार को खारिज करते हैं कि "नकली" विफलताएं (केवल सफल वीडियो को काटकर बनाना) पर्याप्त हैं; वे जोर देते हैं कि भौतिक रूप से यथार्थवादी विफलता डेटा आवश्यक है।

उन्होंने यह भी सुझाव दिया कि यह दृष्टिकोण एक व्यावहारिक रास्ता है, लेकिन उन्होंने स्वीकार किया कि अभी भी बहुत काम करना बाकी है। वे और भी कठिन कार्यों को संभालने की योजना बना रहे हैं, जैसे कि टूल्स (औजारों) का उपयोग करना या लंबे, जटिल कार्यों को करना, और वे अंततः मानव फीडबैक को शामिल करने की आशा करते हैं ताकि रिवार्ड्स को और भी बेहतर बनाया जा सके।

संक्षेप में, DenseReward सुझाव देता है कि यदि आप चाहते हैं कि एक रोबोट तेजी से सीखे, तो आपको एक ऐसा कोच चाहिए जो केवल खेल के अंत तक ग्रेड देने के लिए इंतजार न करे, बल्कि एक ऐसा कोच जो जानता हो कि हर कदम पर रोबोट कैसा प्रदर्शन कर रहा है—और उस कोच ने यह समझने के लिए बहुत सारी वास्तविक, उलझी हुई विफलताओं को देखा हो कि "अच्छा करने" का वास्तव में क्या अर्थ है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →