Robometer: Scaling General-Purpose Robotic Reward Models via Trajectory Comparisons
यह शोध पत्र रोबोटमीटर (Robometer) को प्रस्तुत करता है, जो एक स्केलेबल रिवॉर्ड मॉडलिंग फ्रेमवर्क है जो विविध विशेषज्ञ और उप-इष्टतम प्रक्षेप पथों (trajectories) से प्रभावी ढंग से सामान्यीकरण योग्य रिवॉर्ड फंक्शन सीखने के लिए बड़े पैमाने के RBM-1M डेटासेट पर प्रशिक्षित, फ्रेम-स्तरीय प्रगति पर्यवेक्षण (frame-level progress supervision) को प्रक्षेप पथ-तुलना प्राथमिकता शिक्षण (trajectory-comparison preference learning) के साथ जोड़ता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को रात का खाना बनाना सिखा रहे हैं। अतीत में, रोबोट को सिखाने के लिए, आपको एक सख्त जज की तरह काम करना पड़ता था, जो उसके हर एक मूवमेंट को बारीकी से देखता और उसे एक सटीक स्कोर देता (जैसे कि प्याज काटने के तरीके के लिए "10 में से 7.5")। यदि रोबोट चाकू गिरा देता, तो आपको यह पता लगाना पड़ता कि स्कोर ठीक कब और कितना कम हुआ। यह करना अविश्वसनीय रूप से कठिन है, खासकर जब रोबोट विफल हो जाता है, और इसका मतलब है कि आप वास्तविक दुनिया में रोबोट द्वारा किए गए हजारों "विफल" प्रयासों का उपयोग नहीं कर सकते क्योंकि उन्हें ग्रेड देना बहुत जटिल होता है।
ROBOMETER एक नया सिस्टम है जो हमें रोबोट को सिखाने के तरीके को बदलकर एक अधिक स्मार्ट और मानवीय दृष्टिकोण प्रदान करता है।
मुख्य विचार: ग्रेडिंग के बजाय तुलना करना
हर एक क्षण के लिए एक परफेक्ट स्कोर देने की कोशिश करने के बजाय, ROBOMETER एक ही कार्य के दो अलग-अलग प्रयासों की तुलना करके सीखता है।
इसे एक टैलेंट शो जज की तरह समझें। किसी प्रतियोगी को 10 में से 8.2 का स्कोर देने के बजाय, जज बस दो प्रदर्शनों को देखता है और कहता है, "प्रदर्शन A, प्रदर्शन B से स्पष्ट रूप से बेहतर था।"
- पुराना तरीका: आपको एक कप को मेज पर रखने में विफल होते हुए रोबोट को देखना पड़ता है और यह गणना करने की कोशिश करनी पड़ती कि वह विफलता कितनी "खराब" थी।
- ROBOMETER का तरीका: आप रोबोट को एक इंसान द्वारा इसे पूरी तरह से करने का वीडियो दिखाते हैं और रोबोट द्वारा कप गिराने का एक वीडियो दिखाते हैं। सिस्टम सीखता है: "इंसान वाला वीडियो बेहतर है।" इसे यह जानने की आवश्यकता नहीं है कि क्यों या एक विशिष्ट संख्या देने की आवश्यकता नहीं है; यह बस "अच्छे" बनाम "बुरे" के क्रम को सीखता है।
गलतियों की "विशाल लाइब्रेरी" (RBM-1M)
इस सिस्टम को सिखाने के लिए, शोधकर्ताओं ने RBM-1M नामक एक विशाल लाइब्रेरी बनाई है।
- पुरानी समस्या: अधिकांश रोबोट ट्रेनिंग लाइब्रेरी में केवल "परफेक्ट" वीडियो होते हैं। यदि कोई रोबोट कप गिरा देता है, तो उस वीडियो को कचरे में फेंक दिया जाता है क्योंकि उसे ग्रेड देना कठिन होता है।
- नया समाधान: इस लाइब्रेरी में 21 अलग-अलग प्रकार के रोबोटों (सिंगल आर्म से लेकर मानव जैसे हाथों तक) के 10 लाख वीडियो हैं। महत्वपूर्ण बात यह है कि यह गलतियों, विफलताओं और अनाड़ी प्रयासों से भरी हुई है। क्योंकि ROBOMETER तुलना करके सीखता है (जैसे, "यह असफल प्रयास उस सफल प्रयास से बदतर है"), यह वास्तव में विफल वीडियो के ढेर से भी सीख सकता है। यह विफलताओं को एक मूल्यवान सबक के रूप में देखता है कि क्या नहीं करना है।
यह कैसे काम करता है (दो-चरणीय प्रक्रिया)
ROBOMETER दो विशिष्ट ट्रिक्स का एक साथ उपयोग करके सीखता है:
- "प्रोग्रेस" चेक: यह एक सिंगल वीडियो देखता है और अनुमान लगाने की कोशिश करता है, "यह कार्य कितना आगे बढ़ चुका है?" (0% से 100%)। यह रोबोट की समय और प्रगति की समझ को आधार देता है।
- "प्रेफरेंस" चेक: यह अगल-बगल दो वीडियो देखता है और निर्णय लेता है, "किसने काम को बेहतर ढंग से किया?" यह रोबोट को क्रिया की गुणवत्ता को समझने में मदद करता है, भले ही वह पूरी तरह से विफल क्यों न हो।
इन दोनों को मिलाकर, रोबोट सफलता की एक ऐसी "समझ" विकसित करता है जो तब भी काम करती है जब वह किसी ऐसे रोबोट को देख रहा हो जिसे उसने पहले कभी नहीं देखा, या किसी ऐसे कमरे में हो जहाँ वह पहले कभी नहीं गया।
यह वास्तव में क्या करता है (सिद्ध परिणाम)
पेपर दिखाता है कि यह सिस्टम चार विशिष्ट, वास्तविक दुनिया के परिदृश्यों में पिछले तरीकों से बेहतर काम करता है:
- स्वचालित ऑनलाइन लर्निंग: जब एक रोबोट वास्तविक समय में कोई कार्य सीख रहा होता है (जैसे मेज पर एक कटोरा रखना), तो ROBOMETER एक कोच की तरह काम करता है जो तुरंत रोबोट को बताता है, "तुम गलत कर रहे हो," और गलती सुधारने के लिए उसका मार्गदर्शन करता है। इसने एक अव्यवठित किचन में रोबोट की सफलता दर को 20% से बढ़ाकर 85% कर दिया, जबकि पुराने तरीके 55% पर अटक जाते थे।
- मेसी डेटा से सीखना (Offline RL): यदि आपके पास परफेक्ट वीडियो और मेसी, विफल वीडियो का मिश्रण है, तो ROBOMETER एक नए रोबोट को सिखाने के लिए उनमें से छांट सकता है। इसने पिछले सर्वोत्तम उपकरणों की तुलना में सफलता दर में 2.4 गुना सुधार किया।
- अच्छी चीज़ों को खोजना (Data Filtering): कल्पना कीजिए कि आपके पास वीडियो क्लिप्स का एक बड़ा ढेर है और आपको रोबोट को "बर्तन चलाने" के बारे में सिखाने के लिए 10 सबसे अच्छे क्लिप खोजने की जरूरत है। ROBOMETER अन्य सर्च टूल्स की तुलना में प्रासंगिक, सफल क्लिप्स को खोजने और विफलताओं को अनदेखा करने में बहुत बेहतर है। इससे रोबोट की कार्य सीखने की क्षमता में 4.5 गुना सुधार हुआ।
- विफलताओं को पहचानना: यदि कोई रोबोट अटक गया है, डगमगा रहा है (बिना हिले-डुले इधर-उधर हिल रहा है), या कोई वस्तु गिरा रहा है, तो ROBOMETER बिना यह बताए कि विफलता कैसी दिखती है, तुरंत इस विफलता का पता लगा सकता है। इसने 81% मामलों में विफलताओं को सही ढंग से पहचाना, जो अन्य सिस्टमों से बेहतर है।
निचोड़
ROBOMETER एक "यूनिवर्सल रिवॉर्ड मॉडल" है जो रोबोट को उनके काम के हर सेकंड को ग्रेड करने के लिए इंसान की आवश्यकता को समाप्त करता है। सफलताओं और विफलताओं दोनों की एक विशाल लाइब्रेरी का उपयोग करके "बेहतर" बनाम "बदतर" की तुलना करना सीखकर, यह रोबोट को तेजी से सीखने, गलतियों को बेहतर ढंग से संभालने और बिना दोबारा प्रशिक्षित किए नए कार्यों और नए रोबोट बॉडीज के अनुकूल होने में मदद करता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।