RynnValue: Scaling Robotic Value Foundation Models with Temporal Distance
RynnValue एक ओपन-सोर्स रोबोटिक वैल्यू फाउंडेशन मॉडल है जो टेम्पोरल डिस्टेंस (temporal distance) को सुपरविजन टारगेट के रूप में उपयोग करके लाखों इंस्ट्रक्शन-कंडीशन्ड क्लिप्स तक स्केल करता है, जो मूल्यांकन में प्रेफरेंस-आधारित तरीकों से बेहतर प्रदर्शन करता है और बिना किसी स्पष्ट रिवॉर्ड या प्रोग्रेस एनोटेशन के वास्तविक दुनिया की पॉलिसी सफलता को महत्वपूर्ण रूप से बढ़ाता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को खाना बनाना सिखाने की कोशिश कर रहे हैं, लेकिन उसे कोई रेसिपी देने के बजाय, आप बस कहते हैं, "इसे अच्छा बनाओ!" और उम्मीद करते हैं कि वह बाकी सब खुद समझ जाएगा। यह रोबोट लर्निंग (robot learning) की दुनिया है, जो विज्ञान की एक ऐसी शाखा है जहाँ इंजीनियर मशीनों को भौतिक दुनिया में हिलने-डुलने और बातचीत करने के लिए प्रशिक्षित करने का प्रयास करते हैं। सबसे बड़ी बाधा आमतौर पर रोबोट का दिमाग (उसकी हिलने की क्षमता) नहीं होती, बल्कि उसका रिवॉर्ड (reward/पुरस्कार) होता है। AI की दुनिया में, "रिवॉर्ड" एक स्कोरकार्ड या 'हाई-फाइव' की तरह है जो रोबोट को बताता है, "अच्छा काम किया!" या "फिर से कोशिश करो!" समस्या यह है कि हर एक चाल के लिए रोबोट को एक सटीक स्कोरकार्ड देना अविश्वसनीय रूप से कठिन है। यदि स्कोरकार्ड बहुत अस्पष्ट है, तो रोबोट भ्रमित हो जाएगा। यदि यह एक विशिष्ट कार्य के लिए बहुत विस्तृत है, तो रोबोट कुछ नया नहीं सीख पाएगा। वैज्ञानिक एक ऐसा "सामान्य-उद्देश्य वाला" (general-purpose) स्कोरकार्ड बनाने की कोशिश कर रहे हैं जो किसी भी रोबोट के किसी भी कार्य के लिए काम कर सके, लेकिन वे इस बात पर अटक गए हैं कि बिना किसी इंसान द्वारा हर प्रयास को मैन्युअल रूप से ग्रेड किए इसे कैसे बनाया जाए।
यहीं पर एक नया विचार आता है जिसे RynnValue कहा जाता है। इसे रोबोट के प्रदर्शन को ग्रेड करने के एक नए तरीके के रूप में सोचें। यह पूछने के बजाय कि, "आप फिनिश लाइन के कितने करीब हैं?" (जिसे मापना कठिन है यदि फिनिश लाइन हर कार्य के लिए अलग दिखती है), RynnValue पूछता है, "काम खत्म होने तक कितना समय बचा है?" यह रोबोट की यात्रा को एक काउंटडाउन टाइमर की तरह मानता है। यदि रोबोट लक्ष्य से दूर है, तो टाइमर अधिक होगा। यदि वह करीब है, तो टाइमर कम होगा। इस पेपर का जादू यह है कि आपको यह टाइमर बनाने के लिए किसी इंसान द्वारा बटन दबाकर "अच्छा काम किया" कहने की आवश्यकता नहीं है। आप बस घड़ी देख सकते हैं। यदि रोबिंग कुकिंग का एक वीडियो 10 मिनट से शुरू होता है और 0 पर समाप्त होता है, तो कंप्यूटर स्वचालित रूप से समझ सकता है कि 5 मिनट के निशान पर, रोबोट के पास 5 मिनट बचे थे। यह सरल ट्रिक रोबोट को हजारों घंटों के वीडियो से सीखने की अनुमति देती है बिना किसी के द्वारा उन्हें मैन्युअल रूप से ग्रेड किए।
समस्या: "प्रोग्रेस" का जाल (The "Progress" Trap)
लंबे समय तक, वैज्ञानिकों ने "प्रोग्रेस" (प्रगति) को मापकर रोबोट को सिखाने की कोशिश की। कल्पना कीजिए कि एक रोबोट ब्लॉक स्टैक करने की कोशिश कर रहा है। एक प्रोग्रेस मॉडल यह अनुमान लगाने की कोशिश करेगा कि रोबोट 10% पूरा हुआ, 50% पूरा हुआ, या 90% पूरा हुआ। लेकिन यहाँ एक पेंच है: ब्लॉक स्टैक करने के लिए "50% पूरा होना" पानी भरने की तुलना में बिल्कुल अलग दिखता है। एक रोबोट ऊंचाई के मामले में आधा पूरा हो सकता है, जबकि दूसरा समय के मामले में आधा पूरा हो सकता है। यह एक ऐसे रोबोट को प्रशिक्षित करना वास्तव में कठिन बनाता है जो कई अलग-अलग चीजें कर सके, क्योंकि "प्रगति" की परिभाषा हर बार कार्य बदलने के साथ बदल जाती है। यह एक छात्र को गणित सिखाने जैसा है कि "तुम आधे रास्ते पर हो!" बिना कभी यह बताए कि अंतिम उत्तर क्या होना चाहिए।
इस पेपर के लेखक तर्क देते हैं कि यह "प्रोग्रेस" वाला दृष्टिकोण एक बंद रास्ता है। वे कहते हैं कि हमें यह अनुमान लगाना छोड़ देना चाहिए कि रोबोट कितना आगे है और काम खत्म होने तक समय गिनना शुरू करना चाहिए। वे इसे टेम्पोरल डिस्टेंस (temporal distance/समय की दूरी) कहते हैं। यह "कॉस्ट-टू-गो" (cost-to-go) है, या सरल शब्दों में, "मेरे पास कितना समय बचा है?"
समाधान: RynnValue और जादुई घड़ी
Alibaba की DAMO Academy और Hupan Lab की टीम ने RynnValue नामक एक मॉडल बनाया। प्रोग्रेस प्रतिशत का अनुमान लगाने के बजाय, RynnValue एक रोबोट का वीडियो और एक टेक्स्ट निर्देश (जैसे "कप को मेज पर रखें") देखता है और भविष्यवाणी करता है कि कार्य समाप्त होने में ठीक कितने सेकंड बचे हैं।
यहाँ चतुराई भरा हिस्सा यह है: उन्हें हर वीडियो के लिए "5 सेकंड बचे हैं" लिखने के लिए इंसानों की जरूरत नहीं पड़ी। उन्होंने बस वीडियो फाइलों पर पहले से मौजूद टाइमस्टैम्प्स (timestamps) का उपयोग किया। यदि एक वीडियो 0:00 पर शुरू होता है और रोबोट 0:10 पर समाप्त होता है, तो कंप्यूटर जानता है कि 0:05 पर, रोबोट के पास 5 सेकंड बचे थे। इसका मतलब है कि वे मॉडल को 7,000 घंटों से अधिक के रोबोट वीडियो के विशाल पुस्तकालय पर प्रशिक्षित कर सके—लगभग 3 मिलियन क्लिप्स—बिना किसी इंसान द्वारा उन्हें मैन्युअल रूप से ग्रेड किए। यह एक छात्र को पढ़ने के लिए हजारों फिल्में सबटाइटल के साथ देखने देने जैसा है, बजाय इसके कि एक शिक्षक उनके द्वारा पढ़े गए हर वाक्य को ग्रेड करे।
चालाकियाँ (और उन्होंने उन्हें कैसे रोका)
आप सोच सकते हैं, "यदि रोबोट केवल घड़ी देखना सीख जाता है, तो क्या वह एक शॉर्टकट का फायदा नहीं उठा रहा है?" वैज्ञानिक भी इस बात को लेकर चिंतित थे। वे जानते थे कि यदि वे केवल क्रम में वीडियो दिखाते हैं, तो रोबोट एक शॉर्टकट सीख सकता है: "ओह, वीडियो का तीसरा फ्रेम हमेशा आधा पूरा होता है!" या "यदि वीडियो 10 सेकंड लंबा है, तो बीच का हिस्सा हमेशा 5 सेकंड का होता है।" रोबोट वास्तविक रोबोटिक भुजाओं को देखना बंद कर देगा और केवल वीडियो की स्थिति के आधार पर अनुमान लगाएगा।
इसे रोकने के लिए, उन्होंने प्रशिक्षण में कुछ "अराजकता" (chaos) जोड़ी:
- रैंडम सैंपलिंग (Random Sampling): उन्होंने रोबलेट को वीडियो सीधे क्रम में नहीं दिखाया। उन्होंने वीडियो से यादृच्छिक क्षण चुने, ताकि रोबोट क्रम के आधार पर समय का अनुमान न लगा सके।
- शफलिंग (Shuffling): उन्होंने कभी-कभी वीडियो को उल्टा या जंबल्ड ऑर्डर में दिखाया। यदि रोबोट ने "शुरू" की स्थिति से पहले "समाप्त" की स्थिति देखी, तो उसे यह समझना पड़ा कि "समाप्त" वाली स्थिति वास्तव में समय में अधिक दूर थी, जिससे उसे वास्तव में चित्रों के क्रम के बजाय रोबोट की तस्वीर को देखने के लिए मजबूर होना पड़ा।
- आइसोलेशन (Isolation): उन्होंने यह सुनिश्चित किया कि रोबोट वर्तमान फ्रेम का अनुमान लगाते समय अगले फ्रेम के उत्तरों को न देख सके। उसे प्रत्येक क्षण को अपने दम पर हल करना था।
परिणाम: क्या यह काम करता है?
टीम ने RynnValue का परीक्षण कई अलग-अलग रोबोटों और कार्यों पर किया जिन्हें उसने पहले कभी नहीं देखा था। परिणाम आश्चर्यजनक रूप से अच्छे रहे।
- रैंकिंग कार्य (Ranking Tasks): विभिन्न रोबोट प्रयासों को "सबसे अच्छे" से "सबसे खराब" के क्रम में रैंक करने के लिए पूछे जाने पर, RynnValue का स्कोर 0.675 था। यह पिछले सर्वश्रेष्ठ मॉडलों से बेहतर था जो वीडियो को मैन्युअल रूप से ग्रेड करने के लिए इंसानों पर निर्भर थे (जिनका स्कोर 0.655 था)।
- वास्तविक दुनिया के रोबोट: वे इस मॉडल को वास्तविक रोबोटों को कठिन कार्य सिखाने के लिए ले गए, जैसे टोकरी में ब्रेड रखना या स्पैटुला से स्टेक को हिलाना।
- RynnValue के साथ, ऑनलाइन सीखते समय (चलते हुए) रोबोट 72.5% बार सफल रहे।
- इसके बिना, पुराने सर्वश्रेष्ठ तरीकों का उपयोग करते हुए, वे केवल 52.5% बार सफल हुए।
- ऑफलाइन लर्निंग (पिछले मूव्स के डेटाबेस से सीखना) में, RynnValue ने सफलता को 63.8% से बढ़ाकर 82.5% कर दिया।
यह क्यों महत्वपूर्ण है
इस पेपर की सबसे रोमांचक बात यह है कि यह सुझाव देता है कि रोबोटों को सिखाने के लिए हमें उन्हें ग्रेड करने में परफेक्ट होने की आवश्यकता नहीं है। हमें बस यह जानने की आवश्यकता है कि वे कब समाप्त हुए। "समय" के सरल, स्वचालित "घड़ी" का उपयोग करके, RynnValue रोबोट रिवार्ड्स के लिए एक सार्वभौमिक भाषा बनाता है। यह दो हाथों वाले रोबोट, पहिये वाले रोबोट, या हाथ वाले रोबोट के लिए काम करता है, जब तक कि हम यह बता सकें कि काम कब खत्म हुआ।
लेखक सावधानी से नोट करते हैं कि यह कोई जादुई छड़ी नहीं है जो हर रोबोट समस्या को तुरंत हल कर देगी। उन्होंने पाया कि सटीक संरेखण (alignment) की आवश्यकता वाले बहुत कठिन कार्यों के लिए (जैसे दराज में बॉक्स रखना), मॉडल अभी भी थोड़ा संघर्ष करता है क्योंकि दृश्य संकेत (visual clues) भ्रमित करने वाले होते हैं। लेकिन कुल मिलाकर, उन्होंने दिखाया कि टेम्पोरल डिस्टेंस (temporal distance) रोबोटों को सिखाने का एक शक्तिशाली, स्केलेबल तरीका है। यह रोबोट लर्निंग की अव्यवस्थित, कठिन समस्या को "एक अच्छा मूव क्या है?" की सरल, समाधान योग्य समस्या में बदल देता है।
संक्षेप में, RynnValue एक रिपोर्ट कार्ड के बजाय रोबोट को स्टॉपवॉच देने जैसा है। यह रोबोट लर्निंग की अराजक दुनिया को एक सरल काउंटडाउन में बदल देता है, और ऐसा लगता है कि यह पुराने तरीकों की तुलना में बेहतर काम कर रहा है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।