← नवीनतम पेपर
🤖 machine learning

RynnValue: Scaling Robotic Value Foundation Models with Temporal Distance

RynnValue एक ओपन-सोर्स रोबोटिक वैल्यू फाउंडेशन मॉडल है जो टेम्पोरल डिस्टेंस (temporal distance) को सुपरविजन टारगेट के रूप में उपयोग करके लाखों इंस्ट्रक्शन-कंडीशन्ड क्लिप्स तक स्केल करता है, जो मूल्यांकन में प्रेफरेंस-आधारित तरीकों से बेहतर प्रदर्शन करता है और बिना किसी स्पष्ट रिवॉर्ड या प्रोग्रेस एनोटेशन के वास्तविक दुनिया की पॉलिसी सफलता को महत्वपूर्ण रूप से बढ़ाता है।

मूल लेखक: Dongchi Huang, Hongyin Zhang, Bohan Hou, Siteng Huang, Zhian Su, Hang Guo, Tong Lu, Zhaofeng Xu, Jiahao Tang, Jianfei Yang, Donglin Wang, Peixi Peng, Mingxiu Chen, Deli Zhao, Xin Li

प्रकाशित 2026-08-11
📖 8 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Dongchi Huang, Hongyin Zhang, Bohan Hou, Siteng Huang, Zhian Su, Hang Guo, Tong Lu, Zhaofeng Xu, Jiahao Tang, Jianfei Yang, Donglin Wang, Peixi Peng, Mingxiu Chen, Deli Zhao, Xin Li

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को खाना बनाना सिखाने की कोशिश कर रहे हैं, लेकिन उसे कोई रेसिपी देने के बजाय, आप बस कहते हैं, "इसे अच्छा बनाओ!" और उम्मीद करते हैं कि वह बाकी सब खुद समझ जाएगा। यह रोबोट लर्निंग (robot learning) की दुनिया है, जो विज्ञान की एक ऐसी शाखा है जहाँ इंजीनियर मशीनों को भौतिक दुनिया में हिलने-डुलने और बातचीत करने के लिए प्रशिक्षित करने का प्रयास करते हैं। सबसे बड़ी बाधा आमतौर पर रोबोट का दिमाग (उसकी हिलने की क्षमता) नहीं होती, बल्कि उसका रिवॉर्ड (reward/पुरस्कार) होता है। AI की दुनिया में, "रिवॉर्ड" एक स्कोरकार्ड या 'हाई-फाइव' की तरह है जो रोबोट को बताता है, "अच्छा काम किया!" या "फिर से कोशिश करो!" समस्या यह है कि हर एक चाल के लिए रोबोट को एक सटीक स्कोरकार्ड देना अविश्वसनीय रूप से कठिन है। यदि स्कोरकार्ड बहुत अस्पष्ट है, तो रोबोट भ्रमित हो जाएगा। यदि यह एक विशिष्ट कार्य के लिए बहुत विस्तृत है, तो रोबोट कुछ नया नहीं सीख पाएगा। वैज्ञानिक एक ऐसा "सामान्य-उद्देश्य वाला" (general-purpose) स्कोरकार्ड बनाने की कोशिश कर रहे हैं जो किसी भी रोबोट के किसी भी कार्य के लिए काम कर सके, लेकिन वे इस बात पर अटक गए हैं कि बिना किसी इंसान द्वारा हर प्रयास को मैन्युअल रूप से ग्रेड किए इसे कैसे बनाया जाए।

यहीं पर एक नया विचार आता है जिसे RynnValue कहा जाता है। इसे रोबोट के प्रदर्शन को ग्रेड करने के एक नए तरीके के रूप में सोचें। यह पूछने के बजाय कि, "आप फिनिश लाइन के कितने करीब हैं?" (जिसे मापना कठिन है यदि फिनिश लाइन हर कार्य के लिए अलग दिखती है), RynnValue पूछता है, "काम खत्म होने तक कितना समय बचा है?" यह रोबोट की यात्रा को एक काउंटडाउन टाइमर की तरह मानता है। यदि रोबोट लक्ष्य से दूर है, तो टाइमर अधिक होगा। यदि वह करीब है, तो टाइमर कम होगा। इस पेपर का जादू यह है कि आपको यह टाइमर बनाने के लिए किसी इंसान द्वारा बटन दबाकर "अच्छा काम किया" कहने की आवश्यकता नहीं है। आप बस घड़ी देख सकते हैं। यदि रोबिंग कुकिंग का एक वीडियो 10 मिनट से शुरू होता है और 0 पर समाप्त होता है, तो कंप्यूटर स्वचालित रूप से समझ सकता है कि 5 मिनट के निशान पर, रोबोट के पास 5 मिनट बचे थे। यह सरल ट्रिक रोबोट को हजारों घंटों के वीडियो से सीखने की अनुमति देती है बिना किसी के द्वारा उन्हें मैन्युअल रूप से ग्रेड किए।

समस्या: "प्रोग्रेस" का जाल (The "Progress" Trap)

लंबे समय तक, वैज्ञानिकों ने "प्रोग्रेस" (प्रगति) को मापकर रोबोट को सिखाने की कोशिश की। कल्पना कीजिए कि एक रोबोट ब्लॉक स्टैक करने की कोशिश कर रहा है। एक प्रोग्रेस मॉडल यह अनुमान लगाने की कोशिश करेगा कि रोबोट 10% पूरा हुआ, 50% पूरा हुआ, या 90% पूरा हुआ। लेकिन यहाँ एक पेंच है: ब्लॉक स्टैक करने के लिए "50% पूरा होना" पानी भरने की तुलना में बिल्कुल अलग दिखता है। एक रोबोट ऊंचाई के मामले में आधा पूरा हो सकता है, जबकि दूसरा समय के मामले में आधा पूरा हो सकता है। यह एक ऐसे रोबोट को प्रशिक्षित करना वास्तव में कठिन बनाता है जो कई अलग-अलग चीजें कर सके, क्योंकि "प्रगति" की परिभाषा हर बार कार्य बदलने के साथ बदल जाती है। यह एक छात्र को गणित सिखाने जैसा है कि "तुम आधे रास्ते पर हो!" बिना कभी यह बताए कि अंतिम उत्तर क्या होना चाहिए।

इस पेपर के लेखक तर्क देते हैं कि यह "प्रोग्रेस" वाला दृष्टिकोण एक बंद रास्ता है। वे कहते हैं कि हमें यह अनुमान लगाना छोड़ देना चाहिए कि रोबोट कितना आगे है और काम खत्म होने तक समय गिनना शुरू करना चाहिए। वे इसे टेम्पोरल डिस्टेंस (temporal distance/समय की दूरी) कहते हैं। यह "कॉस्ट-टू-गो" (cost-to-go) है, या सरल शब्दों में, "मेरे पास कितना समय बचा है?"

समाधान: RynnValue और जादुई घड़ी

Alibaba की DAMO Academy और Hupan Lab की टीम ने RynnValue नामक एक मॉडल बनाया। प्रोग्रेस प्रतिशत का अनुमान लगाने के बजाय, RynnValue एक रोबोट का वीडियो और एक टेक्स्ट निर्देश (जैसे "कप को मेज पर रखें") देखता है और भविष्यवाणी करता है कि कार्य समाप्त होने में ठीक कितने सेकंड बचे हैं।

यहाँ चतुराई भरा हिस्सा यह है: उन्हें हर वीडियो के लिए "5 सेकंड बचे हैं" लिखने के लिए इंसानों की जरूरत नहीं पड़ी। उन्होंने बस वीडियो फाइलों पर पहले से मौजूद टाइमस्टैम्प्स (timestamps) का उपयोग किया। यदि एक वीडियो 0:00 पर शुरू होता है और रोबोट 0:10 पर समाप्त होता है, तो कंप्यूटर जानता है कि 0:05 पर, रोबोट के पास 5 सेकंड बचे थे। इसका मतलब है कि वे मॉडल को 7,000 घंटों से अधिक के रोबोट वीडियो के विशाल पुस्तकालय पर प्रशिक्षित कर सके—लगभग 3 मिलियन क्लिप्स—बिना किसी इंसान द्वारा उन्हें मैन्युअल रूप से ग्रेड किए। यह एक छात्र को पढ़ने के लिए हजारों फिल्में सबटाइटल के साथ देखने देने जैसा है, बजाय इसके कि एक शिक्षक उनके द्वारा पढ़े गए हर वाक्य को ग्रेड करे।

चालाकियाँ (और उन्होंने उन्हें कैसे रोका)

आप सोच सकते हैं, "यदि रोबोट केवल घड़ी देखना सीख जाता है, तो क्या वह एक शॉर्टकट का फायदा नहीं उठा रहा है?" वैज्ञानिक भी इस बात को लेकर चिंतित थे। वे जानते थे कि यदि वे केवल क्रम में वीडियो दिखाते हैं, तो रोबोट एक शॉर्टकट सीख सकता है: "ओह, वीडियो का तीसरा फ्रेम हमेशा आधा पूरा होता है!" या "यदि वीडियो 10 सेकंड लंबा है, तो बीच का हिस्सा हमेशा 5 सेकंड का होता है।" रोबोट वास्तविक रोबोटिक भुजाओं को देखना बंद कर देगा और केवल वीडियो की स्थिति के आधार पर अनुमान लगाएगा।

इसे रोकने के लिए, उन्होंने प्रशिक्षण में कुछ "अराजकता" (chaos) जोड़ी:

  1. रैंडम सैंपलिंग (Random Sampling): उन्होंने रोबलेट को वीडियो सीधे क्रम में नहीं दिखाया। उन्होंने वीडियो से यादृच्छिक क्षण चुने, ताकि रोबोट क्रम के आधार पर समय का अनुमान न लगा सके।
  2. शफलिंग (Shuffling): उन्होंने कभी-कभी वीडियो को उल्टा या जंबल्ड ऑर्डर में दिखाया। यदि रोबोट ने "शुरू" की स्थिति से पहले "समाप्त" की स्थिति देखी, तो उसे यह समझना पड़ा कि "समाप्त" वाली स्थिति वास्तव में समय में अधिक दूर थी, जिससे उसे वास्तव में चित्रों के क्रम के बजाय रोबोट की तस्वीर को देखने के लिए मजबूर होना पड़ा।
  3. आइसोलेशन (Isolation): उन्होंने यह सुनिश्चित किया कि रोबोट वर्तमान फ्रेम का अनुमान लगाते समय अगले फ्रेम के उत्तरों को न देख सके। उसे प्रत्येक क्षण को अपने दम पर हल करना था।

परिणाम: क्या यह काम करता है?

टीम ने RynnValue का परीक्षण कई अलग-अलग रोबोटों और कार्यों पर किया जिन्हें उसने पहले कभी नहीं देखा था। परिणाम आश्चर्यजनक रूप से अच्छे रहे।

  • रैंकिंग कार्य (Ranking Tasks): विभिन्न रोबोट प्रयासों को "सबसे अच्छे" से "सबसे खराब" के क्रम में रैंक करने के लिए पूछे जाने पर, RynnValue का स्कोर 0.675 था। यह पिछले सर्वश्रेष्ठ मॉडलों से बेहतर था जो वीडियो को मैन्युअल रूप से ग्रेड करने के लिए इंसानों पर निर्भर थे (जिनका स्कोर 0.655 था)।
  • वास्तविक दुनिया के रोबोट: वे इस मॉडल को वास्तविक रोबोटों को कठिन कार्य सिखाने के लिए ले गए, जैसे टोकरी में ब्रेड रखना या स्पैटुला से स्टेक को हिलाना।
    • RynnValue के साथ, ऑनलाइन सीखते समय (चलते हुए) रोबोट 72.5% बार सफल रहे।
    • इसके बिना, पुराने सर्वश्रेष्ठ तरीकों का उपयोग करते हुए, वे केवल 52.5% बार सफल हुए।
    • ऑफलाइन लर्निंग (पिछले मूव्स के डेटाबेस से सीखना) में, RynnValue ने सफलता को 63.8% से बढ़ाकर 82.5% कर दिया।

यह क्यों महत्वपूर्ण है

इस पेपर की सबसे रोमांचक बात यह है कि यह सुझाव देता है कि रोबोटों को सिखाने के लिए हमें उन्हें ग्रेड करने में परफेक्ट होने की आवश्यकता नहीं है। हमें बस यह जानने की आवश्यकता है कि वे कब समाप्त हुए। "समय" के सरल, स्वचालित "घड़ी" का उपयोग करके, RynnValue रोबोट रिवार्ड्स के लिए एक सार्वभौमिक भाषा बनाता है। यह दो हाथों वाले रोबोट, पहिये वाले रोबोट, या हाथ वाले रोबोट के लिए काम करता है, जब तक कि हम यह बता सकें कि काम कब खत्म हुआ।

लेखक सावधानी से नोट करते हैं कि यह कोई जादुई छड़ी नहीं है जो हर रोबोट समस्या को तुरंत हल कर देगी। उन्होंने पाया कि सटीक संरेखण (alignment) की आवश्यकता वाले बहुत कठिन कार्यों के लिए (जैसे दराज में बॉक्स रखना), मॉडल अभी भी थोड़ा संघर्ष करता है क्योंकि दृश्य संकेत (visual clues) भ्रमित करने वाले होते हैं। लेकिन कुल मिलाकर, उन्होंने दिखाया कि टेम्पोरल डिस्टेंस (temporal distance) रोबोटों को सिखाने का एक शक्तिशाली, स्केलेबल तरीका है। यह रोबोट लर्निंग की अव्यवस्थित, कठिन समस्या को "एक अच्छा मूव क्या है?" की सरल, समाधान योग्य समस्या में बदल देता है।

संक्षेप में, RynnValue एक रिपोर्ट कार्ड के बजाय रोबोट को स्टॉपवॉच देने जैसा है। यह रोबोट लर्निंग की अराजक दुनिया को एक सरल काउंटडाउन में बदल देता है, और ऐसा लगता है कि यह पुराने तरीकों की तुलना में बेहतर काम कर रहा है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →